Зачем вообще разбирать на части хорошо сведённую песню? Ответ простой — ради обучения и практики. Музыканту, разучивающему, например, басовую партию Джона Макви из Dreams группы Fleetwood Mac, удобнее сначала услышать этот бас в чистом виде, а затем получить обратное — всё, кроме баса, чтобы сыграть партию самому вместе с остальной группой.

Чистая дорожка, под которую удобно подыгрывать.Чистая дорожка, под которую удобно подыгрывать.

Ещё недавно ни то, ни другое не давалось легко. Почти всю историю звукозаписи финальный микс оставался по-настоящему финальным: как только бас, барабаны, гитары и вокал сводились в стерео, вытащить исходные ингредиенты обратно было примерно так же реально, как восстановить RAW-файл из JPEG.

Сегодня это уже не так. AudioPrism — приложение для Windows за $79,99 (сейчас продаётся за $59,99), которое обещает разложить готовую запись прямо на вашем ПК обратно на отдельные дорожки: вокал, бас, барабаны и прочие инструменты. Оно также умеет переводить эти партии в MIDI и обучать игре через встроенный тренажёр KeyPrism.

реклама кормит Уточку 🦆

На бумаге это почти идеальный инструмент для занятий. Но после тестирования выяснилось неожиданное: AudioPrism прекрасно справляется с тем, что должно быть почти невозможным, и на удивление плохо — с тем, что должно даваться легко.

От «невозможного» к «готово» за 40 секунд

Желание разобрать запись на составляющие возникло не вчера. Ещё в 2013 году существовала программа Riffstation для гитаристов, которая умела выделять отдельные партии и, что важно, позволяла солировать или заглушать нужный инструмент. Технологии разделения тогда были куда примитивнее, но сам сценарий использования уже был очевиден.

Разделение на источники (stem separation) развивается десятилетиями, но настоящий прорыв совершило машинное обучение. Проекты Spleeter от Deezer и Demucs от компании Meta* сделали нейросетевое разделение на стемы по-настоящему массовым, а команда Питера Джексона (режиссёра «Властелина колец») дала эффектную демонстрацию широкой публике: технология MAL, созданная для фильма «The Beatles: Get Back», затем помогла разложить инструменты на четырёхдорожечных мастерах для ремикса альбома Revolver 2022 года и наконец отделить голос Джона Леннона от фортепиано в старой демозаписи «Now And Then».

Перевод аудио в MIDI развивался своим путём: тот же Ableton конвертировал мелодии, гармонии и барабаны в MIDI ещё в Live 9 больше десяти лет назад. AudioPrism объединяет оба направления: разобрать запись, расшифровать её партии, а затем научить вас их играть.

реклама кормит Уточку 🦆

Отдельный плюс в том, что все тяжёлые вычисления идут на вашей собственной видеокарте. Не нужно никуда загружать музыку, стоять в очереди на обработку и платить за облачные мощности по счётчику. Это хорошо не только для приватности — это ещё и мгновенно.

Потрясающая технология, озадачивающий продукт

Программе устроили два совершенно разных испытания; управление оказалось элементарным — достаточно перетащить аудиофайл в окно. Композиция Dreams группы Fleetwood Mac стала лёгкой разминкой: исключительно чистая студийная запись с большим «воздухом» вокруг баса. AudioPrism разделил всю песню на четыре дорожки на видеокарте RTX 5070 Ti быстрее, чем можно вслух произнести «быстрое преобразование Фурье».

Четыре на удивление чистых и полезных дорожки — впечатляющий результат.Четыре на удивление чистых и полезных дорожки — впечатляющий результат.

Бас выделился великолепно: когда все четыре стема свели обратно в редакторе Audacity и сравнили результат с оригиналом, разницы на слух не было. Для «зверского» теста взяли совсем другой материал — концертную Red Rain Питера Гэбриела с альбома Secret World Live: плотную живую запись, полную реверберации и наложенных друг на друга инструментов. Здесь у выделенного баса появилось заметно больше артефактов и неприятная резонирующая, шипящая окраска, но он всё равно оставался пригодным — пары минут чистки хватило бы, чтобы довести его до идеала.

И вот тут AudioPrism начинает раздражать. Выдав такие отличные дорожки, программа не предлагает микшера. Для басиста логика работы очевидна: включить соло баса, пока разучиваешь партию, а затем заглушить его и играть вместе с остальной группой. Вместо этого дорожки приходится экспортировать в Audacity и глушить бас вручную — то есть ради тривиальной операции нужно выходить из приложения, которое только что совершило почти чудо.

реклама кормит Уточку 🦆

Как назло, у конкурентов это уже есть. StemKit — ещё один локальный разделитель стемов с ускорением на GPU — встраивает микшер прямо в интерфейс: отдельные регуляторы громкости для каждого стема с кнопками mute и solo, без всякого Audacity, да ещё и бесплатно, с открытым исходным кодом. Похожий подход и у JBL BandBox Trio за $599: ИИ-разделение там сделано именно для того, чтобы музыкант мог заглушить или выделить инструмент и играть под остальную дорожку.

С MIDI всё заметно хуже. Даже на собственном идеально чистом басовом стеме из Dreams AudioPrism выдавал непредсказуемую многоголосицу, мало пригодную как нотная расшифровка, а воспроизведение «падающих нот» в KeyPrism то и дело подвисало и сбоило.

Для сравнения: у прежних инструментов качество едва приемлемо даже на статичном фрагменте.Для сравнения: у прежних инструментов качество едва приемлемо даже на статичном фрагменте.

Отдельная история — интерфейс. Он выглядит так, будто его рисовал галлюцинирующий ребёнок, только что открывший для себя визуализации Winamp: светящиеся частицы, шлейфы за курсором, пульсирующая графика и бесконечно движущийся «гиперпространственный» фон наперебой борются за внимание, и отключить всё это, похоже, нельзя. Для учёбы и концентрации обстановка так себе.

Конкуренция у AudioPrism серьёзная. Кроме упомянутого StemKit, есть бесплатный Ultimate Vocal Remover с открытым кодом, поддерживающий в том числе Demucs и MDX-Net. Сервис Moises смотрит на задачу глазами музыканта: разделённые дорожки сразу попадают в микшер, где их можно заглушить, солировать или подстроить, — но он работает через облако, а платные тарифы расширяют возможности. Локальную обработку предлагает и LALAL.AI с моделью Lyra через настольное приложение и VST-плагин, однако для работы «на устройстве» нужна подписка Pro за $19,99 в месяц, а не разовая покупка.

Пожалуй, в этом и вся суть. Мы дошли до момента, когда вытащить убедительную басовую партию из полувековой стереозаписи за 40 секунд на домашнем ПК — уже не проблема. Проблема в том, что построено вокруг этой возможности. Ядро разделения у AudioPrism способно творить чудеса, но продукт раз за разом будто спроектирован вокруг того, что умеет технология, а не того, что реально нужно музыканту. Дайте ему разовую цену, отличное локальное разделение, простой микшер с кнопками mute и solo, надёжную расшифровку в ноты и интерфейс, не похожий на игровой автомат из 80-х, — и до идеального инструмента для занятий осталось бы совсем немного.

* Принадлежит компании Meta, деятельность которой признана экстремистской и запрещена на территории Российской Федерации. Социальные сети Facebook и Instagram запрещены в РФ.