Главная/ Статьи/ «Использование нейросетевых технологий в работе звукорежиссера с музыкальной фонограммой», часть 2
«Использование нейросетевых технологий в работе звукорежиссера с музыкальной фонограммой», часть 2

«Использование нейросетевых технологий в работе звукорежиссера с музыкальной фонограммой», часть 2

Автор: Алексей Быстрых

Рассмотрим основные методики работы с инструментами на основе нейронных сетей на текущий момент. Они сгруппированы по типам применения нейросетевых моделей.  Рассмотрим взаимодействие звукорежиссера с такими нейросетевыми моделями при работе над музыкальной фонограммой.

Методика работы с музыкальной фонограммой с использованием нейросетевых инструментов

Рассмотрим основные методики работы с инструментами на основе нейронных сетей на текущий момент. Они сгруппированы по типам применения нейросетевых моделей.  Рассмотрим взаимодействие звукорежиссера с такими нейросетевыми моделями при работе над музыкальной фонограммой.

Методика работы с генеративными нейронными сетями

Развитие генеративного искусственного интеллекта привело к формированию новой парадигмы музыкального производства, в которой процессу композиторского поиска могут помочь алгоритмы, а звукорежиссер, освоивший дисциплины, традиционно выходившие за пределы его компетенций, может найти новые способы формирования музыкального образа. Генеративные нейросетевые модели уже успешно интегрированы в практику аудиопроизводства — от прототипирования тембровых решений для рекламных роликов до полноценной композиции в игровых аудио и стриминговых сериалах. Такие модели демонстрируют сопоставимое с человеческой работой качество при решении задач музыкальной стилизации, саунд-дизайна и подготовки стемов, что подтверждают публикации AES (2024) и отчеты Международной Ассоциации производителей фонограмм IFPI о росте доли ИИ‑контента в каталожных релизах крупных лейблов.

Рассмотрим основные этапы работы с генеративными нейросетями и критерии их оценки в рамках художественно‑производственного цикла. Однако необходимо подчеркнуть, что все описанные методики быстро меняются, но уже демонстрируют устойчивые и предсказуемо высокие результаты в практике профессионального производства.

Генеративные сети трансформируют производственный процесс: время от первого замысла до презентации прототипа сокращается в разы. Звукорежиссер, знакомый с методикой экспресс‑итераций, способен оперативно предлагать музыкальные решения, существенно сокращая сроки производства. Наконец, компетентность в области искусственного интеллекта служит гарантией правовой устойчивости проекта. Понимание лицензионных особенностей датасетов, на которых обучена модель, и умение документировать seed и промпт‑метаданные минимизируют риски предъявления авторско‑правовых претензий дистрибьюторами и стриминговыми площадками. Таким образом, грамотное освоение генеративных нейросетей перерастает из технологического хобби в элемент профиля звукорежиссера, обеспечивая ему конкурентоспособность и творческую автономию в условиях быстро меняющегося рынка.

Составление запроса (промпта)

Промпт в генеративной экосистеме исполняет функцию партитуры: чем точнее пользователь описывает контекст, тем выше вероятность получить релевантный результат. Исследования показывают, что длина и лексическая насыщенность текстового запроса коррелируют со степенью «семантической когерентности» сгенерированного материала. Следовательно, звукорежиссер обязан оперировать лексикой, характерной для профессионального музыкального анализа (например: «лаконичная минорная остинатная фигура в низком регистре, метр ‑ 5/4, темп ‑ 96 BPM»). Важную роль играет модульность запроса. Разбиение композиции на сегменты — intro, build‑up, climax, release — позволяет осуществлять поэтапный контроль драматургической динамики и избежать «дрейфа стиля», типичного для некоторых архитектур-трансформеров.

Параметризация модели и юридическая верификация

Современные системы (Suno, Mubert, Riffusion, Udio) предоставляют доступ к перечню внутренних параметров: значения «seed», объем пространства, количество итераций, режим royalty‑free. Отдельного внимания заслуживает вопрос авторского права. Если алгоритм обучен на небесконечно больших датасетах, необходимо активировать опцию «no references» или ограничить генерацию royalty‑free источниками, иначе результат может быть квалифицирован как дериватив существующего произведения.

Первичная генерация и анализ результата

Генерация энного количества вариантов (n‑takes) позволяет осуществить статистическую выборку и оценить степень попадания в заданные стилистические рамки. Анализ состоит из двух независимых плоскостей: художественной и технической. Первая измеряет соответствие темброво‑гармонического профиля драматургической задаче, вторая — отсутствие технических дефектов (клип‑пики, искажения разрядности). Лучшие генерации фиксируются как кандидаты для стадии углубленного репромптинга.

Итеративное уточнение и генерация стемов

Дальнейшая работа происходит в режиме «итеративного уточнения»: путем точечного изменения запроса корректируются отдельные параметры — темп, плотность фактуры, наличие вокальной линии. Если архитектура поддерживает экспорт стемов, генерируются независимые дорожки ударных, баса, вокала и других инструментов. Такой подход коррелирует с парадигмой «контекстуального микширования», когда пространственный образ формируется не в момент генерации, а в виртуальной рабочей станции методами традиционной звукорежиссуры.

Сформированный материал проходит этап микширования. Практика показывает, что результаты генеративных моделей зачастую требуют динамической, частотной и пространственной доработки и адаптации к целевому формату воспроизведения: стерео, 5.1, Atmos. При работе с видео отдельное внимание уделяется структурному монтажу: синхронизация кульминаций с видео‑монтажными опорными точками, коррекция темповой сетки через time‑stretch‑алгоритмы, кросс‑фейдовая стыковка сегментов для сохранения музыкальной когерентности.

Утверждение музыкальной фонограммы

Заключительная стадия включает совместное прослушивание с продюсером и композитором. В документационном пакете фиксируются seed‑значения, версия модели, промпт‑журнал и правовая информация по лицензиям. Такая прозрачность обеспечивает воспроизводимость художественного результата и снимает риски при возможных ревизиях или релизах на альтернативных платфо        рмах.

Таким образом, генеративные нейросети не являются «черным ящиком», в который достаточно погрузить случайный текстовый запрос. Их эффективное использование требует от пользователя совмещения компетенций музыкального аналитика и data‑инженера. Лишь при условии комплексного подхода алгоритмический ресурс ИИ полностью раскрывается, трансформируясь из гаджета для быстрого прототипирования в полноценный инструмент художественного творчества.

Практические примеры работы генеративных нейронных сетей

Нейронные сети активно изменяются, и изменяется подход к составлению запроса (промпта). Так, в 2026 году после многочисленных исков от правообладателей музыки, сервисы адаптировались под текущий рынок и ввели частичный запрет на использование имён композиторов, а также наименования особенно знаковых композиций. Примеры ниже были сгенерированы в начале 2025 года, когда составление запроса было более свободным, а сервисы не ввели улучшенные модели для работы. Тем не менее, общие принципы сохранили свою актуальность; при анализе представленных примеров необходимо учитывать время их создания и изложенный выше контекст.

Рассмотрим описанную методику на нескольких генеративных инструментах на базе нейронной сети, а также примеры успешного использования таких нейросетевых моделей.

Одним из наиболее простых примеров является использование генеративной модели Udio для создания музыкальной фонограммы.

Для успешной генерации музыкальной фонограммы необходимо сформулировать задачу. Исходя из замысла, определим драматургическую функцию будущей фонограммы: длительность музыкальной композиции будет составлять восемьдесят четыре секунды, а формат итогового мастера планируется в конфигурации 5.1 при частоте дискретизации 48 кГц и 24 бита.

Далее необходимо сформулировать стилистический референс. Возьмем саундтрек Бена Фроста «Theory Of Machines», арпеджио‑фактуру Нильса Фрама «Says» и основной лейтмотив картины, написанный композитором проекта; из указанных произведений экстрагируются темпо‑ритмические (девяносто шесть ударов в минуту) и гармонические (ми минор с последующим кадансовым отклонением в соль мажор) параметры, которые позднее вводятся в качестве контрольных переменных.

В пользовательском интерфейсе Udio во вкладке «Create» активируется режим Instrumental, исключающий наличие вокальной дорожки, после чего составляется базовый текстовый запрос (prompt), описывающий желаемую музыкальную палитру на английском языке: «dark introspective cinematic underscore, 96 BPM, 6/8 meter, E minor drone with subtle bowed textures, no percussion, sparse, cold reverb». Так как алгоритм Udio оперирует сегментами фиксированной продолжительности в тридцать две секунды или две минуты десять секунд, общая форма делится на три взаимосвязанных блока, где первый отвечает за статичное введение, второй — за нарастание динамического напряжения, а третий — за последующее затухание; для каждого сегмента формируется уточняющий промпт, содержащий директивы «add evolving synth» и «introduce dissonant string cluster» соответственно.

Рисунок 1 – Пользовательский интерфейс Udio с диалоговым окном запроса(составлен автором)

Генерация выполняется итеративно по четыре варианта на сегмент, после чего следует аналитический отбор: с помощью эмпирического анализа оцениваем соответствие музыки характеру сцены, а также проверяем отсутствие фазовых искажений, транзиентных артефактов и консистентность музыкальной фонограммы. Финальный запрос выглядит как «dark introspective cinematic underscore, 96 BPM, 6/8 meter, E minor drone with subtle bowed textures, no percussion, sparse, cold reverb, add evolving synth in the middle of the song, introduce dissonant upper‑string cluster in the end».

В результате веб-сервис представил варианты произведений.

Рисунок 2 – QR-код для прослушивания сгенерированных вариантов музыкальных фрагментов в жанре Ambient

Рисунок 3 – Расположение сгенерированной музыки впользовательской библиотеке Udio

Все варианты композиции точно выполняют запрос о музыкальных дронах, струнных текстурах, а также темпо-ритмических и гармонических параметрах, однако добавляют в партитуру вокальные партии, не обозначенные непосредственно в запросе. Такую проблему можно решить посредством автоматического экспорта стэмов в веб-сервисе и последующей работой над аранжировкой.

Рисунок 4 – Диалоговое окно автоматического экспорта стемов композиции

Стоит также отметить существенное различие между предложенными версиями композиции, что говорит о неконсистентности текстовому запросу. Все четыре предложенные композиции консистентны по выбранной гармонии и темпоритму, а также не содержат искажений нехудожественного характера или звуковых артефактов. Стоит также отметить и впечатляющую проработку музыкальной палитры генеративной нейронной сетью, что еще раз подчеркивает потенциальные возможности использования генеративного искусственного интеллекта в области поиска музыкального художественного решения. Предположим другую художественную задачу, для решения которой необходимо написать оркестровое музыкальное произведение, вдохновленное работой композитора Рамина Джавади для телевизионного сериала «Игра Престолов». Зададим необходимую звуковую палитру из музыкальных инструментов, темпа и гармонии. Финальный запрос будет выглядеть как «instrumental music track in the style of composer Ramin Djawadi, «Game of Thrones» soundtrack. Epic, dramatic, slowly building tension with a gradual increase in emotional intensity. Primary Instrument: Deep strings, including cello, double bass, and viola, joining gradually to intensify emotional impact. Additional Atmospheric Elements: Organ or synthesized organ-like textures, enhancing solemnity and depth. Subtle choir presence (wordless vocals or minimalistic vocalization) in the second half of the track. Minor key (preferably C minor or D minor) with occasional modulations to heighten drama. Simple yet emotionally powerful harmonic progression dominated by minor chords and pedal tones to build tension. Intro: establish the main theme. Development: Gradual introduction of string instruments, building dynamics and emotional intensity. Climax: Incorporation of choir and organ, powerful, richly layered sound achieving emotional peak. Outro: Gradual fading of instruments». («Инструментальная композиция в стиле саундтрека к сериалу «Игра престолов» (композитор Рамин Джавади). Эпичная, драматичная музыка с постепенным нарастанием напряжения и эмоционального накала. Основные инструменты: низкие струнные (виолончель, контрабас, альт), вступающие поочередно для усиления эмоционального воздействия. Дополнительные атмосферные элементы: орган или синтезированные органные тембры, придающие звучанию торжественность и глубину. Ненавязчивое хоровое сопровождение (вокализ без слов или минималистичные вокальные партии) во второй половине трека. Минорная тональность (предпочтительно до-минор или ре-минор) с эпизодическими модуляциями для усиления драматизма. Простая, но эмоционально насыщенная гармоническая последовательность, основанная преимущественно на минорных аккордах и органных пунктах (выдержанных басовых нотах) для создания напряжения. Вступление: экспозиция основной темы. Развитие: постепенное вступление струнных инструментов, нарастание динамики и эмоциональной интенсивности. Кульминация: вступление хора и органа; мощное, многослойное звучание, достигающее эмоционального пика. Завершение: постепенное затихание инструментов» – прим. ред.).

Получившиеся композиции не только содержат развитие темы, но и внутренне согласованы между собой частями, что ранее было проблемой в области генеративной музыки. Все четыре композиции обладают заданными в запросе функциями, и могут быть использованы для имплементации художественного образа в кинематографе как в качестве референсной композиции, так и непосредственно в виде музыкальной фонограммы.

Рисунок 5 – QR-код для прослушивания сгенерированных вариантов музыкальных фрагментов в оркестровой аранжировке

Предположим более сложную задачу по написанию главной темы фильма с вокальной дорожкой. Обозначим необходимые параметры музыкальной фонограммы, темп, ритм, текст, и дадим подробный запрос нейронной сети: «Create an original main-title song for a contemporary spy thriller: a soulful contralto lead (British accent) over an orchestral ballad in F-minor at 74 BPM with a laid-back swing feel. Mood is dark, smouldering and suspenseful, rising to a heroic payoff. Introduce legato strings (violins/violas), bass-clarinet countermelody and pulsing electric bass. Build tension with brushed drums, deep toms, timpani rolls and muted brass swells. First chorus should unleash full strings, drums and brass around a tonic-minor-sixth hook. Second verse pares back to pizzicato strings and warm Rhodes while tremolo guitar and reversed cymbals create atmosphere. A bridge modulates briefly to A♭ major with lush choir «ah» pads and soaring vocal ad-libs, then drops back to F-minor for a climactic final chorus ending on a long fermata tonic with an echoing piano arpeggio. Orchestration details: strings, horns & muted trumpets, low woodwinds, brushed kit, orchestral percussion, reversed cymbal swells and airy vocal pads. Production: wide stereo strings, centred vocal, deep cinematic reverb, low-pass swells before each chorus».

«Создать оригинальную заглавную песню для современного шпионского триллера: проникновенное контральто (с британским акцентом) на фоне оркестровой баллады фа-минор со скоростью 74 удара в минуту в непринужденном стиле свинг. Настроение мрачное, тлеющее и тревожное, достигающее героической цели. Вступление: струнное легато (скрипки/альты), контрапункт бас-кларнета и пульсирующий электрический бас. Создать напряжение с помощью барабанов со щетками, глубоких томов, тремоло литавр и приглушенных раскатов медных духовых. В первом припеве струнные, барабаны и медные духовые должны полностью раскрываться вокруг тонического минора с секстой. Второй запев возвращает к пиццикато струнных и теплому Родесу, в то время как тремоло на гитаре и реверсивные тарелки создают атмосферу. Средняя часть ненадолго переходит в ля-бемоль мажор с пышными хоровыми «ах» и свободным парящим вокалом, затем возвращается к Фа минору для кульминационного финального припева, завершающегося длинной ферматой на тонике фортепианного арпеджио с эхом. Детали оркестровки: струнные, валторны и засурдиненные трубы, низкие деревянные духовые, ударные со щетками, оркестровая перкуссия, реверсивные тарелки и воздушные вокальные пэды. Звучание: широкие стереофонические струнные, вокал по центру, глубокая кинематографическая реверберация, усиление низких частот перед каждым припевом» – прим. ред.).

Нейронная сеть успешно справилась с задачей создания музыкальной композиции, точно передав характер, инструменты, гармонические и темпоритмические инструкции. В частности, хорошо чувствуется «swing feel» всей композиции.

Рисунок 6 – QR код для прослушивания первой версии сгенерированного музыкального вокального фрагмента

Композиции заметно различаются и достаточно точно выполняют текстовый запрос о наличии струнной, медной духовой секции и перкуссии с хором. Композиция под кодовым названием «Var1» обладает более напряженным характером в первой части произведения, в отличие от второго и третьего вариантов. Проведение тем также варьируется: «Var1» представляет тему медной духовой секцией в начале произведения, в то время как «Var3» начинает с легатной струнной секции.

Рассмотрим также несколько более мелодичных композиций в жанре соул и оркестровой поп музыки.

Рисунок 7 – QR код для прослушивания сгенерированного музыкального фрагмента в жанре соул

Рисунок 8 – QR код для прослушивания сгенерированного музыкального фрагмента в жанре оркестровой поп музыки

В перечисленных жанрах нейронная сеть успешно справляется с написанием музыки по запросу, промпту, и пользовательскому тексту песни.

Помимо аранжировок на английском, примеры которых доступны на физическом носителе и облачном сервисе, нейросеть успешно справляется и с задачами по написанию музыки на русском языке. Результаты могут быть успешными, однако требуется тщательная подготовка нейронной модели: текст должен быть разбит на составные формы: куплет, припев и другие. Также необходимо произвести большее количество генераций ввиду учащающегося количества дефектов в русской речи у нейронной модели, а также неконсистентных вокальных мелодических линий. Такие дефекты происходят вследствие недостаточной тренировки датасета модели на музыкальных фонограммах на русском языке.

В композиции «В поле спите, мотыльки» под кодовым названием «MainTheme_Ver6» в вокальном треке наблюдаются дефекты произношения некоторых слов, а также акцент.

Рисунок 9 – QR код для прослушивания сгенерированного музыкального фрагмента «В поле спите, мотыльки»

Однако с большим количеством новых генераций этих дефектов можно избежать. В генерации «MainTheme_Ver8» наблюдается чистое произношение и отсутствие вокальных искажений.

Рисунок 10 – QR код для прослушивания второго сгенерированного музыкального фрагмента «В поле спите, мотыльки»

Особенно точно у нейронной модели генерируются ансамблевые исполнения произведения, как в хоровой композиции «Мне жалко, что теперь зима…».

Рисунок 11 – QR код для прослушивания сгенерированного музыкального фрагмента «Мне жалко, что теперь зима…»

В дальнейшем итоговая фонограмма проходит процедуру контрольного прослушивания в калиброванной студии на мониторах дальнего поля, после чего продюсер утверждает художественную состоятельность решения; параллельно фиксируются seed‑значения, версии модели и полный журнал использованных промптов, что гарантирует воспроизводимость при возможной ревизии релиза. С юридической точки зрения, используется актуальная редакция пользовательского соглашения Udio, согласно которой все имущественные права на сгенерированный материал переходят к пользователю, что делает фонограмму пригодной для свободного коммерческого использования в рамках OTT‑платформ и кинотеатрального проката.

Таким образом, последовательное применение описанной методики демонстрирует, что генеративная модель Udio способна в оперативные сроки производить высококачественный музыкальный материал, интегрируясь в существующий технологический процесс звукорежиссера и сокращая суммарные трудозатраты по сравнению с традиционным композиторским процессом.

Рассмотрим другой похожий пример на основе генеративной модели Mubert, хорошо адаптированной для создания семплированной музыки. Mubert – генеративная платформа, использующая гибридные алгоритмы машинного обучения и rule‑based подбор семплов из собственной базы лупов. Сервис допускает экспорт мастер‑файлов в форматах PCM Wave 48 кГц/24 бит и конфигурациях стереомикса. Предположим ситуацию, для которой будет необходимо создать музыкальную фонограмму в жанре Ambient.

Необходимо определить эмоциональный вектор сцены, во время которой будет звучать музыка: например, как «приглушенное внутреннее напряжение главного героя», а также технические характеристики, необходимые для выполнения поставленной задачи, например, длительность в минуту двадцать секунд и многоканальный формат 5.1.

Подберем референсное звучание музыки, музыкальные фрагменты в жанре Ambient близкой темброво‑фактурной направленности (например, композицию «A Sudden Manhattan Of The Mind» Бена Фроста), и экстрагируем темпо-метрические данные, необходимые для правильного запроса музыкальной композиции (темп 96 ударов в минуту, размер 4/4, нижний-средний регистр).

Далее необходимо зайти в веб-приложение Mubert, выбрать на главной странице раздел Generate track и составить подробный запрос на основе необходимых данных, например, «Ambient / Drone, Dramatic; BPM:96, Instruments: Pads, Textures. Dark evolving ambient underscore with low frequency drone, subtle granular textures; NO rhythmic percussion, maintain cinematic tension». В правом окне выбрать необходимую длину трека и нажать клавишу Generate.

Рисунок 12 – Диалоговое окно с выбором запроса в сервисе Mubert

Необходимо провести не менее пяти генераций и отобрать понравившуюся композицию, зафиксировав идентификатор сеанса (Seed ID, Track ID), при этом видоизменяя промпт (запрос) для получения необходимого результата. Так, запрос «Ambient/Drone, Dramatic; BPM = 96, Instruments: Pads, Textures. Dark evolving ambient underscore with low frequency drone, subtle granular textures; maintain cinematic tension» эмпирически приводит к более консистентным результата.

Рисунок 13 – QR код для прослушивания сгенерированных музыкальных фрагментов в жанре Ambient

В результате работы сервиса, было отобрано четыре наиболее подходящие запросу композиции. Можно наблюдать, как отличаются алгоритмы Udio и Mubert в плане реализации творческой идеи. Ввиду использования rule-based алгоритмов платформой Mubert получившиеся композиции обладают более строгой консистентностью генерации – инструменты, использующиеся в вариантах композиции, похожи друг на друга, а звучание инструментов приближено к семплированному, так как генеративная модель Mubert использует изначально подготовленные датасеты семплов. После прохождения первичного контроля генерации в виде проверки целостности звукового файла, необходимо экспортировать звуковую дорожку в виртуальную рабочую станцию для дальнейшей работы над монтажом и сведением музыки в многоканальном формате.

Современные генеративные нейросети, такие как Suno AI, Udio, Mubert и другие не только автоматизируют процессы создания музыкального материала, но и трансформируют подход звукорежиссера к выражению художественного высказывания в рамках аудиовизуального произведения, однако применение моделей требует от пользователя не просто технической осведомленности о субъективных параметрах музыки, но и музыкальной компетенции.

Генеративные нейронные сети не всегда обладают согласованностью и структурной устойчивостью генерируемого материала. Проблема обусловлена как стохастической природой таких моделей, так и рядом архитектурных и методологических особенностей, присущих современным системам глубокого обучения. Генеративные модели, построенные на архитектурах VAE и GAN (см. первую часть статьи), оперируют скрытыми переменными, значения которых задаются через вероятностное распределение. Даже при одинаковых условиях формирования музыкальной фонограммы, модель может генерировать различные по структуре, гармонии и форме результаты. С одной стороны, такая вариативность расширяет творческий потенциал взаимодействия с генеративной системой, с другой стороны, снижает воспроизводимость и предсказуемость результата.

Несмотря на значительный прогресс в области достоверности генерируемого звучания с точки зрения таких параметров музыки, как мелодия, тембр и ритмический рисунок, некоторые генеративные нейронные сети не обладают встроенными механизмами моделирования формы и структуры произведения. Консистентность результата во многом определяется репрезентативностью обучающего датасета во время создания нейронной сети. При недостатке жанрового разнообразия, стилистического баланса или большого объема метаданных, обучающая выборка может индуцировать у модели склонность к повторению фрагментов, нарушению целостности произведения или, наоборот, чрезмерной «шаблонности» формируемой музыкальной фонограммы, что особенно заметно при генерации длинных музыкальных фрагментов ввиду потери контекста.

В системах, использующих систему text-to-music, консистентность зависит от семантической интерпретации системой текстового запроса. Неоднозначность или скупость формулировки может привести к появлению музыкальных элементов, не соответствующих заданному настроению, жанру или тембру. Кроме того, повторная генерация по одному и тому же текстовому запросу может давать существенно отличающиеся результаты, поэтому важно следовать статистическим правилам генерации и выборки, описанным в начале главы.

Современные архитектурные решения построения нейронных сетей направлены на устранение данной проблемы. Так, использование моделей-трансформеров с расширенными механизмами внимания позволяет уменьшить вероятность появления неконсистентного строения формы музыкального произведения, а составление точного текстового запроса позволяет более точно настраивать стилистические особенности фонограммы.

Генеративные нейросети не гарантируют консистентности результата по умолчанию, тем не менее, целенаправленная настройка таких моделей, внедрение структурных ограничений, а также использование рационального технологического подхода позволяют повысить предсказуемость и художественную целостность музыкального материала. В этой исследовательской работе были упомянуты наиболее консистентные инструменты, в типе архитектур которых применяются модели-трансформеры, а также rule-based алгоритмы, повышающие устойчивость генерируемого материала к неконсистентной генерации.

Музыкальные генеративные модели уже применяются в аудиовизуальном производстве: например, музыкальное сопровождение экспериментального короткометражного фильма «Sunspiring» 2016 года включает в себя элементы, сгенерированные нейронной сетью; а музыкант JEL выпустил музыкальное видео «Constellations of Love», созданное с помощью генеративной платформы Udio, указанной в качестве соавтора композиции.

В фильме «Бэтмен» 2022 года (режиссер Мэтт Ривз) также использовались генеративные технологии для создания музыкальных композиций в жанре эмбиент с помощью платформы Amper Music.

Таким образом, в условиях современных требований к скорости и адаптивности производства, генеративные модели позволяют быстро предложить музыкальные фрагменты, а в кино произвести оригинальное звуковое решение в отсутствие композитора и обеспечить консистентность музыкальной фонограммы.

Методика работы с сепарационными нейронными сетями

Прогресс искусственного интеллекта предоставил новые возможности работы с музыкальной фонограммой, которые ранее казались невозможными. Разделение готовой многоканальной фонограммы на составляющие совсем недавно было одним из вызовов, с которыми не могли справиться простые алгоритмы машинного обучения, а зачастую проводилось вручную посредством редактирования спектрограммы музыки. Павел Згордан, сооснователь сервиса Mubert, в интервью упоминает о случаях, с которыми сталкивались многие музыкальные звукорежиссеры в начале творческого пути:

«Раньше подобные задачи (разделения музыкальных дорожек на стемы) казались почти невозможными. В начале 2010-х заказчики просили «убрать вокал» из готовой фонограммы, не понимая, что это равносильно попытке извлечь соль из супа – компоненты уже слиты.

Некоторые пытались добиться результата эквалайзером или противофазой, но это практически всегда разрушало исходную фонограмму. Намного проще было бы переписать все заново, чем пытаться спасти испорченный трек. Сегодня же технологии позволяют выполнять такие задачи быстрее, проще и качественнее.

Помню, как с появлением RX от iZotope я впервые ощутил настоящий восторг. Я с радостью купил этот софт и до сих пор использую его в работе. Это был настоящий инструмент профессионала, а не просто эффект».

Сейчас такой вид работ не только возможен, но и высокоэффективен; алгоритмы, разработанные для разделения стемов, стали одним из главных прорывов нейронных сетей в области звукорежиссуры. В каких видах работ звукорежиссеру могут помочь нейронные сети, разработанные для разделения аудиосигнала? Основным направлением работы является реставрация и адаптация музыкальной фонограммы под многоканальные форматы.

Известно, что некоторые многодорожечные записи музыкальных фонограмм не производились, были утрачены или не сохранялись. Советская кино- и музыкальная индустрия также сталкивалась с дефицитом качественной пленки. Кроме этого, существуют и другие причины, вследствие которых многодорожечные записи исполнения могут отсутствовать. Среди них, например, любительская съемка или запись концерта или отсутствие возможности записи в многодорожечном формате.

Эти и многие другие причины создают проблему отсутствия поканальных треков, а, значит, адаптации музыкальной фонограммы в многоканальных форматах или ремастеринга архивных записей.

Основная причина ремастеринга записей – изменение потребительской привычки вследствие войны громкостей и преобразование художественного образа музыкальной фонограммы. В 1960-х годах звукозаписывающие компании начали увеличивать громкость записей, чтобы привлечь внимание слушателей. Однако физические ограничения виниловых пластинок сдерживали этот процесс. С появлением цифровых технологий и компакт-дисков в 1980-х годах эти ограничения исчезли, и громкость записей начала стремительно расти. К 2000-м годам многие альбомы достигли пикового уровня громкости, что привело к искажению звука и утомлению слушателей. С внедрением стриминговых сервисов, таких как Spotify, Apple Music и YouTube, которые используют нормализацию громкости, ожидалось, что война громкостей закончится. Однако, по мнению специалистов, она продолжается, и многие продюсеры и инженеры стремятся к громкому звучанию, несмотря на нормализацию громкости на платформах. Художественный образ музыки также обновляется вследствие изменения потребительской привычки. Например, звучание записей группы The Beatles заметно изменилось в результате ремастеринга и ремиксов вследствие развития современных технологий. Новые инструменты позволили звукорежиссерам не только улучшить баланс и панорамирование инструментов, но и сделать звучание инструментов более отчетливым и детализированным.

С появлением многоканальных форматов 5.1, 7.1, а затем Dolby Atmos, музыкальная фонограмма в фильме также претерпела значительные изменения. Мария Александровна Соболева упоминает о некоторых экспериментальных, ввиду относительно недавнего появления технологии, изменениях в работе звукорежиссера записи музыки:

«В целом, технология остается такой же. Есть опорный план и индивидуальные микрофоны, но поскольку Dolby Atmos – это другое мышление и другое сведение, то помимо основного комплекта микрофонов, ставятся еще и вертикальные микрофоны в потолок. И даже несколько планов, чтобы на сведении было больше возможностей работы».

Помимо постоянно изменяющегося подхода к записи музыки в многоканальных форматах, объектно-ориентированный подход в системе Dolby Atmos позволил воплотить детализированное панорамирование как в горизонтальной, так и вертикальной плоскостях, что привнесло новую свободу в рамках воплощения художественного образа. Возможность детализированной настройки панорамирования внутри объектно-ориентированной системы одновременно является проблемой недостатка индивидуальной звуковой информации, панорамирование которой необходимо совершить звукорежиссеру при работе над художественным образом музыки.

Наконец, немаловажным фактором использования многоканальной музыки являются различные музыкальные интерпретации произведения, в том числе, в трейлерах и промо-роликах фильма. Тенденцию к переосмыслению музыкальных тем посредством добавления синтезированных инструментов и тяжелой перкуссии можно проследить во многих отечественных и зарубежных блокбастерах, что ставит перед звукорежиссером новые художественные задачи.

Решить поставленные выше проблемы звукорежиссер может посредством работы над стемами музыкального произведения, созданными при помощи сепарационных нейросетей. Алгоритмы позволяют эффективно перевести стереомикс в отдельные дорожки, что значительно упрощает работу на этапах монтажа и сведения произведения.

Использование сепарационных нейросетей показывает успешные результаты в музыкальном и кинопроизводстве. Так, инженер Джеймс Кларк из Abbey Road Studios использовал методы машинного обучения для разделения монофонических записей на отдельные инструменты при ремастеринге альбома The Beatles «Live at the Hollywood Bowl» и архива американского фестиваля Вудсток. А в процессе ремикса альбома «Revolver: Special Edition» была применена технология команды Питера Джексона для изоляции отдельных инструментов и вокальных партий из оригинальных записей, что ранее было невозможно. Технология особенно эффективна для работы с взаимопроникновением инструментов в индивидуальные микрофоны, что также применяется в работе над записями концертных исполнений.

#Назад в Статьи