Главная/ Статьи/ 160 конгресс АES – научные результаты
160 конгресс АES – научные результаты

160 конгресс АES – научные результаты

Автор: Ирина Алдошина

С 28 по 30 мая в Копенгагене прошел очередной 160 конгресс AES. На конгрессе, как и на всех предыдущих, работали: научная сессия, семинары, выставка, студенческие мероприятия и др.

Мемориальную лекцию, памяти Хейзера прочитала профессор Ольборгского университета (Дания) Dorte Hammershøi. Она является специалистом в аудиологии и работает в области слухового восприятия человека применительно к электроакустическим приложениям, включая аудиометрическую калибровку, отоакустическую эмиссию, повреждения слуха, слуховую реабилитацию, пространственный слух и измерение источников шума вблизи уха. Лекция называлась «От передаточных функций головы к повреждению слуха и слуховой реабилитации» и содержала анализ достижений в этой области за последние тридцать лет.

На научной сессии было представлено 105 докладов, расскажу о наиболее интересных.

Много докладов было посвящено актуальнейшей теме использования нейросетей в аудиотехнологиях.

В докладе Ольборгского университета (Дания) «От ЦОС к аудиоинженерии на основе ИИ: наследие и будущее физического моделирования и  синтеза звука (пр. 409) предлагается ввести новую зарождающую дисциплину «ИИ-аудиоинженерия», которая заменит собой ЦОС, физическое моделирование и др. При этом измерения, физическое моделирование, обучение и перцептивная оценка образуют непрерывный цикл, в котором аудиомодели становятся развёртываемыми, сопровождаемыми и постоянно улучшаемыми артефактами.

В докладе из Технологического института в Мексике «Спектральная оптимизация для автоматического многоканального микширования» (пр. 10310) рассматривается новый алгоритм применения систем искусственного интеллекта для многоканального микширования (frmixerr). Сравнение полученных результатов его применения с микшированием профессиональных звукорежиссеров показало. что субъективные оценки для обоих случаев оказались очень близки.

Доклад фирмы Samsung «Upmix с помощью машинного метода обучения» (пр. 10283) предлагает новый алгоритм воссоздания дополнительных каналов громкоговорителей (например, при воссоздании системы 22.2 из меньшего числа каналов) с помощью машинного обучения.

Австрийский доклад «Общая модель обнаружения речевых дипфейков (подделок): сравнение различных подлинных источников или генераторов на основе ИИ?» (пр. 10264) предлагает метод тестирования и совершенствование модели детектирования подделок речи Deepfake Speech Detection (DSD) на основе анализа обширной базы данных подлинных речевых предложений и сгенерированных ИИ.

Доклад Университета Майами (США) «Слуховая оценка различных коммерческих моделей разделения музыкальных источников с фокусом на нетрадиционном музыкальном материале» (пр. 10259) содержит результаты слухового анализа различных машинных методов разделения музыкальных источников (спектрограмм-модель, модель по волновым формам и гибридная модель). Наилучшие оценки получила гибридная модель применительно к электронной музыке.

Доклад фирмы COMSOL A/S (Дания) «Оценка звуковых поглотителей с помощью глубинных нейронных сетей» (пр. 428) рассматривает проблему оценки пористых поглотителей для расчета параметров помещения волновым методом, что требует детальной формулировки граничных условий в зависимости от частоты и угла падения волны. Для решения этой проблемы использовались глубинные нейронные сети, обучение которых производилось на различных типах материалов и их конфигурации расположения.

Новинки микрофонных технологий были отражены в соответствующей секции конгресса.

Интересен норвежский доклад «Оптические микрофоны с уровнем сигнал/шум 80 дБ» (пр. 430). В настоящее время для создания миниатюрных MEMS-микрофонов используется в основном конденсаторный принцип, который позволяет получить отношение сигнал/шум 73 дБ и эквивалентный уровень шумов 21 дБА. В 2000-е годы появились сообщения фирмы Sennheiser о создании оптических микрофонов, принцип действия которых показан на рис. 1. В них используется лазерный луч. который после отражения от колеблющейся диафрагмы попадает на фотодиод. В данном докладе предлагается миниатюрная конструкции для создания микрофонных чипов, построенных на этом принципе, что позволяет увеличить отношение сигнал/шум до 80 дБ.

Рис 1 Принцип работы оптического микрофона MEMS (пр. 430)
Optical MEMS microphones leverage architectural advantages to achieve 80 dB SNR
Jakob Vennerød, sensiBel AS, Gaustadalléen 21, 0349 Oslo, Norway
https://aes2.org/publications

В докладе технического университета Дании «Измерения чувствительности MEMS-микрофонов в условиях свободного поля» (пр. 10308) рассматривается метод сравнительных измерений (с помощью пробного микрофона) чувствительности микрофонных чипов MEMS, которые активно применяются в настоящее время для создания микрофонных решеток.

Польский доклад «Микрофоны Zylia ZM-1 и Harpex Spcmic: изучение качества записей высокого порядка Амбисоник» (пр. 447) представляет результаты записей с помощью микрофонов Zylia ZM-1 (103 мм диаметр сферы с размещенными на ней 19 МЕМS-капсюлями 3-го порядка) и Harpex Spcmic (плоскость 170 мм с размещенными на ней 84 МЕМS-капсюлями, 5-го порядка) (рис. 2). Запись фортепиано производилась в концертном зале на 370 мест. Анализ субъективных оценок показывает, что увеличение порядка Амбисоник не оказывает существенного влияния на распределение пространственной  энергии в записях и качество оценок.

Рис 2 Два микрофона Zylia ZM-1 и один микрофон Harpex Spcmic: в центре (пр. 447)
Zylia ZM-1 vs. Harpex Spcmic: A Case Study of Higher-Order Ambisonic Recording Performance
Bartłomiej Mróz and Szymon Zaporowski
1 Department of Multimedia Systems, Gdansk University of Technology
https://aes2.org/publications

В докладе фирмы Nokia «Точные характеристики интегрированных микрофонных систем для синтеза передаточных функций источника» (пр. 10291) рассматривается улучшенный метод для синтеза передаточных функций источника с помощью специальных пробных микрофонов (IMPro technique), что позволяет оценить и компенсировать временные задержки в современных многомикрофонных измерительных устройствах.

Интересные доклады были прочитаны в секции психоакустики и восприятия звука.

Китайский доклад «Метод перцептуальной оценки для различных алгоритмов бинаурального воспроизведения» (пр. 10929) представил результаты работ по организации субъективных оценок различных алгоритмов бинаурального воспроизведения с учетом оценки не только тембра, но пространственной различимости углов расположения источников (т.е. минимально слышимой различимости углов JND).

В докладе Пекинского университета «Рекурсивная аттракторная сеть для локализации длительных источников звука и отслеживания их траектории при переменном количестве источников» (пр. 10271) представлен новый алгоритм RANet, который показывает стабильные результаты при локализации и оценке траектории движущихся источников.

Во французском докладе «Новый многоканальный алгоритм FxLMS полнодиапазонного воспроизведения в реальном времени в трансауральной стереофонии» (пр. 10288) предложен новый алгоритм для воспроизведения через четыре громкоговорителя (рис. 3) бинауральных сигналов, что дает возможность получить пространственное воспроизведение звука, как в бинауральной стереофонии, но без использования телефонов.

Рис. 3 Трансауральная система воспроизведения через четыре громкоговорителя (пр.10288)
An Extended Multichannel Frequency-Domain FxLMS Algorithm for Real-Time Full-Band Adaptive Transaural Reproduction
Thomas Fouchard, Alexis Rigaud, and Pierre Lecomte
Ecole Centrale de Lyon, CNRS, Universite Claude Bernard Lyon 1, INSA Lyon, LMFA, UMR5509, 69130, Ecully, France
https://aes2.org/publications

В датском докладе «Искусственное ухо для измерения и моделирования костной вибрации» (пр. 10266) представлен новый прибор и соответствующее программное обеспечение для измерений костных вибраций при прослушивании звуковых сигналов (рис. 4), которые являются главным источником искажений при прослушивании через наушники типа вкладыши (earplugs).

Рис. 4 Структура прибора «искусственное ухо» для измерения костной вибрации (пр. 10266)
Artificial ear for bone-conducted vibrations, simulation and measurement
Yu Luan 1 and Roberta Dattilo 1, 2
1 GN Hearing A/S
2 Technical University of Denmark (DTU)
https://aes2.org/publications

Доклад фирмы Dynaudio назывался «Использование характеристик направленности источника для устойчивого асимметричного подавления перекрестных связей» (пр. 418). В задачах бинаурального синтеза очень важное значение имеет устойчивость систем подавления перекрестных связей, особенно при поворотах головы. Для повышения устойчивости предлагается новый алгоритм, учитывающий характеристики направленности источников.

Еще один доклад Пекинского Университета «Реконструкция головы и ушной раковины на основе метода Gaussian Splatting для вычисления индивидуализированной передаточной функции головы (HRTF) по многовидовым изображениям, полученным с помощью коммерчески доступных камер» (пр. 10990) предложил метод для точной реконструкции формы головы и ушной раковины с помощью метода Gaussian Splatting (GS) – это технология, которая позволяет по набору обычных фотографий создать интерактивную 3D-модель. Эксперименты показали, что удалось создать метод, который позволяет получить значительно более точную модель HRTF, необходимую для решения задач бинаурального синтеза.

Китайский доклад «Восприятие горизонтальных углов при изменении ITD и ILD-признаков на низких частотах» (пр. 416) представил результаты субъективных оценок при восприятии углового расположения источников при изменении разницы во времени (ITD) и по интенсивности (ILD) в диапазоне 300-1480 Гц. Минимально воспринимаемый горизонтальный угол (по отношению к центральной оси) находился в районе 700 Гц. Эти данные могут быть полезны при аудиокодировании пространственного расположения источников.

В докладе фирмы Вeyerdynamic «Новая эталонная кривая для студийных наушников» (пр. 423) содержит результаты многочисленных субъективных экспертиз, на основе которых предлагается уточненная эталонная частотная характеристика для студийных наушников (рис. 5). Следует отметить, что работы по этому направлению ведутся с 90-х годов и данные по эталонным кривым все время совершенствуются.

Рис. 5 Новый вид рекомендуемой АЧХ для наушников (пр. 423)
A New Reference Target Curve for Studio Headphones
Jonas Förster and Lukas Keppler
beyerdynamic GmbH & Co. KG
https://aes2.org/publications

Японский доклад «Персональная оптимизация тембра для стереозвука, воспроизводимого через наушники» (пр. 438) представил продолжение работы по оптимизации тембров с учетом индивидуальных особенностей головы и ушной раковины (рис. 6) с использованием машинного обучения.

Рис. 6 Опорные точки на внешнем ухе для построения модели (пр. 438)
Personalized Timbre Optimization for Stereophonic Sound Reproduction via Earphones:
Part 2 – Practical Implementation and Validation on Consumer TWS Devices
Kimio Hamasaki 1, 2, Atsushi Hara 1, Haruto Hirai 1, Nao Tojo 1, Shun Saito 1, and Mitsuru Hosoo 1
1 final Inc.
2 ARTSRIDGE LLC
https://aes2.org/publications

В докладе известного специалиста Sean Olive «Восприятие и измерения нелинейных искажений в наушниках» (пр. 10263) описана серия экспериментов (рис. 7) по определению порогов слышимости нелинейных искажений в наушниках на музыке разных уровней громкости. Эксперименты показали, что, когда уровни превышают 104 дБ, слышимость нелинейных искажений становится значительной.

Рис. 7 Схема измерений наушников (пр. 10263)
The Perception and Measurement of Nonlinear Distortion in Headphones
Sean E. Olive 1 and Pierre Lelièvre 2
1 Sean Olive Audio Consulting, Oak Park, CA, USA.
2 Rtings, Montreal, PQ, Canada.
https://aes2.org/publications

Ряд интересных докладов был посвящен системам звукоусиления.

Доклад фирмы Dynaudio Lab «Частотно-временная интегрированная схема для частотно-независимого формирования характеристики направленности в линейных массивах» (пр. 10284) предлагает теорию формирования характеристик направленности в линейных массивах и методы управления их параметрами.

В докладе фирмы L-Acoustics (Франция) «Акустические и перцептуальные последовательности временных задержек в линейных массивах» (пр. 464) представлен анализ методов управления характеристиками направленности в линейных массивах, отмечается существенная важность фазовых задержек между компонентами массива. Эксперименты на 12-компонентном криволинейном массиве показали влияние фазовых (временных) задержек между компонентами на форму характеристик направленности и их влияние на субъективную оценку слушателей. (рис. 8).

Рис. 8 Влияние временных задержек на форму характеристики направленности линейного массива (пр. 464)
Acoustic and Perceptual Consequences of Time Misalignments in Line Array Speakers
Nicolas Epain and Etienne Corteel
L-Acoustics, 13 rue Levacher-Cintrat, 91462 Marcoussis Cedex, France
https://aes2.org/publications

Доклад фирмы Dynaudio «Модуляции волнового фронта для управления направленностью на высоких частотах» (пр. 10255) представляет двухслойное устройство (рис. 9), которое устанавливается перед высокочастотником для выравнивания фронта и расширения характеристики направленности на высоких частотах.

Рис. 9 Двухслойное устройство для выравнивания фронта волны перед высокочастотником (пр. 10255)
Differentiated Wavefront Modulation for Directivity Control at High Frequencies
Jun Gu, Zhi Li, and Jianbin Yang  
Dynaudio Lab, Gammel Lundtoftevej 3B, Copenhagen, Denmark
https://aes2.org/publications

В докладе канадского университета McGill «Влияние активных акустических систем звукоусиления на музыкальное впечатление в студии звукозаписи» (пр. 10280) приводятся результаты изменения параметров в студиях виртуальной реальности (рис. 10) за счет различного размещения громкоговорителей, и оценивается их влияние  на объективные характеристики и субъективные оценки восприятия различных музыкальных жанров.

Рис. 10 Студия виртуальной реальности (пр. 10280)
Effect of an Active Acoustic Reinforcement System on Musical Performance in a Recording Studio
Gianluca Grazioli, Richard King, and Wieslaw Woszczyk
Graduate Program in Sound Recording, McGill University, Montréal (CA)
https://aes2.org/publications

Доклад Технического университета Дании «Входная-выходная линеаризация динамики громкоговорителей через автоматическую дифференциацию» (пр. 10307) посвящен актуальной проблеме в громкоговорителях – компенсации нелинейных искажений. Этой проблеме посвящено большое количество исследований, где идентификация источников искажений проводилась в ручном режиме. Здесь предлагается автоматизированный метод определения причин нелинейных искажений и их линеаризация, что позволило уменьшить искажения на 6-12 дБ.

Итальянский доклад «Механические характеристики и геометрическая оптимизация шайб громкоговорителей» (пр. 410) содержит детальный анализ геометрических и упругих параметров шайб с помощью экспериментальных и численных методов, а также рекомендации по их выбору (рис. 11).

Рис. 11 Общий вид шайбы громкоговорителя (пр. 410)
Mechanical Characterization and Geometry Optimization of Loudspeaker Spider Suspensions
N. Chillè 1, L. Villa 2, C. Corsini 2 and G. Spatafora 2
1 Politecnico di Milano, Piazza Leonardo Da Vinci 32, Milano (MI), Italy
2 Faital SpA [Alps Alpine Group], via Bruno Buozzi 12, San Donato Milanese (MI), Italy
https://aes2.org/publications

В докладе фирмы Dynaudio «Нелинейная вязкоэластичность в подвесах громкоговорителей» (пр. 10301) содержит очень полезные для проектирования громкоговорителей результаты: подробный анализ гистерезисных свойств подвесов и появление обусловленных ими нечетных гармоник в спектре. Эксперименты показали, что гистерезисные свойства подвесов проявляются не только на высоких, но и на низких амплитудах.

Интересные доклады касались и сигнальной обработки аудио.

В докладе фирмы Samsung «Метод синхронизации динамических медиапотоков в различных медиапроигрывающих устройствах» (пр. 10302) предлагается новый алгоритм синхронизации аудиосигналов, позволяющий осуществлять многоканальное воспроизведение независимо от сетевых условий и источника передачи.

Китайский доклад «Психоакустическая модель для отображения цвето-звуковых сигналов в салоне автомобиля» (пр. 412) представил субъективные оценки  одновременного предъявления световых и звуковых сигналов в салоне автомобиля. Результаты показали, что цветовое сопровождение увеличивает ясность звуковых сигналов и также помогает слушателю воспринимать изменения в звуке более отчетливо.

Доклад Aalborg Universit (Дания) «Интеллектуальное адаптивное подавление шипящих с их автоматическим отслеживанием» (пр. 19268) рассматривает автоматическое применение De-Esser (подавителя шипящих) с отслеживанием шипящих и добавлением высоких частот с помощью динамического гармонического эксайтера.

Индийский доклад назывался «Интеллектуальная аудиоперсонализация для опытных пользователей» (пр. 10303). Поскольку музыкальный контент, представленный в стерео, обладает недостатками в воспроизведении пространства, предлагается метод разделения стереосигналов на отдельные фрагменты (инструменты или вокал) и панорамирование их по отдельным каналам воспроизведения через несколько распределенных громкоговорителей (рис. 12), что значительно улучшает их пространственное распределение.

Рис. 12 Разделение стереосигнала на отдельные потоки
Intelligent audio personalization for enhanced user experience
Avinash Singh 1, Sumit Panwar 1, Natasha Meena 1, and Hemanshu Srivastava 1
Samsung R&D Institute India — Delhi, a division of Samsung India Electronics Limited
https://aes2.org/publications

Доклад University of Salford, «JoyCam: Распознавание выражения лица с измерением нейронной активности с целью распознавания в реальном времени слушательских эмоций» (пр. 10267) рассматривает новую мультимодальную систему JoyCam, которая отслеживает выражение лица с измерением электроэнцелограммы для определения реальных слушательских эмоций при прослушивании музыки, что может найти применение в медицинских целях и при постановке различных экспериментов.

Ряд докладов был посвящен пространственным эффектам и технологиям.

В ирландском докладе «Оптимизация звуковых эффектов для улучшения восприятия диалогов при аудиомикшировании» (пр. 10257) рассматривается психоакустическое влияние эквализации и изменения пространственности на уменьшение слухового маскирования и четкость восприятия речевых диалогов. Эксперименты показали, что эквализация более эффективна для уменьшении маскирования, в то же время их совместное применение позволяет улучшить разборчивость и ясность (С80) в восприятии диалогов.

Французский доклад «Применение в реальном времени персональных звуковых зон с использованием секционированной свертки» (пр. 454) представил теорию создания отдельных звуковых зон при воспроизведении звука линейкой громкоговорителей (рис. 13). Для применения в реальном времени предлагается алгоритм секционирования операции свертки.

Рис. 13 Формирование отдельных звуковых зон (пр. 10303)
Real-Time Implementation of Personal Sound Zones Using Partitioned Convolution in PurrData
Jean Beuchet 1, Titouan Lefrançois 1, Guilhem Pagès 1, 2, and Manuel Melon 1
1 Laboratoire d’Acoustique de l’Université du Mans (LAUM), UMR 6613, Institut d’Acoustique — Graduate School (IA-GS), CNRS, Le Mans Université, France
2 Equipe GSII, ESEO Group, Angers, France
https://aes2.org/publications

Доклад Политехнического института в Мадриде «Пространственная оценка акустических параметров помещения с помощью методов реконструкции звукового поля» (пр. 10309) предлагает метод оценки акустических параметров (время реверберации, ясность, разборчивость и др.) во всех точках звукового поля с опорой на модель реконструкции импульсной характеристики звукового поля в различных точках помещения. В докладе приведен обзор методов реконструкции, применяемых в настоящее время.

В докладе итальянского аспиранта Консерватории «Художественная роль звукорежиссера в пространственной специализации. Исследование влияния пространства в эмоциональной оценке звука» (пр. 419) ставится задача исследовать, как позиция источника в пространственных системах влияет на эмоциональный отклик слушателя. Данный доклад является начальным этапом работы и определяет выбор положения источников и системы воспроизведения (Амбисоник 3-го порядка), методов оценки отчетов слушателей и др.

Доклад Belmont University «Эффективность восприятия мнимого источника» (пр. 453) представил результаты экспериментов по установлению положения мнимого источника. Для этого слушателям предлагалось панорамировать положение мнимого источника в стереосистеме так, чтобы он совпал с положением отдельно установленного монитора, который был расположен со сдвигом 15 градусов от центра. Эксперименты показали, что точность увеличивается с увеличением числа попыток, но точного совпадения не получается ни в горизонтальной, ни в вертикальной плоскости.

Немецко-швейцарский доклад «Методы измерений в помещении, основанные на новом стандарте MPEGI» (пр. 10276). В 2025 году был принят новый стандарт MPEG-I для пространственного звука, включая виртуальную и усиленную реальность ((VR/AR) с шестью степенями свободы. Стандарт предусматривает воспроизведение звука как через наушники, так и через громкоговорители. Этот доклад подробно описывает технологию измерений, изложенную в стандарте, для звукового воспроизведения в помещении через громкоговорители с отслеживанием движения головы слушателя.

В заключение следует отметить, что количество докладов, посвященных применению искусственного интеллекта и нейронных сетей в различных задачах аудиотехники (микшировании, панорамировании, распознавании звуковых источников и т.д.), на каждом конгрессе возрастает.

#Назад в Статьи