глоссарий

Audio tokenization

Audio tokenization

Аудио-токенизация превращает непрерывный звуковой сигнал в последовательность дискретных токенов — коротких числовых меток из заранее заданного словаря. Это как разбить запись на крошечные фрагменты и каждому присвоить номер. Такое представление нужно, чтобы нейросети, созданные для работы с текстом, могли обрабатывать и звук: текст уже дискретен, а звук — это бесконечные волны.

Модели вроде трансформеров не могут напрямую работать с сырым аудио из-за его огромной размерности и непрерывности. Токенизация приводит звук к удобному «текстовому» виду, позволяя сети учиться предсказывать следующий токен — а значит, понимать речь, музыку, шумы и генерировать новые звуки. Без этого невозможны системы распознавания речи, синтеза голоса и музыкальные генераторы, обученные на миллионах часов записей.

Принцип работы можно представить как пересказ мелодии по телефону шёпотом: передаются не физические колебания, а ноты, ритм и тембр. Токенизатор разбивает звук на окна (обычно 10–30 мс), находит похожие акустические паттерны и присваивает им одинаковые номера. В итоге весь аудиопоток превращается в строку чисел, с которой модель работает как с текстом: учится, предсказывает продолжение, исправляет ошибки.

Пример — генерация музыки в стиле конкретного артиста. Модель обучается на тысячах токенизированных записей, захватывая характерные гармонии и тембры, а затем по запросу «создай трек в духе этого пианиста, но чуть быстрее» выдаёт последовательность токенов. Декодер превращает их обратно в звук. Так работают Jukebox от OpenAI и MusicLM от Google.

Коротко: аудио-токенизация — это мост между непрерывным аналоговым звуком и дискретным цифровым мышлением нейросетей. Она даёт машинам возможность писать, редактировать и сочинять звук так же естественно, как мы пишем слова.