Audio tokenization
Модели вроде трансформеров не могут напрямую работать с сырым аудио из-за его огромной размерности и непрерывности. Токенизация приводит звук к удобному «текстовому» виду, позволяя сети учиться предсказывать следующий токен — а значит, понимать речь, музыку, шумы и генерировать новые звуки. Без этого невозможны системы распознавания речи, синтеза голоса и музыкальные генераторы, обученные на миллионах часов записей.
Принцип работы можно представить как пересказ мелодии по телефону шёпотом: передаются не физические колебания, а ноты, ритм и тембр. Токенизатор разбивает звук на окна (обычно 10–30 мс), находит похожие акустические паттерны и присваивает им одинаковые номера. В итоге весь аудиопоток превращается в строку чисел, с которой модель работает как с текстом: учится, предсказывает продолжение, исправляет ошибки.
Пример — генерация музыки в стиле конкретного артиста. Модель обучается на тысячах токенизированных записей, захватывая характерные гармонии и тембры, а затем по запросу «создай трек в духе этого пианиста, но чуть быстрее» выдаёт последовательность токенов. Декодер превращает их обратно в звук. Так работают Jukebox от OpenAI и MusicLM от Google.
Коротко: аудио-токенизация — это мост между непрерывным аналоговым звуком и дискретным цифровым мышлением нейросетей. Она даёт машинам возможность писать, редактировать и сочинять звук так же естественно, как мы пишем слова.
Поделиться