WaveNet
Зачем это важно: голос стал интерфейсом общения с машинами. Качество речи напрямую определяет доверие к ассистенту, доступность контента для незрячих людей, качество перевода и озвучки. WaveNet открыла дорогу целому семейству генеративных моделей и показала, что звук можно «рисовать» так же, как изображения.
Как это работает на интуитивном уровне: представьте, что вы угадываете следующую ноту мелодии, зная все предыдущие. Нейросеть прослушивает окно из тысяч прошлых отсчетов и для каждого нового выдает не единственный вариант, а распределение вероятностей всех возможных значений. Затем случайно выбирается одно значение, и оно добавляется в историю. Ключевой трюк — расширяющиеся сверточные фильтры, которые охватывают всё более длинные промежутки времени: сеть слышит и недавние звуки, и контекст из далекого прошлого.
Прикладной пример: Google Assistant использовала WaveNet для генерации голосовых ответов, а также в Google Translate для озвучивания переведенных фраз. Компания даже выпустила фирменные голоса, которые звучат как живые дикторы, при том что их можно менять тембром и скоростью на лету.
Вывод: WaveNet — фундамент современного генеративного аудио. Она доказала, что даже такие тонкие вещи, как тембр и интонация, можно смоделировать, обрабатывая звук по семплам, и положила начало эпохе естественных синтезированных голосов.
Поделиться