глоссарий

MFCC

MFCC

MFCC — это мел-частотные кепстральные коэффициенты, способ превратить звуковую волну в компактный набор чисел, который компьютер может использовать для распознавания речи и звука. Проще говоря, это «отпечаток» звука, который выделяет самые важные для человеческого уха особенности.

Этот термин важен потому, что нейросети не умеют слушать напрямую — им нужны таблицы чисел. MFCC подаются на вход систем голосовых помощников, диктофонов с поиском по фразе, музыкальных рекомендаций и даже некоторых медицинских диагностик. Они позволяют отбросить лишнее: шум, тембр, громкость — и оставить то, что определяет смысл сказанного.

Как это работает на интуитивном уровне? Представьте, что вы рисуете портрет голоса, но не кистью, а линиями, отражающими энергию разных частот. Ухо устроено так, что лучше различает низкие и средние частоты, а высокие — хуже. MFCC имитируют этот фильтр: разбивают звук на множество временных окон, для каждого считают спектр, затем сжимают его по шкале мела (приближающей восприятие), а вместо полного спектра оставляют лишь несколько десятков коэффициентов — как бы «скелет» звука. Эти коэффициенты уже не зависят от высоты голоса или фонового гула.

Прикладной пример: приложение для изучения иностранного языка. Оно записывает ваше произношение, извлекает MFCC из каждой произнесённой фонемы и сравнивает их с эталонными коэффициентами носителя языка. Если расстояния между векторами малы — вы говорите близко к идеалу, если велики — алгоритм подсвечивает проблемную букву.

Вывод: MFCC — не сама речь, а удобная её проекция, которая помогает искусственному интеллекту слышать так же, как человек, только через числа.