глоссарий

Mel-spectrogram

Mel-spectrogram

Мел-спектрограмма — это способ изобразить звук в виде «картинки», где по горизонтали откладывается время, по вертикали — частота, а яркость показывает громкость. Её особенность: частоты пересчитаны в мел-шкалу, которая приближена к восприятию человеческого уха.

Зачем это важно? Для ИИ это стандартный «вход» при работе со звуком. Нейросети не понимают аудио напрямую, им нужны числовые таблицы. Мел-спектрограмма сжимает звук в компактную матрицу, сохраняя то, что слышит человек. Поэтому её используют в распознавании речи, генерации музыки, классификации звуков.

Как это работает интуитивно? Представь, что ты записываешь песню. Каждая секунда делится на крошечные кадры. Для каждого кадра компьютер считает, какие частоты присутствуют. Громкость каждой частоты становится точкой на сетке. Получается двухмерное изображение. Но обычная спектрограмма слишком чувствительна к высоким частотам — на ней много лишних деталей, которые мы не слышим. Мел-шкала «сжимает» высокие частоты, как линза, приближая картину к нашему слуху. Так, разница между 500 и 1000 Гц видна хорошо, а между 5000 и 5500 Гц — почти никакой, что соответствует реальности.

Прикладной пример: в голосовых ассистентах звук сначала превращают в мел-спектрограмму. Затем нейросеть анализирует её, чтобы понять слова. Если говорить в шумной комнате, спектрограмма помогает отделить голос от шума, так как мел-шкала подчёркивает речевые частоты.

Вывод: мел-спектрограмма — это мост между физическим звуком и машинным обучением. Она делает аудио удобным для ИИ, сохраняя наше восприятие.