глоссарий

Speaker diarization

Speaker diarization

Speaker diarization — это технология, которая отвечает на вопрос «кто говорит когда?» в аудиозаписи. Она разделяет поток речи на отрезки и группирует их по говорящим, не распознавая сами слова. Термин важен, потому что системы распознавания речи без диаризации превращают разговор в «кашу» из слов, где невозможно понять, кто что сказал. Диаризация широко применяется при автоматической транскрибации встреч, создании протоколов судебных заседаний, анализе звонков в колл-центрах.

Как это работает на интуитивном уровне? Представьте, что вы слушаете разговор двух дикторов. Ваш мозг мгновенно отмечает различия в тембре, высоте голоса, манере говорить. Алгоритм делает нечто похожее: он разбивает звук на маленькие фрагменты, для каждого вычисляет «отпечаток голоса» — набор численных характеристик, а затем группирует похожие отпечатки в кластеры. Каждый кластер соответствует отдельному человеку. Остаётся лишь разметить кластеры и нанести их на временную шкалу.

Прикладной пример: сервис автоматической расшифровки совещания. Сначала диаризация определяет, когда говорит менеджер, а когда — инженер, а затем каждому фрагменту текста присваивается имя говорящего. В результате получается удобный протокол, где реплики атрибутированы, и можно найти, кто озвучил определённую идею.

Вывод: Speaker diarization — незаменимый инструмент для работы с многоголосым аудио. Она превращает хаос звуков в упорядоченный диалог, делая голосовые данные доступными для поиска, анализа и навигации.