глоссарий

Voice activity detection

Voice activity detection

Voice activity detection, или VAD, — это технология, определяющая, присутствует ли человеческая речь в аудиопотоке в данный момент. Если совсем просто, это «умный выключатель» для микрофона: он решает, когда в сигнале есть голос, а когда — только тишина или шум. Зачем это нужно? Без VAD любая система, работающая со звуком, обрабатывала бы всё подряд, включая паузы, дыхание и стук клавиш. Это тратило бы память, энергию и вычислительные мощности. Представьте, что ваш телефон записывает каждый ваш вздох во время разговора — абсурд. Именно поэтому VAD стоит в основе практически всех голосовых интерфейсов и систем связи.

Как это работает на интуитивном уровне? Представьте, что вы сидите в шумном кафе и пытаетесь услышать собеседника. Ваш мозг автоматически отфильтровывает звон чашек и гул, выделяя характерные частоты человеческого голоса, его ритм и интонации. VAD делает примерно то же, но математически: анализирует амплитуду сигнала, спектр частот и изменения во времени. Если энергия в диапазоне голоса (примерно 300–3400 Гц) резко выросла и меняется плавно, как при артикуляции, — значит, это речь. А если звук стабилен и монотонен, как шум вентилятора, — это просто фон, который можно проигнорировать.

Классический пример — голосовой помощник на смартфоне. Он постоянно слушает эфир в энергоэкономном режиме, но полноценная обработка и распознавание включаются только после того, как VAD замечает акустический узор, похожий на фразу активации вроде «Окей, Google» или «Привет, Siri». Без этой техники аккумулятор разряжался бы за пару часов, а помощник постоянно реагировал бы на телевизор или разговоры посторонних. Так что VAD невидим, но незаменим: он экономит ресурсы, снижает ошибки распознавания и делает диалог с машиной естественным. Возможно, именно крошечный алгоритм, решающий «сейчас говорят или нет», — одна из самых практичных идей в искусственном интеллекте, на которой держится современная акустика.