глоссарий

Sound event detection

Sound event detection

Sound event detection (SED) — область ИИ, где компьютер распознаёт конкретные звуковые события: стук, сирену, плач, лай, звон стекла. Система определяет, что произошло и когда началось и закончилось. Это «слух для машин», позволяющий понимать окружение без видеокамер.

Это важно: мир полон значимых звуков. Умный дом услышит протечку воды, производство — неисправный подшипник, безопасность — крик или выстрел. Без SED устройства полагаются на видео, которое бывает недоступно или неуместно. Слышащий ИИ делает автоматизацию естественнее.

Как работает? Нейросеть на огромных массивах аудио учится различать звуки, как ребёнка учат распознавать гром. Аудио режется на фрагменты по 20–30 мс и превращается в спектрограмму. Модель находит паттерны: низкий всплеск для грома, быстрое чередование высоких частот для лая. Сеть скользит по потоку, присваивает вероятности классам и объединяет их в цельные события.

Пример: пожилой человек рискует упасть. Модель обучена на тысячах звуков падения. Система через микрофон слышит характерный удар, отличает его от обычного шума и через секунду отправляет сигнал родственнику или в службу помощи, сокращая время реакции.

Итак, SED превращает акустический хаос в структурированные метки времени и типов. Он не слышит по-человечески, но извлекает смысл из волн. Технология делает машины чувствительными к звуку, а жизнь безопаснее.