глоссарий

Open-vocabulary detection

Open-vocabulary detection

Термин «Open-vocabulary detection» описывает способность алгоритма находить объекты по произвольному текстовому описанию, а не только по выученному списку классов. Классические детекторы обучаются на ограниченном наборе и не смогут найти объект, которого нет в их памяти. Открытый словарь снимает это ограничение: модель понимает описание, встреченное впервые, и находит нужное на картинке. Это важно, потому что реальный мир разнообразен, а возможность описывать цель словами делает систему гибкой и приближает к человеческому мышлению: мы ищем «треснутую вазу с синим узором», не перебирая все вазы из справочника.

Как это работает? Модель обучается на парах «изображение — текст» и учится сопоставлять визуальные фрагменты и слова в едином смысловом пространстве. Когда вы даёте описание, оно превращается в вектор признаков — «слепок смысла». Затем модель превращает области изображения в похожие векторы и ищет максимальное совпадение. Чем лучше совпали смысл фразы и визуальный образ, тем выше вероятность, что здесь нужный объект. Детектор становится не каталогом известного, а переводчиком между речью и зрением.

Показательный пример: складской робот получает задание «найти повреждённую по углу коробку с апельсинами». Система, обученная только на классах «коробка» и «апельсин», этого не сделает, ведь сочетание признаков не встречалось в датасете. Модель с открытым словарём понимает фразу, находит коробки, оценивает их состояние по текстовому описанию и выбирает нужную. Такой подход ведёт от жёстких предопределённых функций к живому взаимодействию с миром — важный шаг к универсальному машинному восприятию.