Open-vocabulary detection
Как это работает? Модель обучается на парах «изображение — текст» и учится сопоставлять визуальные фрагменты и слова в едином смысловом пространстве. Когда вы даёте описание, оно превращается в вектор признаков — «слепок смысла». Затем модель превращает области изображения в похожие векторы и ищет максимальное совпадение. Чем лучше совпали смысл фразы и визуальный образ, тем выше вероятность, что здесь нужный объект. Детектор становится не каталогом известного, а переводчиком между речью и зрением.
Показательный пример: складской робот получает задание «найти повреждённую по углу коробку с апельсинами». Система, обученная только на классах «коробка» и «апельсин», этого не сделает, ведь сочетание признаков не встречалось в датасете. Модель с открытым словарём понимает фразу, находит коробки, оценивает их состояние по текстовому описанию и выбирает нужную. Такой подход ведёт от жёстких предопределённых функций к живому взаимодействию с миром — важный шаг к универсальному машинному восприятию.
Поделиться