глоссарий

Cross-modal retrieval

Cross-modal retrieval

Cross-modal retrieval — это поиск информации, где запрос и результат относятся к разным типам данных: например, фото по текстовому описанию, аудио по картинке или видео по смыслу фразы. Система не ищет по тегам и названиям, а понимает содержание объекта и сопоставляет его с запросом другой природы.

Важность подхода растёт: мир полон изображений, видео и звуков, и находить нужное без ручной разметки крайне сложно. Cross-modal retrieval связывает форматы, делая поиск естественным: вы описываете словами то, что хотите увидеть или услышать, без технических формулировок.

Как это работает? Нейросеть помещает все объекты в единое многомерное пространство. Текст «собака» и фото собаки имеют разную природу (слова и пиксели), но сеть превращает их в числовые векторы, располагая похожие по смыслу рядом. Обучение идёт на миллионах пар «текст-картинка» или «звук-видео»: для соответствующих пар расстояние сокращается, для несоответствующих — растёт. При запросе «пушистый кот на подоконнике» фраза становится вектором, и система находит ближайшие к нему векторы изображений.

Пример: стоковые фотобанки используют эту технологию. Запрос «азиатская девушка в красном платье с велосипедом на фоне небоскрёбов» выдаёт реальные фотографии с такими элементами, а не просто совпадения слов в названиях.

Коротко: cross-modal retrieval — это мост между разными форматами информации. Он позволяет обращаться к мультимедиа на человеческом языке, не зная заранее, как называются нужные объекты.