глоссарий

Мультимодальность

Мультимодальность

Мультимодальность в ИИ — способность модели работать с данными разных типов: текстом, изображениями, звуком, видео. Вместо обработки каждого вида по отдельности нейросеть объединяет их в единую картину, например, «видит» фото и «слышит» подпись, выдавая осмысленный результат.

Это важно, так как человек воспринимает мир через несколько органов чувств. Чтобы ИИ взаимодействовал с людьми и понимал реальность, ему нужно выйти за рамки одной модальности. Мультимодальность позволяет системам отвечать на сложные вопросы, распознавать сарказм по тону, оценивать настроение по лицу и словам. Без неё помощник услышал бы фразу, но упустил бы контекст улыбки.

Принцип работы: модель формирует «общий шкаф» — пространство векторов. Текст, изображения и звук преобразуются в числа и выравниваются так, чтобы слово «кошка» и фото пушистого зверя оказались рядом. Запрос ищет перекрёстные соответствия, синтезируя ответ: описание по картинке или картинку по тексту.

Пример: диагностика в медицине. Врач загружает снимок МРТ и историю болезни. Модель видит аномалию и одновременно «читает» симптомы, объединяя данные для более точного прогноза, чем при работе с одной модальностью. Это снижает риск ошибки.

Мультимодальность делает ИИ гибким и человекоцентричным: объединяя разные формы информации, модель видит мир объёмно. В этом направлении — будущее ИИ.