глоссарий

Flamingo

Flamingo

Flamingo — семейство мультимодальных моделей от DeepMind, которые понимают картинки и текст одновременно и учатся по нескольким примерам, без дообучения под каждую задачу.

Зачем это важно: мир состоит из смешанных данных — фото с подписями, видео с речью, таблицы с текстом. Раньше модели были узкими специалистами: одни видели, другие читали. Flamingo доказал, что мощные готовые модели можно объединить тонкими настраиваемыми прослойками, не переучивая гигантов с нуля. Это экономит ресурсы и приближает ИИ к гибкости человека.

Как это работает интуитивно: представьте переводчика (языковая модель) и художника с фотографической памятью (зрительная модель). Чтобы они сработались, не нужно учить их всему языку друг друга — достаточно нанять тренера, который быстро объяснит правила перевода картинок в слова. В Flamingo такой тренер — адаптеры: небольшой набор обучаемых слоёв, которые перекодируют изображения в язык текстовой модели, пока сами гиганты остаются замороженными.

Пример: биолог показывает модели пять подписанных фото редкого вида животных, и она находит этот вид на сотнях новых кадров, отвечая на вопросы: сколько особей, чем заняты. Раньше для этого требовалась бы отдельная обучающая выборка и дорогое дообучение.

Вывод: Flamingo — мост между зрением и языком, который учится на ходу. Несколько хороших примеров плюс умные адаптеры заменяют целую систему переобучения — ИИ становится гибче и ближе к человеческому обучению.