глоссарий

COCO caption

COCO caption

COCO caption — это подпись к фотографии из датасета Microsoft COCO: около 330 тысяч изображений, к каждому прилагается пять ручных описаний на английском. Это пары «картинка + текст», на которых нейросети учатся связывать визуальное с языком.

Термин важен, потому что именно на таких данных обучают модели, способные описывать фото для незрячих, искать кадры по запросу или контролировать склад. COCO caption стал эталонным «учебником»: он большой, разнообразный и размечен вручную, поэтому используется как стандарт в научных работах по машинному зрению.

Как это работает? Ребёнку показывают мяч и говорят: «Мальчик бросает красный мяч». Повторяя тысячи раз, он связывает детали со словами. Нейросеть делает то же математически: превращает пиксели в абстрактные понятия, слова — в векторы, и учится выстраивать соответствие. Чем больше подписей, тем точнее понимается контекст: мяч — предмет, «бросает» — действие.

Пример: вы фотографируете сломанный уличный фонтан и отправляете в городское приложение. Модель, обученная на COCO caption, формулирует: «Фонтан с водой в городской зоне, видимо, неисправен» — и автоматически создаёт заявку. Специалисты получают понятный текст вместо галочки «проблема».

COCO caption — не просто подписи, а мост между зрением и языком. Он позволяет машине переводить визуальный опыт в человеческий текст. Благодаря таким данным нейросети перестают быть «слепыми» и видят мир в понятных нам терминах.