глоссарий

Image captioning

Image captioning

Image captioning (в переводе с английского — «подписывание изображений») — это задача искусственного интеллекта: алгоритм получает фотографию и создаёт её связное текстовое описание. Например, на снимке, где мальчик с собакой, модель напишет: «Ребёнок играет с псом на пляже». Важно, что это не просто перечисление объектов, а осмысленный рассказ о сцене, действиях и отношениях между элементами.

Зачем нужно? Прежде всего, оно помогает людям с нарушениями зрения — озвучивает картинки в соцсетях и на сайтах. Ещё это автоматическое создание подписей к фотографиям и описаний товаров, а также более точный поиск изображений по тексту.

Как работает? Система состоит из двух нейросетей. Свёрточная сеть «рассматривает» картинку и превращает её в компактный набор признаков — очертания, цвета, положение объектов. Затем генератор текста на основе трансформера пошагово предсказывает слова, ориентируясь на эти признаки и на уже написанную фразу, как автоподсказка в смартфоне. Механизм внимания при этом выбирает важные зоны изображения, когда нужно уточнить, например, кто совершает действие.

Пример: приложение для незрячих. Направив камеру в парк, человек получает голосовое описание: «На лужайке белая собака ловит мяч». Это простая и полезная иллюстрация технологии.

Итак, image captioning — мост между зрением и языком. Он позволяет машинам описывать мир по картинкам, что приближает нас к по-настоящему понимающему ИИ.