глоссарий

TextVQA

TextVQA

TextVQA — задача ИИ: алгоритм отвечает на вопрос, используя текст, изображённый на картинке. В отличие от обычного распознавания объектов, системе нужно «читать» таблички, вывески, этикетки, счета и связывать прочитанное с вопросом. Это сложно: необходимо одновременно понимать сцену, распознавать мелкий шрифт и логически соединять текст с запросом.

Это важно, потому что в реальной жизни мы часто опираемся на визуальный текст: номера домов, дозировки, цены. Без этого роботы беспомощны в навигации, медицине и логистике. TextVQA — шаг от простого распознавания изображений к практическому взаимодействию со средой.

Механизм можно представить как диалог двух нейросетей. Зрительная сеть разбивает изображение, находит и извлекает надписи. Языковая сеть обрабатывает вопрос, сопоставляет его с распознанными словами и другими объектами и решает, на что смотреть. Например, на вопрос «Сколько стоит кофе?» модель находит слово «кофе» в меню, затем соседние цифры и отвечает, отличая цену от номера стола по контексту.

Пример: слабовидящий человек наводит камеру на указатель в метро. Система понимает вопрос «Куда ведёт табличка?», считывает надпись «Выход к театру» и озвучивает ответ. На складе робот спрашивает «Какая это зона?» и получает точный ответ, а не просто распознанный текст, благодаря встроенной логике вопроса.

Вывод: TextVQA объединяет зрение, чтение и рассуждение. Это незаметно делает технологию полезной в повседневных сценариях — от складов до ассистентов. Модели ещё ошибаются на сложных шрифтах, но TextVQA ведёт к машинам, понимающим не только картинку, но и её смысл.