Zidong Taichu представил метод GMC позволяющий сократить токены на 80% без потери качества
GMC отходит от идеи выбора отдельных лучших токенов и рассматривает все токены как единое коллективное сообщение. Метод включает два этапа. На первом этапе, названном комплементарным адаптивным отбором, учитываются семантика вопроса, визуальное сходство и пространственное положение объектов. Это позволяет распределить бюджет токенов по разным фрагментам изображения, не концентрируясь только на заметных местах. На втором этапе механизм population transport переносит скрытые состояния удаляемых токенов в ближайшие представители, сохраняя детальную информацию.
Ключевое преимущество GMC в том, что он не требует дообучения, внешних OCR-моделей или детекторов и работает с уже обученными архитектурами вроде Qwen2.5-VL и LLaVA. Эксперименты показали, что при сокращении числа визуальных токенов с 1296 до 256, то есть более чем на 80%, модель Qwen2.5-VL-7B сохраняет 97,78% среднего качества, а при снижении до 128 токенов — 99,11%. Для LLaVA-1.5-7B с 128 и 64 токенами результаты достигают 99,76% и 99,82% соответственно. Кроме того, метод снижает визуальные галлюцинации в тестах POPE, HallusionBench и CHAIR.
В сценарии длинных документов с 15 876 визуальными токенами GMC сократил KV-кэш на 73,94%, ускорил инференс в 1,258 раза и сохранил 98,87% качества ответов. По мнению разработчиков, это открывает путь к эффективному масштабированию мультимодальных моделей без взрывного роста вычислительных затрат.
Источник: www.qbitai.com
Поделиться