Zidong Taichu представил метод GMC позволяющий сократить ток
новости
12.08.2026

Zidong Taichu представил метод GMC позволяющий сократить токены на 80% без потери качества

Zidong Taichu представил метод GMC позволяющий сократить токены на 80% без потери качества

Команда Zidong Taichu (紫东太初) из Института автоматизации Китайской академии наук представила метод GMC (Grounded Message Coreset Pruning), который позволяет резко сократить количество визуальных токенов в мультимодальных моделях без существенной потери точности. Современные модели кодируют изображения в сотни и тысячи токенов, что увеличивает расход памяти и замедляет вывод. Традиционный подход Top-K, отбирающий самые важные токены, часто дублирует информацию из ярких областей и теряет важные детали вроде текста или пространственных отношений.

GMC отходит от идеи выбора отдельных лучших токенов и рассматривает все токены как единое коллективное сообщение. Метод включает два этапа. На первом этапе, названном комплементарным адаптивным отбором, учитываются семантика вопроса, визуальное сходство и пространственное положение объектов. Это позволяет распределить бюджет токенов по разным фрагментам изображения, не концентрируясь только на заметных местах. На втором этапе механизм population transport переносит скрытые состояния удаляемых токенов в ближайшие представители, сохраняя детальную информацию.

Ключевое преимущество GMC в том, что он не требует дообучения, внешних OCR-моделей или детекторов и работает с уже обученными архитектурами вроде Qwen2.5-VL и LLaVA. Эксперименты показали, что при сокращении числа визуальных токенов с 1296 до 256, то есть более чем на 80%, модель Qwen2.5-VL-7B сохраняет 97,78% среднего качества, а при снижении до 128 токенов — 99,11%. Для LLaVA-1.5-7B с 128 и 64 токенами результаты достигают 99,76% и 99,82% соответственно. Кроме того, метод снижает визуальные галлюцинации в тестах POPE, HallusionBench и CHAIR.

В сценарии длинных документов с 15 876 визуальными токенами GMC сократил KV-кэш на 73,94%, ускорил инференс в 1,258 раза и сохранил 98,87% качества ответов. По мнению разработчиков, это открывает путь к эффективному масштабированию мультимодальных моделей без взрывного роста вычислительных затрат.

Источник: www.qbitai.com