глоссарий

KV cache quantization

KV cache quantization

KV cache quantization — это сжатие внутренней памяти языковых моделей (кэша ключей и значений). При генерации текста модель сохраняет промежуточные представления обработанных токенов, чтобы не пересчитывать их заново. Кэш быстро растёт и занимает много памяти, особенно в длинных диалогах. Квантование снижает точность чисел (например, с 16 до 8 или 4 бит), уменьшая размер кэша в разы ценой небольшой потери точности.

Без сжатия модели упираются в лимит памяти GPU или обычного ПК. С каждым новым словом кэш увеличивается: при контексте в десятки тысяч токенов он занимает десятки гигабайт. Тогда запуск становится невозможным или скорость падает из-за свопа на диск. Квантование кэша — ключевой приём для локального запуска больших моделей и обработки длинных запросов.

Интуитивно это похоже на ведение конспекта: модель записывает детально, но конспект разрастается. Квантование — умение переписать его кратко, оставив основные идеи и округлив второстепенное. Для обычных вопросов искажения незаметны, зато всё умещается и работает быстрее.

Пример: чат-бот на ноутбуке без видеокарты. Без сжатия модель с 7 млрд параметров начинает тормозить уже через несколько сотен слов. С 8-битным квантованием кэша память снижается вдвое — бот ведёт длинную беседу, отвечая чуть менее детально, но быстро и осмысленно.

Вывод: KV cache quantization — компромисс между памятью и точностью, делающий длинные диалоги практичными на обычном оборудовании. Без неё большие модели остались бы доступны только владельцам дорогих серверов, а с ней работают почти где угодно.