KV cache quantization
Без сжатия модели упираются в лимит памяти GPU или обычного ПК. С каждым новым словом кэш увеличивается: при контексте в десятки тысяч токенов он занимает десятки гигабайт. Тогда запуск становится невозможным или скорость падает из-за свопа на диск. Квантование кэша — ключевой приём для локального запуска больших моделей и обработки длинных запросов.
Интуитивно это похоже на ведение конспекта: модель записывает детально, но конспект разрастается. Квантование — умение переписать его кратко, оставив основные идеи и округлив второстепенное. Для обычных вопросов искажения незаметны, зато всё умещается и работает быстрее.
Пример: чат-бот на ноутбуке без видеокарты. Без сжатия модель с 7 млрд параметров начинает тормозить уже через несколько сотен слов. С 8-битным квантованием кэша память снижается вдвое — бот ведёт длинную беседу, отвечая чуть менее детально, но быстро и осмысленно.
Вывод: KV cache quantization — компромисс между памятью и точностью, делающий длинные диалоги практичными на обычном оборудовании. Без неё большие модели остались бы доступны только владельцам дорогих серверов, а с ней работают почти где угодно.
Поделиться