глоссарий

Post-training quantization

Post-training quantization

Квантование после обучения (post-training quantization) — это сжатие уже готовой нейросети: её веса переводят из точного числового формата в более грубый, но компактный. Например, из 32-битных чисел с плавающей точкой в 8-битные целые. Модель занимает меньше памяти и работает быстрее, а точность падает незначительно. Сжатие происходит без долгого переобучения, что экономит время и вычислительные ресурсы.

Зачем это нужно? Современные большие модели весят сотни гигабайт, и запустить их можно только на мощных серверах. Квантование после обучения позволяет уместить такую модель в обычный смартфон или браузер, делая ИИ массовым. Это особенно важно для больших языковых моделей, которые слишком тяжелы для повседневных устройств.

Как это работает? Представьте, что вы записываете рост людей с точностью до миллиметра, а потом решаете округлять до сантиметра. Привычные задачи не пострадают, а запись станет проще. Так и сеть: вместо тысяч уникальных весов используется ограниченный набор уровней, подобранный так, чтобы сохранить важные диапазоны значений. Главное — выбрать правильную шкалу, иначе сеть начнёт ошибаться.

Пример: модель на 70 миллиардов параметров занимает около 140 гигабайт. После квантования до 4 бит на параметр — всего 35 гигабайт. Такую модель уже можно запустить на домашнем компьютере с видеокартой.

Вывод: квантование после обучения — быстрый и дешёвый способ адаптировать тяжёлую нейросеть к реальным устройствам. Именно поэтому ИИ сегодня работает прямо в вашем телефоне.