Post-training quantization
Зачем это нужно? Современные большие модели весят сотни гигабайт, и запустить их можно только на мощных серверах. Квантование после обучения позволяет уместить такую модель в обычный смартфон или браузер, делая ИИ массовым. Это особенно важно для больших языковых моделей, которые слишком тяжелы для повседневных устройств.
Как это работает? Представьте, что вы записываете рост людей с точностью до миллиметра, а потом решаете округлять до сантиметра. Привычные задачи не пострадают, а запись станет проще. Так и сеть: вместо тысяч уникальных весов используется ограниченный набор уровней, подобранный так, чтобы сохранить важные диапазоны значений. Главное — выбрать правильную шкалу, иначе сеть начнёт ошибаться.
Пример: модель на 70 миллиардов параметров занимает около 140 гигабайт. После квантования до 4 бит на параметр — всего 35 гигабайт. Такую модель уже можно запустить на домашнем компьютере с видеокартой.
Вывод: квантование после обучения — быстрый и дешёвый способ адаптировать тяжёлую нейросеть к реальным устройствам. Именно поэтому ИИ сегодня работает прямо в вашем телефоне.
Поделиться