Квантизация LLM: как запихнуть 70B модель в свою видюху
Различают два основных подхода к квантизации. PTQ, или пост-обучение, применяется к готовой модели и не требует дообучения. QAT же встраивает квантование прямо в процесс тренировки, что дает более высокую точность, но требует дополнительных вычислительных ресурсов. Для большинства сценариев PTQ оказывается достаточно, особенно с современными алгоритмами, которые минимизируют ошибки округления.
Сложнее дело обстоит с архитектурами на основе смеси экспертов (MoE), такими как DeepSeek-V3 или Mixtral. В таких моделях для каждого входа активируется лишь часть параметров, что само по себе экономит память. Однако квантизация всех экспертов может приводить к неравномерному распределению ошибок, поэтому здесь требуются более тонкие настройки. Тем не менее, примеры успешного запуска подобных гигантов на потребительском железе уже есть.
На прикладном уровне важно выбрать правильный формат хранения модели. GPTQ отлично работает с видеокартами NVIDIA и большинством библиотек инференса. GGUF — универсальный формат, поддерживающий запуск на CPU через llama.cpp, а AWQ балансирует между скоростью и качеством, комбинируя квантование разных слоев. Новичкам стоит начать с GGUF, используя готовые сборки в Ollama, чтобы быстро получить работающую модель.
Таким образом, квантизация открывает путь к запуску самых мощных LLM на обычном домашнем компьютере. Это избавляет от необходимости приобретать серверное оборудование и делает передовые нейросети доступными каждому разработчику. Главное — потратить немного времени на изучение основ и подобрать оптимальную конфигурацию под свою видеокарту.
Источник: habr.com
Поделиться