Квантизация LLM: как запихнуть 70B модель в свою видюху
новости
18.08.2026

Квантизация LLM: как запихнуть 70B модель в свою видюху

Квантизация LLM: как запихнуть 70B модель в свою видюху

Многие полагают, что для запуска больших языковых моделей вроде LLaMA 3 70B или DeepSeek-V3 с сотнями миллиардов параметров необходима серверная стойка с огромными затратами. На самом деле это не всегда так: технология квантизации позволяет ужать модель настолько, что она помещается в видеопамять обычной потребительской видеокарты. Суть метода заключается в снижении точности числовых представлений весов нейросети, что многократно сокращает объем занимаемой памяти без существенной потери качества. Например, веса в формате FP16 занимают 16 бит на значение, а квантизация до INT4 уменьшает их в четыре раза.

Различают два основных подхода к квантизации. PTQ, или пост-обучение, применяется к готовой модели и не требует дообучения. QAT же встраивает квантование прямо в процесс тренировки, что дает более высокую точность, но требует дополнительных вычислительных ресурсов. Для большинства сценариев PTQ оказывается достаточно, особенно с современными алгоритмами, которые минимизируют ошибки округления.

Сложнее дело обстоит с архитектурами на основе смеси экспертов (MoE), такими как DeepSeek-V3 или Mixtral. В таких моделях для каждого входа активируется лишь часть параметров, что само по себе экономит память. Однако квантизация всех экспертов может приводить к неравномерному распределению ошибок, поэтому здесь требуются более тонкие настройки. Тем не менее, примеры успешного запуска подобных гигантов на потребительском железе уже есть.

На прикладном уровне важно выбрать правильный формат хранения модели. GPTQ отлично работает с видеокартами NVIDIA и большинством библиотек инференса. GGUF — универсальный формат, поддерживающий запуск на CPU через llama.cpp, а AWQ балансирует между скоростью и качеством, комбинируя квантование разных слоев. Новичкам стоит начать с GGUF, используя готовые сборки в Ollama, чтобы быстро получить работающую модель.

Таким образом, квантизация открывает путь к запуску самых мощных LLM на обычном домашнем компьютере. Это избавляет от необходимости приобретать серверное оборудование и делает передовые нейросети доступными каждому разработчику. Главное — потратить немного времени на изучение основ и подобрать оптимальную конфигурацию под свою видеокарту.

Источник: habr.com