734 пакета зависимостей: почему локальный ИИ глупее официальной версии
Дальше — квантование KV-кэша. BF16 стабильно, INT8 справляется с ошибками, а INT4 на длинном контексте полностью ломает работу. Сравнение пяти методов квантования весов дало сюрприз: популярный NVIDIA NVFP4 показал худший результат, к 88 тысячам токенов почти половина позиций выбирала неверный токен, а самодельный INT8 оказался лучше официальных вариантов. Усугубляет ситуацию и число видеокарт: при переходе с одной на две карты тест проваливался, а на четырех снова проходил из-за особенностей коммуникаций NCCL.
Исследователь напоминает: в типовом образе vLLM 734 программных пакета, и каждый может внести свою лепту в расхождение. Поэтому заявленные на HuggingFace показатели KL-дивергенции нельзя воспринимать буквально — без полного описания окружения, методики и контекста такие цифры неинформативны. А локальные пользователи, экономящие память на квантовании, рискуют получить не просто «более глупую» модель, а систематически опасные ошибки в агентных сценариях.
Источник: www.qbitai.com
Поделиться