734 пакета зависимостей: почему локальный ИИ глупее официаль
новости
30.08.2026

734 пакета зависимостей: почему локальный ИИ глупее официальной версии

734 пакета зависимостей: почему локальный ИИ глупее официальной версии

Пользователи часто замечают, что локально запущенная модель работает хуже официальной, хотя веса и видеокарта те же. Энтузиаст thr3e выяснил, почему это происходит. Он протестировал Qwen3.6-27B на RTX PRO 6000 Blackwell, зафиксировав более 100 тысяч токенов. Оказалось, что даже минимальные различия в вычислениях с плавающей точкой, порядке операций и наборе инструкций меняют выходные токены на ключевых позициях. Всего-то смена attention backend — и модель начинает ошибаться: правильный интерфейс GigabitEthernet0/0/1.201 превращается в 0/1/4, а инструмент вызывается неверно.

Дальше — квантование KV-кэша. BF16 стабильно, INT8 справляется с ошибками, а INT4 на длинном контексте полностью ломает работу. Сравнение пяти методов квантования весов дало сюрприз: популярный NVIDIA NVFP4 показал худший результат, к 88 тысячам токенов почти половина позиций выбирала неверный токен, а самодельный INT8 оказался лучше официальных вариантов. Усугубляет ситуацию и число видеокарт: при переходе с одной на две карты тест проваливался, а на четырех снова проходил из-за особенностей коммуникаций NCCL.

Исследователь напоминает: в типовом образе vLLM 734 программных пакета, и каждый может внести свою лепту в расхождение. Поэтому заявленные на HuggingFace показатели KL-дивергенции нельзя воспринимать буквально — без полного описания окружения, методики и контекста такие цифры неинформативны. А локальные пользователи, экономящие память на квантовании, рискуют получить не просто «более глупую» модель, а систематически опасные ошибки в агентных сценариях.

Источник: www.qbitai.com