Qwen3.5/3.6 на 16Гб VRAM: кванты, fine-tune, сравнение и нем
новости
13.08.2026

Qwen3.5/3.6 на 16Гб VRAM: кванты, fine-tune, сравнение и немного про Gemma-4

Qwen3.5/3.6 на 16Гб VRAM: кванты, fine-tune, сравнение и немного про Gemma-4

Разработчик небольших игр на основе d10-механик, в которых сражения между виртуальными персонажами проходят в автоматическом режиме, поделился опытом выбора локальной нейросети для своих проектов. Изначально он полагался на облачный чат одной китайской модели со значком в виде кита, но постоянные ошибки вроде «server is busy... try later» вынудили его искать бесплатное и безлимитное решение. В итоге он переключился на локальные инструменты вроде OpenCode и недавно вышедшего LM Studio Bionic, после чего встал вопрос о выборе базовой модели.

Автор отмечает, что зоопарк моделей разрастается стремительно: базовых не так много, зато их варианты квантования и тысячи fine-tune модификаций на HuggingFace обещают высокую скорость инференса, «думалку» от DeepSeek, Claude или Fable и интеллект уровня передовых систем. В центре внимания оказались свежие Qwen3.5 и Qwen3.6, которые удалось запустить на видеокарте с 16 ГБ VRAM благодаря квантованию. По словам автора, квантованные версии этих моделей стабильно работают и выдают вполне годный код, что подтвердилось в ходе его тестов. Также он сравнил их с Gemma-4, найдя у каждой своих сторонников среди его экспериментов.

В заключение он обещает в следующем материале раскрыть подробности сравнения, точные настройки и результаты замеров производительности на ограниченном объёме памяти, чтобы другие энтузиасты могли повторить его опыт.

Источник: habr.com