Qwen3.5/3.6 на 16Гб VRAM: кванты, fine-tune, сравнение и немного про Gemma-4
Автор отмечает, что зоопарк моделей разрастается стремительно: базовых не так много, зато их варианты квантования и тысячи fine-tune модификаций на HuggingFace обещают высокую скорость инференса, «думалку» от DeepSeek, Claude или Fable и интеллект уровня передовых систем. В центре внимания оказались свежие Qwen3.5 и Qwen3.6, которые удалось запустить на видеокарте с 16 ГБ VRAM благодаря квантованию. По словам автора, квантованные версии этих моделей стабильно работают и выдают вполне годный код, что подтвердилось в ходе его тестов. Также он сравнил их с Gemma-4, найдя у каждой своих сторонников среди его экспериментов.
В заключение он обещает в следующем материале раскрыть подробности сравнения, точные настройки и результаты замеров производительности на ограниченном объёме памяти, чтобы другие энтузиасты могли повторить его опыт.
Источник: habr.com
Поделиться