Qwen3.8-27B открыли: локально на RTX 4090 тянет агента уровня Opus
Главное, что радует энтузиастов, — запуск не требует дата-центра. После квантизации Qwen3.8-27B помещается в 24 гигабайта видеопамяти, так что локально её потянут RTX 3090 или RTX 4090. В Сети уже шутят, что получили модель уровня Opus на домашней машине. В 27B появился и настраиваемый режим мышления: Thinking включён по умолчанию, а глубину рассуждений можно менять через reasoning_effort — от максимального xhigh до быстрого low. Для простых вопросов мышление отключается полностью. Функция preserve_thinking сохраняет ход рассуждений между шагами длинного агентного процесса, чтобы код-агент, правящий десяток файлов, не терял нить.
В операторных и мультимодальных тестах Qwen тоже показывает зубы: OSWorld-Verified 84,3 против 72,7 у Opus 4.6 Max, AndroidWorld 81,9 против 62,0. В визуальной математике при включённом CI модель набирает 94,6, в общей визуальной рассуждалке — 85,6 против 65,7 без него. Архитектурно это 64 слоя, построенные как «три линейных attention с Gated DeltaNet плюс один полный»: такой гибрид снимает нагрузку на длинных последовательностях и позволяет удержать огромный контекст. Для продакшена заявлены SGLang, vLLM и Transformers, на Hugging Face уже лежат квантованные веса — так что поэкспериментировать можно прямо на домашней видеокарте или Mac с большим объёмом памяти.
Источник: www.qbitai.com
Поделиться