Рейтинг ИИ-моделей: qwen3.8-max от Alibaba вошел в топ-6, китайские модели в лидерах
В общем зачете по-прежнему доминирует Anthropic: первую тройку занимают claude-fable-5 (1507), claude-opus-4-6-thinking (1505) и claude-opus-4-7-thinking (1502). Четвертое место неожиданно заняла новая модель Meta — muse-spark-1.2 (xHigh) с результатом 1498. Верхняя часть таблицы очень плотная: все участники топ-10 набрали не менее 1488 баллов.
Китайские модели заметно укрепились и в специализированных категориях. В рейтинге кода kimi-k3-max от Moonshot поднялся на шестое место (1542), став лучшей китайской моделью; qwen3.8-max расположился на восьмой позиции. Во фронтенд-разработке qwen3.8-max сразу стал четвертым (1667), а deepseek-v4-flash-high от DeepSeek впервые вошел в топ-10. В агентном рейтинге лидером стал Claude Opus 5 (High) от Anthropic, сместивший Claude Fable 5 (High) на второе место, а Kimi K3 (Max) удержал пятую строчку.
Напомним, что рейтинг Arena основан на анонимном слепом голосовании пользователей, а ELO отражает субъективные предпочтения, а не абсолютное качество. Разные категории оцениваются независимо, поэтому сравнивать результаты между ними напрямую некорректно.
Источник: www.ithome.com
Поделиться