Anthropic штурмует рейтинг Arena: новые Claude Opus 4 в топе
новости
17.08.2026

Anthropic штурмует рейтинг Arena: новые Claude Opus 4 в топе, kimi-k3-max держится в лидерах

Anthropic штурмует рейтинг Arena: новые Claude Opus 4 в топе, kimi-k3-max держится в лидерах

Платформа Arena (arena.ai) опубликовала свежий рейтинг больших языковых моделей за 33-ю неделю 2026 года, то есть за период с 10 по 16 августа. Главная интрига этого выпуска — сразу несколько новых моделей Anthropic из серии claude-opus-4 практически одновременно ворвались в верхнюю часть общего зачета, изменив привычную расстановку сил. При этом китайские модели продолжают уверенно держаться в середине и верхней половине списка, а в некоторых специализированных категориях уже вплотную приблизились к зарубежным лидерам.

В общем рейтинге первую тройку заняли claude-fable-5 с 1506 баллами, следом за ним расположились новинки claude-opus-4-6-high и claude-opus-4-7-high, набравшие 1505 и 1502 балла соответственно. Разрыв между призерами составляет менее пяти пунктов, поэтому организаторы считают такое положение статистической ничьей в пределах погрешности. Неожиданно ярким стал дебют Google gemini-3.7-flash-high, который сразу поднялся на девятую строчку. Среди китайских моделей лучший результат показал kimi-k3-max от Moonshot: он поднялся на две позиции и теперь занимает 12-е место с 1489 баллами. У Alibaba qwen3.8-max расположился на восьмой строчке, хотя и потерял две позиции, а qwen3.7-max-preview опустился на 26-ю. Отдельно отмечено, что qwen3.8-max впервые вошел в десятку рейтинга агентных моделей.

В категории программирования картина оказалась похожей. Лидером по-прежнему остается claude-fable-5 с 1554 баллами, а сразу за ним закрепились claude-opus-4-7-high и claude-opus-4-6-high. Лучшей китайской моделью для написания кода снова стал kimi-k3-max, сохранивший шестое место и даже немного улучшивший свой результат. Заметный скачок совершила модель Meta muse-spark-1.2 (xHigh), которая поднялась на семь строчек и заняла восьмую позицию.

Во фронтенд-разработке китайские модели чувствуют себя особенно уверенно. Первое место удерживает claude-opus-5-max с 1692 баллами, но kimi-k3-max идет вторым с 1674 баллами и отстает всего на 18 пунктов. На третью строчку поднялся qwen3.8-max от Alibaba. Неожиданным дебютантом стала модель DeepSeek deepseek-v4-pro-high-20260813, которая сразу ворвалась в десятку, заняв десятую позицию. В этом же списке на девятом месте находится glm-5.2-max от Zhipu.

В генерации изображений ничего не изменилось на вершине: gpt-image-2 (medium) от OpenAI продолжает лидировать с 1381 баллом. Зато на второе место с ходу вышла новинка Microsoft mai-image-2.6-preview. Среди китайских моделей лучше всего выступили seedream-5.0-pro от ByteDance, занявший восьмую строчку, и qwen-image-3.0-pro, который идет девятым с минимальным отставанием.

В рейтинге видеогенерации главной сенсацией стал flux-3-video от Black Forest Labs, который с первого же появления занял второе место, уступив только gemini-omni-flash от Google. Третью позицию сохранила китайская dreamina-seedance-2.0-720p, а на пятом месте расположился minimax-h3. Организаторы напоминают, что рейтинг Arena строится на основе анонимного слепого голосования пользователей и отражает субъективные предпочтения, а не абсолютное качество моделей. Небольшие различия в баллах находятся в пределах погрешности, поэтому сравнивать результаты разных категорий между собой некорректно.

Источник: www.ithome.com