12 тестов для китайских LLM: Kimi K3, GLM-5.2, DeepSeek V4 Pro и Qwen 3.8 Max
Выбор именно этих моделей не случаен. В финале предыдущего материала редакция поинтересовалась у читателей, каких героев они хотели бы увидеть в следующей части. Подавляющее большинство голосов набрали DeepSeek и Qwen, однако итоговый список решили расширить, включив в него также Kimi и GLM. Это четвёртый выпуск серии: раньше были протестированы Opus 4.8, GPT 5.5 и Gemini 3.1 Pro, затем состоялась очная дуэль Claude Fable 5 и GPT 5.5 Pro, а в третьей части сравнивались три поколения Sonnet с российскими GigaChat 2 MAX и YandexGPT Pro 5.1. Каждый материал вызывал живое обсуждение, поэтому новый раунд ожидаемо привлёк пристальное внимание.
Особый акцент в испытаниях был сделан на владении китайским языком, который является родным для всех четырёх участников. Однако модели также проверялись на английском и русском, ведь для международного рынка важна универсальность. Дополнительно фиксировались скорость генерации, стабильность ответов и устойчивость к сложным вопросам, призванным сбить модель с толку. Все тесты выполнялись в автоматическом режиме с идентичными параметрами, чтобы обеспечить максимальную объективность сравнения.
Предварительные результаты показывают, что китайские LLM больше не воспринимаются как дешёвая альтернатива западным разработкам. Они уверенно справляются с задачами на логику и программирование, а в работе с иероглифическими текстами часто превосходят зарубежных конкурентов. При этом между участниками существуют заметные различия в подходах: одни делают ставку на универсальность, другие — на глубокую специализацию. Ни одна из моделей не стала безоговорочным лидером во всех дисциплинах, что делает итоговую картину особенно интересной для анализа.
Полные результаты с детальными таблицами по каждому тесту будут представлены в расширенной версии материала. Редакция рассчитывает, что это сравнение поможет разработчикам и исследователям лучше понять текущий уровень китайских LLM и спрогнозировать дальнейшее развитие отрасли. Цикл испытаний на этом не заканчивается: уже сейчас открыт сбор пожеланий по следующим участникам. Судя по активности аудитории, тема сравнения языковых моделей остаётся одной из самых востребованных, и впереди нас ждёт немало новых громких имён.
Источник: habr.com
Поделиться