Zhipu выпустила GLM-5.3-Flash при поддержке китайских мощнос
новости
28.08.2026

Zhipu выпустила GLM-5.3-Flash при поддержке китайских мощностей SenseTime

Zhipu выпустила GLM-5.3-Flash при поддержке китайских мощностей SenseTime

26 августа китайская компания Zhipu официально выпустила и открыла исходный код модели GLM-5.3-Flash (320B-A18B) — первой нативной мультимодальной модели серии GLM-5. С 320 миллиардами параметров она превосходит предыдущую GLM-5.2 и набирает 57 баллов в рейтинге Artificial Analysis Intelligence Index, сравнявшись с показателем Claude Opus 4.8 от Anthropic. Архитектура модели создана для экстремально низкой стоимости вычислений: в сочетании с новым мультимодальным обучением на 30 трлн токенов она обеспечивает более высокую производительность при меньших затратах.

Инфраструктуру для запуска GLM-5.3-Flash предоставила платформа SenseTime (商汤大装置), задействовав передовые гетерогенные смешанные вычисления и крупномасштабную поддержку национальных вычислительных мощностей. В основе сотрудничества — концепция SenseTime из трех компонентов: единая модель, «фабрика токенов» и система управления агентами. Фабрика токенов объединяет разные чипы, кластеры и источники энергии, оптимизируя производство высококачественных токенов по низкой цене и адаптируясь к итерациям мультимодальных моделей.

До официального релиза GLM-5.3-Flash тестировалась под анонимным именем Ox-Alpha (в китайских сообществах — «Нюлай») на платформах OpenCode и OpenRouter. Суммарный объем запросов достиг 62 трлн токенов, и все они обрабатывались исключительно на китайских чипах. По сравнению с исходным уровнем в том же аппаратном окружении конечная производительность сервиса выросла втрое, а стоимость одного токена достигла уровня популярных GPU NVIDIA. По словам представителей SenseTime, это подтверждает, что отечественные вычисления способны эффективно и экономично поддерживать вывод передовых больших моделей в реальных масштабных сценариях.

SenseTime заявляет, что их гетерогенная технология обеспечивает соотношение цена/производительность в 1,25 раза выше, чем у серии NVIDIA H, а при равных затратах объем производства токенов примерно в 2,5 раза больше, чем при гомогенных вычислениях. В июле ежедневный объем токен-сервисов SenseTime достиг 2,42 трлн, к концу 2026 года компания планирует выйти на 10 трлн в сутки.

Источник: www.qbitai.com