Стратегический альянс QuJing и Moore Threads: китайские AI T
новости
05.09.2026

Стратегический альянс QuJing и Moore Threads: китайские AI Token дешевле зарубежных

Стратегический альянс QuJing и Moore Threads: китайские AI Token дешевле зарубежных

Китайские компании QuJing Technology (趋境科技) и Moore Threads (摩尔线程) объявили о стратегическом партнерстве: они будут совместно развивать «фабрики» по производству высококачественных AI-токенов на национальной вычислительной инфраструктуре. Основой сотрудничества стала связка собственной PD-гетерогенной технологии QuJing с интеллектуальными картами MTT S5000 и программной платформой MUSA от Moore Threads. Как сообщается, решение уже выведено в промышленную эксплуатацию и обслуживает реальный трафик от официальных клиентов ведущих разработчиков больших языковых моделей.

Суть подхода в том, чтобы разделить два этапа генерации: Prefill и Decode. Карты MTT S5000 берут на себя предварительную обработку входных данных и формирование KV-кэша, а за финальную выдачу токенов отвечают GPU с высокой пропускной способностью. Благодаря такой гетерогенной конфигурации удается сократить дорогостоящие ресурсы на этапе Prefill и не строить инфраструктуру под пиковые нагрузки одного из этапов. По данным компаний, ресурсный пул из четырех-пяти MTT S5000 по соотношению цены и производительности на обработку входных токенов обходит импортные передовые решения.

Производственные испытания показали, что связка оборудования выдерживает высокий параллелизм, сверхдлинные контексты и колебания трафика. Заявлены средняя скорость генерации свыше 50 токенов в секунду, попадание в KV-кэш более 90 процентов, стабильность 99,9 процента и низкая задержка первого токена. Это, по мнению участников альянса, подтверждает, что китайские GPU способны не только запускать модели, но и выдавать качественные AI-токены в промышленных масштабах.

Партнеры намерены поставлять совместный продукт Token Pod (Token 超节点) — аппаратно-программный комплекс для создания локальных «токен-фабрик». Он будет адаптироваться под разные комбинации GPU и уже включает наработки по моделированию, межсерверному взаимодействию и эксплуатации. К августу 2026 года QuJing участвовала в проектах, обеспечивающих производство триллионов AI-токенов в сутки, и накопила опыт для масштабирования.

В компаниях подчеркивают, что их стратегия — «меньше моделей, глубже оптимизация»: вместо распыления усилий на множество архитектур они концентрируются на ключевых моделях и реальных бизнес-нагрузках. Альянс рассчитывает расширять применение этой схемы в интернет-компаниях, у разработчиков фундаментальных моделей и в телеком-операторах, переводя гетерогенные вычисления на китайских GPU в более широкую практику.

Источник: www.qbitai.com