Модель мира уходит после обучения, и робот становится успешн
новости
05.09.2026

Модель мира уходит после обучения, и робот становится успешнее

Модель мира уходит после обучения, и робот становится успешнее

Модель мира обычно работает как внутренний симулятор: робот заранее проигрывает будущее и только потом действует. Компания Guangxiang Technology и группа профессора Ли Шэнбо из Университета Цинхуа представили Phi-WM 1.0 ActEffect. Она учится на последствиях действий, а затем уходит из управляющего контура, оставляя опыт в весах стратегии.

Во время обучения политика выдаёт три движения: быстрый ответ, черновик и уточнённую версию. Модель предсказывает результаты каждого, сравнивает их с реальным будущим из демонстраций и подсказывает, какой из вариантов точнее. Языковая инструкция остаётся на стороне VLA, а сцена кодируется в признаках DINOv3 — без генерации картинки.

На тестах успешность достигла 98,8 процента на LIBERO, 80,3 на LIBERO-PLUS с семью типами распределённых сдвигов и 67,5 на RoboCasa-GR1 с 29-мерным пространством действий. Без сигнала о последствиях показатель на LIBERO падает до 97 процентов.

Такая схема объясняется экономикой производства. Каждый дополнительный прогон модели на линии добавляет задержку и требует графических ресурсов; при десятках роботов расходы становятся серьёзными. Поэтому тяжёлый модуль оставляют на этапе обучения. Робот Phi-Bot X1 уже отработал на выставке в сварочном сценарии для NIO три дня подряд, в сумме 21,5 часа, без сбоев. Теперь ActEffect должен подтвердить надёжность на реальной линии.

Источник: www.qbitai.com