Роботам нельзя ждать: Astribot представил SmoothRL для онлай
новости
05.09.2026

Роботам нельзя ждать: Astribot представил SmoothRL для онлайн-RL при асинхронном выводе

Роботам нельзя ждать: Astribot представил SmoothRL для онлайн-RL при асинхронном выводе

У реального робота нет кнопки паузы. Большие модели действий всё дольше считают следующий отрезок движения, поэтому на практике вывод делают асинхронно: робот продолжает двигаться, пока модель в фоне вычисляет новый action chunk. Но при таком режиме предсказанные и реально выполненные действия не совпадают, и классический онлайн-RL не понимает, какие движения привели к успеху, а какие — к неудаче.

Китайская компания Astribot представила фреймворк SmoothRL. Он делит action chunk на уже зафиксированные, реально исполняемые и отброшенные действия, а обновляет политику только по той части, которую робот действительно выполнил. Обучение при этом строится в том же асинхронном режиме, что и реальная работа, — принцип назвали Reinforce in Deployment.

На роботе S1 точность броска выросла с 39 до 94 процентов, надевания колпачка на ручку — с 8 до 83, вскрытия коробки ножом — с 30 до 90. Среднеквадратичное ускорение снизилось на 52 процента, jerk — на 47. Вместо систематических ошибок остались лишь неточности в несколько миллиметров около нужной позиции.

SmoothRL не учит робота с нуля, а дообучает уже готовую базовую политику на реальных результатах. Метод требует укладываться в заданный бюджет задержки и опирается на замороженную базовую модель, но позволяет роботу улучшаться прямо в работе, не останавливаясь в ожидании следующего предсказания.

Источник: www.qbitai.com