Роботам нельзя ждать: Astribot представил SmoothRL для онлайн-RL при асинхронном выводе
Китайская компания Astribot представила фреймворк SmoothRL. Он делит action chunk на уже зафиксированные, реально исполняемые и отброшенные действия, а обновляет политику только по той части, которую робот действительно выполнил. Обучение при этом строится в том же асинхронном режиме, что и реальная работа, — принцип назвали Reinforce in Deployment.
На роботе S1 точность броска выросла с 39 до 94 процентов, надевания колпачка на ручку — с 8 до 83, вскрытия коробки ножом — с 30 до 90. Среднеквадратичное ускорение снизилось на 52 процента, jerk — на 47. Вместо систематических ошибок остались лишь неточности в несколько миллиметров около нужной позиции.
SmoothRL не учит робота с нуля, а дообучает уже готовую базовую политику на реальных результатах. Метод требует укладываться в заданный бюджет задержки и опирается на замороженную базовую модель, но позволяет роботу улучшаться прямо в работе, не останавливаясь в ожидании следующего предсказания.
Источник: www.qbitai.com
Поделиться