Как роботы учатся навыкам через взаимодействие с миром? Интервью с Цзяхэном Ху
Классический подход — обучать политику в симуляции, а затем переносить на реального робота. Но для каждой задачи требуется создавать высокоточную модель среды, что занимает дни и месяцы. А задачи с деформируемыми объектами или насыщенными контактами, например переливание воды или вытирание доски, крайне трудно симулировать точно. Поэтому исследователи обратились к реальному взаимодействию. Прямое обучение в физическом мире затрудняют две вещи: неэффективность по числу проб (роботу нужно много взаимодействий) и безопасность — случайные действия могут его сломать.
Метод SLAC обходит эти ограничения. Сначала в низкоточной симуляции с помощью неконтролируемого обучения с подкреплением формируется латентное пространство действий. Специальная цель обучения поощряет безопасные и структурированные поведенческие примитивы. Затем это пространство используется как набор действий для реального обучения: робот осваивает конкретные задачи, выбирая из предобученных безопасных движений. Так удается избежать опасных исследований и быстрее обучаться.
Эксперименты проводились на роботе Tiago с двумя руками и высокой степенью свободы. Он должен был вытирать большую доску, убирать стол и сметать мусор в мешок. За час взаимодействия с миром метод достигал более чем 80 процентов успешных попыток. Предыдущие подходы справиться не могли и часто рисковали повредить робота. По словам Цзяхэна Ху, в будущем он планирует использовать фундаментальные модели вроде vision-language-action, чтобы роботы могли самосовершенствоваться без участия человека.
Источник: robohub.org
Поделиться