Китайский стартап предложил единый рецепт для универсальных роботов
Единица данных для компании — не траектория, а взаимодействие: демонстрация засчитывается, только если мир изменился как задумано. Предобучение должно давать готовую способность, а не просто инициализацию. Поведение моделируется через физические события, а не фиксированные отрезки времени.
Главный барьер — стоимость и качество данных. Чтобы их получить, разработана система UMI: человек надевает оснастку с двумя захватами и показывает действия. Ключевое — контроль качества: записанные траектории проигрывают на реальном роботе, и валидны лишь те, что реально завершают задачу. Небольшой чистый набор данных ценнее большого зашумлённого. Человеческие демонстрации дополняют малым количеством данных с конкретного робота: результат сравним с полностью роботным набором при примерно двадцатикратном снижении стоимости.
Мировая модель WALL-WM работает с событиями — дотянуться, схватить, поставить — а не с фиксированными по времени движениями. К текст-в-видео модели подключена сеть действий, которая читает видеопризнаки, не затирая их. Есть режим для длинных рассуждений и режим реального времени.
Пока результаты измерены на собственных роботах компании. Нужно независимое тестирование.
Источник: spectrum.ieee.org
Поделиться