GRASP: новый метод градиентного планирования для мир-моделей на длинных горизонтах
Современные мир-модели уже умеют предсказывать длинные последовательности будущих наблюдений в визуальных пространствах и обобщаться на разные задачи. Они становятся всё более похожи на универсальные симуляторы. Однако наличие мощной предсказательной модели само по себе не означает, что её легко использовать для управления и планирования. На практике долгосрочное планирование остаётся хрупким: оптимизация становится плохо обусловленной, нежадная структура задач порождает локальные минимумы, а в высокоразмерных скрытых пространствах возникают трудноуловимые сбои.
Проблема усугубляется тем, что при развёртывании модели на длинном горизонте граф вычислений становится глубоким и плохо обусловленным: градиенты могут экспоненциально затухать или взрываться. На коротких горизонтах часто достаточно жадного движения к цели, но длинные задачи требуют нежадного поведения — обойти препятствие, перестроиться, отступить для более удачного манёвра. С ростом горизонта расширяется и пространство оптимизации, а ландшафт функции потерь становится всё более изрезанным.
Решение GRASP состоит в том, чтобы рассматривать ограничение динамики как мягкое и оптимизировать функцию штрафа одновременно по действиям и состояниям. Такой приём в литературе по планированию и робототехнике называют коллокацией. У такой формулировки те же глобальные минимумы, что и у исходной задачи, но совсем другой ландшафт оптимизации. Каждое обращение к модели зависит только от локальных переменных, поэтому все вычисления можно выполнять параллельно по времени. Кроме того, обучающий сигнал больше не проходит через единую глубокую композицию из множества шагов: вместо произведения якобианов появляется сумма локальных членов. Это даёт значительное ускорение на длинных горизонтах и заметно упрощает поиск решений.
Источник: robohub.org
Поделиться