глоссарий

Sparse reward

Sparse reward

Sparse reward — это ситуация в обучении с подкреплением, когда агент получает сигнал о правильности действий очень редко, например только в конце длинного эпизода. Представьте, что вы учите щенка приносить мяч, но хвалите его лишь после того, как он вернул мяч в руку, игнорируя все промежуточные шаги. Агент действует почти вслепую, перебирая варианты, пока случайно не дождётся положительного сигнала.

Это важно, потому что в реальном мире большинство задач именно такие: шахматист узнаёт об успехе на мате, робот на складе — только когда поставил коробку в нужное место. Без понимания sparse reward нельзя построить системы для длинных цепочек действий. Интуитивно это похоже на поиск иголки в стоге сена без подсказок. Если награды слишком редки, обучение замирает или требует огромного числа попыток. Чтобы ускорить процесс, добавляют промежуточные награды за приближение к цели, учат предсказывать будущую награду или исследовать незнакомые состояния, но суть проблемы остаётся.

Классический пример — робот, который учится собирать кубик: награда даётся только в момент успешного захвата. Первые тысячи эпизодов он бесцельно двигает рукой, но постепенно находит путь к редкому сигналу и начинает повторять удачные движения. Так в 2015 году DeepMind обучила нейросеть играть в видеоигры, где награда доставалась лишь за съеденную точку.

Вывод: sparse reward — фундаментальный вызов обучению с подкреплением. Понимание этой проблемы приближает нас к алгоритмам, способным действовать в сложном реальном мире, где награды не раздают просто так.