Sparse reward
Это важно, потому что в реальном мире большинство задач именно такие: шахматист узнаёт об успехе на мате, робот на складе — только когда поставил коробку в нужное место. Без понимания sparse reward нельзя построить системы для длинных цепочек действий. Интуитивно это похоже на поиск иголки в стоге сена без подсказок. Если награды слишком редки, обучение замирает или требует огромного числа попыток. Чтобы ускорить процесс, добавляют промежуточные награды за приближение к цели, учат предсказывать будущую награду или исследовать незнакомые состояния, но суть проблемы остаётся.
Классический пример — робот, который учится собирать кубик: награда даётся только в момент успешного захвата. Первые тысячи эпизодов он бесцельно двигает рукой, но постепенно находит путь к редкому сигналу и начинает повторять удачные движения. Так в 2015 году DeepMind обучила нейросеть играть в видеоигры, где награда доставалась лишь за съеденную точку.
Вывод: sparse reward — фундаментальный вызов обучению с подкреплением. Понимание этой проблемы приближает нас к алгоритмам, способным действовать в сложном реальном мире, где награды не раздают просто так.
Поделиться