Reward shaping
Метод важен там, где награда приходит только в конце эпизода и алгоритму непонятно, какие действия привели к успеху. Без подсказок обучение может занять миллионы попыток или застрять. Reward shaping дробит большую задачу на мелкие и поощряет за каждое движение в нужную сторону.
Интуитивно это похоже на дрессировку собаки: если хвалить только за то, что она донесла мяч до ног, она растеряется. Но если давать лакомство за каждый шаг — к мячу, за взятие в пасть, за бег к вам — обучение пойдёт быстрее. Нейросеть, как собака, лучше ориентируется на «вкусняшку» за приближение к цели, чем на редкую большую награду в финале.
Пример: робот-манипулятор учится вставлять деталь в паз. Финальная награда — только за успешную сборку. Инженеры добавляют shaping: немного за касание детали, за поднос к пазу, за правильный угол. Через несколько тысяч эпизодов робот осваивает сборку, тогда как без промежуточных сигналов он бы хаотично дёргался.
Вывод: reward shaping — искусственный «пряник» на пути к большой цели. Он ускоряет обучение, но требует осторожности. Если поощрять не то, агент найдёт лазейку и начнёт халтурить, накручивая лёгкие награды. Это методичный инструмент, а не волшебная палочка.
Поделиться