Dense reward
Важность термина в том, что без плотного сигнала обучение напоминает поиск выхода в темной комнате. Если награда выдается только в конце, агент не понимает, какие промежуточные действия привели к успеху. Плотное вознаграждение сужает пространство поиска и позволяет искусственному интеллекту находить закономерности через несколько тысяч шагов, а не через миллионы.
Механизм интуитивно понятен. Представьте, что вы учите ребенка собирать пирамидку. Если хвалить за каждое правильно надетое кольцо, он быстро уловит закономерность. Если же вручить конфету лишь после полной сборки, обучение затянется. Алгоритм, получая частые оценки, связывает конкретное действие с результатом и начинает повторять те движения, за которые получал поощрение.
Прикладной пример — роботизированная рука, осваивающая захват стакана. Здесь плотное вознаграждение — расстояние между манипулятором и целью. Чем ближе стакан к захвату, тем выше награда на каждом шаге. Рука постепенно корректирует траекторию, и навык закрепляется. При разреженном же сигнале (успех или неудача) она двигалась бы хаотично очень долго.
Вывод: плотное вознаграждение незаменимо, когда требуется быстрая обратная связь. Но разработчику стоит помнить о риске: слишком частые подсказки порой заставляют агента жульничать, добиваясь награды простым способом, так и не решив реальную задачу.
Поделиться