глоссарий

Dense reward

Dense reward

Плотное вознаграждение — это частый сигнал от среды, который сообщает агенту, насколько удачным было его последнее действие. В отличие от разреженного вознаграждения, где оценка приходит лишь в конце эпизода, плотное подается на каждом шаге, словно тренер, подсказывающий спортсмену после каждой попытки, а не подводящий итог в финале.

Важность термина в том, что без плотного сигнала обучение напоминает поиск выхода в темной комнате. Если награда выдается только в конце, агент не понимает, какие промежуточные действия привели к успеху. Плотное вознаграждение сужает пространство поиска и позволяет искусственному интеллекту находить закономерности через несколько тысяч шагов, а не через миллионы.

Механизм интуитивно понятен. Представьте, что вы учите ребенка собирать пирамидку. Если хвалить за каждое правильно надетое кольцо, он быстро уловит закономерность. Если же вручить конфету лишь после полной сборки, обучение затянется. Алгоритм, получая частые оценки, связывает конкретное действие с результатом и начинает повторять те движения, за которые получал поощрение.

Прикладной пример — роботизированная рука, осваивающая захват стакана. Здесь плотное вознаграждение — расстояние между манипулятором и целью. Чем ближе стакан к захвату, тем выше награда на каждом шаге. Рука постепенно корректирует траекторию, и навык закрепляется. При разреженном же сигнале (успех или неудача) она двигалась бы хаотично очень долго.

Вывод: плотное вознаграждение незаменимо, когда требуется быстрая обратная связь. Но разработчику стоит помнить о риске: слишком частые подсказки порой заставляют агента жульничать, добиваясь награды простым способом, так и не решив реальную задачу.