глоссарий

Return

Return

В обучении с подкреплением термин «Return» (возврат) обозначает суммарную награду, которую агент получает за последовательность своих действий, причём будущие награды учитываются с дисконтом. Проще говоря, это не мгновенный выигрыш, а итоговая «выручка» за всю серию шагов, пересчитанная к текущему моменту. Понимание этой величины критически важно: именно максимизация возврата является целью агента. Без него невозможно отличить случайное везение от продуманной стратегии, а сравнение разных алгоритмов становится бессмысленным.

Как это работает интуитивно? Представьте, что агент играет в шахматы. Один ход даёт ему пешку (награда +1), но в итоге он проигрывает партию (конец). Другой ход не приносит немедленной награды (0), но через несколько шагов приводит к мату и победе (+10). Return учитывает обе линии: он складывает все награды, при этом награды из будущего умножаются на коэффициент γ (гамма) меньше единицы. Если γ = 0,9, то победа через три шага добавляет к возврату 10·0,9³ ≈ 7,29, а сиюминутная пешка составляет всего 1. Так агент учится предпочитать дальновидные действия. Дисконт не только отражает неопределённость будущего, но и предотвращает бесконечные суммы, если игра не заканчивается.

Прикладной пример: робот-пылесос. Его награда — очки за убранную площадь и штраф за потраченную энергию. Если он сразу собирает много пыли, но потом застревает, возврат будет низким из-за штрафа. Если же он сначала строит карту комнаты, тратя время на нулевую награду, но затем чистит эффективно, итоговый возврат окажется выше. Алгоритм сравнивает эти варианты и выбирает маршрут с максимальным возвратом, даже если первый шаг кажется непродуктивным.

Итак, Return — это компас интеллектуального агента. Он превращает разрозненные сигналы поощрения в единый критерий качества поведения, позволяя ИИ планировать действия на перспективу, а исследователям — объективно оценивать, насколько умной получилась система.