Return
Как это работает интуитивно? Представьте, что агент играет в шахматы. Один ход даёт ему пешку (награда +1), но в итоге он проигрывает партию (конец). Другой ход не приносит немедленной награды (0), но через несколько шагов приводит к мату и победе (+10). Return учитывает обе линии: он складывает все награды, при этом награды из будущего умножаются на коэффициент γ (гамма) меньше единицы. Если γ = 0,9, то победа через три шага добавляет к возврату 10·0,9³ ≈ 7,29, а сиюминутная пешка составляет всего 1. Так агент учится предпочитать дальновидные действия. Дисконт не только отражает неопределённость будущего, но и предотвращает бесконечные суммы, если игра не заканчивается.
Прикладной пример: робот-пылесос. Его награда — очки за убранную площадь и штраф за потраченную энергию. Если он сразу собирает много пыли, но потом застревает, возврат будет низким из-за штрафа. Если же он сначала строит карту комнаты, тратя время на нулевую награду, но затем чистит эффективно, итоговый возврат окажется выше. Алгоритм сравнивает эти варианты и выбирает маршрут с максимальным возвратом, даже если первый шаг кажется непродуктивным.
Итак, Return — это компас интеллектуального агента. Он превращает разрозненные сигналы поощрения в единый критерий качества поведения, позволяя ИИ планировать действия на перспективу, а исследователям — объективно оценивать, насколько умной получилась система.
Поделиться