Policy gradient
Метод важен для задач с непрерывными пространствами действий, где перебор невозможен. Например, управление роботизированной рукой с семью суставами: нельзя пронумеровать все позы. Policy gradient плавно подстраивает движения, сглаживая ошибки, и находит оптимальную траекторию.
Интуиция — дрессировка собаки: сначала случайные действия, дрессировщик подкрепляет удачные и игнорирует неудачи. Агент «прокручивает» эпизод, запоминает последовательность действий, затем подталкивает политику в сторону тех, после которых итоговая награда оказалась высокой. Ключевой трюк — статистически понять, какая череда решений привела к успеху, чтобы в следующий раз выбрать их с большей вероятностью.
Классический пример — обучение нейросети играть в «Пинг-понг» (Atari). Сеть не знает правил, просто управляет ракеткой, вначале хаотично. После проигрыша градиент снижает вероятность действий, приведших к пропуску мяча; после выигрыша — повышает вероятность успешных серий. Тысячи циклов — и сеть виртуозно отбивает мяч.
Вывод: policy gradient — элегантный и мощный способ учиться методом проб и ошибок; лежит в основе современных систем от игровых ботов до робототехники.
Поделиться