глоссарий

Policy gradient

Policy gradient

Policy gradient — метод обучения с подкреплением, в котором агент (робот или алгоритм) учится принимать решения напрямую. Вместо оценки ценности состояний он настраивает политику — правила выбора действий: увеличивает вероятность удачных шагов и уменьшает провальных. Проще: это не «что будет, если сделаю X», а «как действовать в целом, чтобы получать больше награды».

Метод важен для задач с непрерывными пространствами действий, где перебор невозможен. Например, управление роботизированной рукой с семью суставами: нельзя пронумеровать все позы. Policy gradient плавно подстраивает движения, сглаживая ошибки, и находит оптимальную траекторию.

Интуиция — дрессировка собаки: сначала случайные действия, дрессировщик подкрепляет удачные и игнорирует неудачи. Агент «прокручивает» эпизод, запоминает последовательность действий, затем подталкивает политику в сторону тех, после которых итоговая награда оказалась высокой. Ключевой трюк — статистически понять, какая череда решений привела к успеху, чтобы в следующий раз выбрать их с большей вероятностью.

Классический пример — обучение нейросети играть в «Пинг-понг» (Atari). Сеть не знает правил, просто управляет ракеткой, вначале хаотично. После проигрыша градиент снижает вероятность действий, приведших к пропуску мяча; после выигрыша — повышает вероятность успешных серий. Тысячи циклов — и сеть виртуозно отбивает мяч.

Вывод: policy gradient — элегантный и мощный способ учиться методом проб и ошибок; лежит в основе современных систем от игровых ботов до робототехники.