глоссарий

On-policy

On-policy

Когда говорят об обучении с подкреплением, «On-policy» — это способ, которым агент (например, робот или алгоритм) учится на собственном опыте, действуя по текущей стратегии. Проще говоря, агент «пробует» действия, которые сам же выбрал, и использует только эти результаты для улучшения. Если он решил, что лучше идти направо, то и учится на последствиях именно шага направо, а не на том, что было бы, пойди он налево.

Почему это важно? В реальных системах, особенно в робототехнике или играх, цена ошибки может быть высокой. On-policy методы гарантируют, что агент обучается только на тех действиях, которые реально совершает в текущий момент. Это делает обучение более стабильным и безопасным: алгоритм не пытается опираться на «воображаемые» сценарии из прошлого, когда его поведение было другим. Такой подход особенно ценен, когда среда меняется со временем — агент постоянно адаптируется к актуальным условиям, а не использует устаревшие данные.

На интуитивном уровне представьте, что вы учитесь играть на музыкальном инструменте. Вы слушаете только ту музыку, которую сами играете в данный момент, и тут же исправляете ошибки. Вы не пытаетесь учиться, слушая записи себя прошлого, когда вы играли хуже. On-policy — это «учёба в процессе игры», а не «учёба на анализе старых партий».

Классический пример — обучение робота ходить. Робот делает шаг, падает, встаёт и снова пробует, но уже с учётом того, как именно он упал. Каждая попытка генерирует новую информацию, и все эти данные сразу используются для корректировки движений. Если бы он использовал off-policy подход, он мог бы пытаться учиться на шагах, которые «мог бы сделать», но это рискованно и замедляет прогресс.

Итог: On-policy — это философия «учись на том, что делаешь». Она обеспечивает надёжность и прямую связь между действием, результатом и улучшением, что делает её незаменимой для задач, где важна безопасность и быстрая адаптация.