глоссарий

Off-policy

Off-policy

Off-policy — это способ обучения агента в искусственном интеллекте, при котором он использует опыт, собранный не своей текущей стратегией, а какой-либо другой. Проще говоря, агент учится на «чужих» или «старых» действиях, а не только на тех, что совершает прямо сейчас. Это ключевое отличие от on-policy методов, которые обучаются строго на собственных текущих решениях.

Почему это важно? В реальном мире пробовать все самому дорого и опасно: робот не должен разбиться, чтобы понять, что падать плохо. Off-policy позволяет извлекать уроки из уже имеющихся данных — чужих записей, прошлых попыток или симуляций. Это экономит время, ресурсы и делает обучение безопаснее. Именно на этом принципе работают многие современные алгоритмы, например DQN, которые могут пересматривать старую память миллионы раз.

Интуитивно это похоже на обучение вождению не только за рулем, но и наблюдая за другими водителями: вы мысленно проигрываете их ошибки и успехи, даже если сами не выполняли этих маневров. Агент в off-policy режиме может в любой момент «вспомнить» эпизод, собранный другой политикой, и обновить свои знания, не повторяя этот опыт в реальности. При этом важно, что он оценивает ценность действий так, как будто сам их выбирал, корректируя смещение от чужой стратегии.

Прикладной пример — рекомендательная система в онлайн-кинотеатре. Она может обучаться на логах взаимодействий пользователей, собранных старой версией алгоритма или даже случайными действиями тестеров. Новый алгоритм пересматривает эти записи и улучшает свои предсказания, не требуя, чтобы сначала он сам показал конкретный фильм. Это позволяет быстро адаптироваться к новым данным, используя прошлый опыт как дешевый тренажер.

Кратко: off-policy — это умение учиться на чужом опыте. Такой подход делает обучение гибким и экономичным, отделяя процесс сбора данных от процесса его осмысления. Именно поэтому он стал фундаментом для многих прорывов в обучении с подкреплением.