Off-policy
Почему это важно? В реальном мире пробовать все самому дорого и опасно: робот не должен разбиться, чтобы понять, что падать плохо. Off-policy позволяет извлекать уроки из уже имеющихся данных — чужих записей, прошлых попыток или симуляций. Это экономит время, ресурсы и делает обучение безопаснее. Именно на этом принципе работают многие современные алгоритмы, например DQN, которые могут пересматривать старую память миллионы раз.
Интуитивно это похоже на обучение вождению не только за рулем, но и наблюдая за другими водителями: вы мысленно проигрываете их ошибки и успехи, даже если сами не выполняли этих маневров. Агент в off-policy режиме может в любой момент «вспомнить» эпизод, собранный другой политикой, и обновить свои знания, не повторяя этот опыт в реальности. При этом важно, что он оценивает ценность действий так, как будто сам их выбирал, корректируя смещение от чужой стратегии.
Прикладной пример — рекомендательная система в онлайн-кинотеатре. Она может обучаться на логах взаимодействий пользователей, собранных старой версией алгоритма или даже случайными действиями тестеров. Новый алгоритм пересматривает эти записи и улучшает свои предсказания, не требуя, чтобы сначала он сам показал конкретный фильм. Это позволяет быстро адаптироваться к новым данным, используя прошлый опыт как дешевый тренажер.
Кратко: off-policy — это умение учиться на чужом опыте. Такой подход делает обучение гибким и экономичным, отделяя процесс сбора данных от процесса его осмысления. Именно поэтому он стал фундаментом для многих прорывов в обучении с подкреплением.
Поделиться