глоссарий

Model-based RL

Model-based RL

Model-based RL — подход в обучении с подкреплением, где агент строит внутреннюю модель среды и использует её для планирования. В отличие от model-free методов, где всё решается методом проб и ошибок, здесь агент сначала предсказывает последствия своих действий, а затем выбирает оптимальный сценарий. Разница та же, что между изучением карты и правил на тренажёре перед поездкой и немедленным вождением автомобиля.

Этот подход сильно повышает эффективность обучения: опасные ситуации можно «проиграть» в голове, не совершая реальных ошибок. Поэтому model-based RL критичен для областей, где цена ошибки высока, — робототехники, управления энергосетями, логистики. Кроме того, модель легко адаптировать: при изменениях среды достаточно обновить её, а не переучиваться с нуля.

Работает это так. Агент исследует среду, собирает наблюдения и строит предсказательную модель — по сути, симулятор реальности. Когда появляется задача, он не действует сразу, а запускает мысленный поиск: перебирает возможные цепочки действий, сравнивает их исходы и выбирает ту, что ведёт к награде. Если предсказания расходятся с реальностью, агент замечает ошибку и исправляет модель.

Хороший пример — робот-курьер. Вместо риска столкновения на каждом перекрёстке он строит модель движения пешеходов и машин и мысленно проверяет десятки маршрутов, выбирая самый безопасный. Если погода меняется (например, дождь делает дорогу скользкой), модель корректируется по новым данным, и следующий план становится точнее.

Итак, model-based RL — это умение агента думать, прежде чем действовать. Именно это отличает интеллектуальное поведение от простого перебора и открывает путь к системам, способным планировать в сложных, меняющихся условиях.