глоссарий

Марковский процесс решений

Марковский процесс решений

Марковский процесс решений — это модель, где агент последовательно принимает решения, а результат действия зависит только от текущего состояния и выбранного шага, а не от предыстории. Это свойство называют марковским: будущее не зависит от прошлого при известном настоящем. На этой модели построено почти всё современное обучение с подкреплением — от игровых алгоритмов до автономных автомобилей. Без неё нельзя формализовать выбор стратегии в случайной среде с отложенными последствиями.

Интуитивно: у агента есть состояния, в каждом он выбирает действие. Среда отвечает переходом в новое состояние и численным вознаграждением. Вероятности и награды зависят только от текущего состояния и действия. Цель — найти стратегию, максимизирующую суммарное вознаграждение на длинном горизонте. Важно сравнивать немедленный выигрыш с будущими возможностями.

Пример: робот-пылесос. Состояние — позиция и уровень заряда. Действия — ехать, повернуть, встать на зарядку. Вознаграждение — собранная грязь, штраф — столкновение. Среда случайна: проскальзывание колёс, неравномерная пыль. МПР позволяет выбрать оптимальную политику: когда вернуться на базу, а когда продолжить уборку. Такой же подход применяют в управлении запасами, лечении и рекомендательных системах.

Итак, МПР — язык описания решений в случайном мире. Он даёт формальные принципы поиска лучшей стратегии с учётом неопределённости и долгосрочных последствий. Поэтому он стал основой многих интеллектуальных систем.