Марковский процесс решений
Интуитивно: у агента есть состояния, в каждом он выбирает действие. Среда отвечает переходом в новое состояние и численным вознаграждением. Вероятности и награды зависят только от текущего состояния и действия. Цель — найти стратегию, максимизирующую суммарное вознаграждение на длинном горизонте. Важно сравнивать немедленный выигрыш с будущими возможностями.
Пример: робот-пылесос. Состояние — позиция и уровень заряда. Действия — ехать, повернуть, встать на зарядку. Вознаграждение — собранная грязь, штраф — столкновение. Среда случайна: проскальзывание колёс, неравномерная пыль. МПР позволяет выбрать оптимальную политику: когда вернуться на базу, а когда продолжить уборку. Такой же подход применяют в управлении запасами, лечении и рекомендательных системах.
Итак, МПР — язык описания решений в случайном мире. Он даёт формальные принципы поиска лучшей стратегии с учётом неопределённости и долгосрочных последствий. Поэтому он стал основой многих интеллектуальных систем.
Поделиться