MDP
MDP даёт единый язык для задач с последовательными решениями. Игра, навигация, торговля, диалог с ассистентом — всё это цепочки решений с обратной связью. Цель агента — максимизировать суммарную награду в долгосрочной перспективе, а не сиюминутный выигрыш.
Интуитивно MDP похоже на игру. Вы агент в лабиринте: клетка — состояние, движение — действие. Движение иногда случайно, например поскользнулись, и попали не туда — это вероятность перехода. За некоторые клетки дают очки — награда. Важно марковское свойство: для решения не нужна вся история, достаточно текущего состояния. Это упрощает анализ.
Пример: робот-пылесос. Состояния — координаты и заряд батареи. Действия — ехать, повернуть, вернуться на базу. Награда — плюс за пыль, минус за падение. Вероятности переходов учитывают, что робот может застрять. Оптимизируя MDP, находим политику: «в этом состоянии делать то-то», максимизирующую общую чистоту и зарядку.
MDP — рабочий инструмент, переводящий поведение в числа. Он объясняет, как принимать решения в условиях случайности и длинных последствий, и остаётся фундаментом современных систем ИИ.
Поделиться