глоссарий

MDP

MDP

MDP — марковский процесс принятия решений — математическая модель, где агент действует в среде, получая награды или штрафы. Формально он задаётся состояниями, действиями, вероятностями переходов и функцией награды. Эта модель лежит в основе большинства алгоритмов обучения с подкреплением: от игровых ботов до роботов.

MDP даёт единый язык для задач с последовательными решениями. Игра, навигация, торговля, диалог с ассистентом — всё это цепочки решений с обратной связью. Цель агента — максимизировать суммарную награду в долгосрочной перспективе, а не сиюминутный выигрыш.

Интуитивно MDP похоже на игру. Вы агент в лабиринте: клетка — состояние, движение — действие. Движение иногда случайно, например поскользнулись, и попали не туда — это вероятность перехода. За некоторые клетки дают очки — награда. Важно марковское свойство: для решения не нужна вся история, достаточно текущего состояния. Это упрощает анализ.

Пример: робот-пылесос. Состояния — координаты и заряд батареи. Действия — ехать, повернуть, вернуться на базу. Награда — плюс за пыль, минус за падение. Вероятности переходов учитывают, что робот может застрять. Оптимизируя MDP, находим политику: «в этом состоянии делать то-то», максимизирующую общую чистоту и зарядку.

MDP — рабочий инструмент, переводящий поведение в числа. Он объясняет, как принимать решения в условиях случайности и длинных последствий, и остаётся фундаментом современных систем ИИ.