глоссарий

DDPG

DDPG

DDPG — алгоритм обучения с подкреплением для непрерывных действий: вместо «вверх/вниз» агент выбирает точные значения (угол, силу, скорость). Расшифровка — Deep Deterministic Policy Gradient, то есть «глубокий детерминированный градиент политики». Нейросеть учится выбирать одно лучшее действие для каждого состояния.

Он важен, потому что реальные задачи обычно непрерывны: автопилоту или роботу нельзя управлять дискретными кнопками, нужно плавно менять параметры. Классические методы вроде DQN работают лишь с конечным набором действий, а DDPG заполняет этот пробел, соединяя глубокие нейросети и детерминированную политику.

Как это работает? Есть две сети: актёр и критик. Актёр, глядя на состояние, предлагает действие. Критик оценивает, насколько оно хорошо, предсказывая будущую награду. Сначала они действуют случайно, но актёр постепенно улучшает свои предложения по «советам» критика. Используется буфер опыта: агент запоминает шаги и случайно выбирает их из памяти, чтобы не забывать прошлые успехи и ошибки — это даёт стабильность обучения.

Пример — обучение четырёхногого робота ходьбе. Каждый сустав требует точного момента вращения. DDPG получает сигналы датчиков и выдаёт непрерывные команды для всех суставов, чтобы робот шёл вперёд и не падал. Со временем он находит эффективную походку, максимизирующую пройденное расстояние при минимальных усилиях.

Итак, DDPG — мощный инструмент для плавного и точного управления: от промышленных роботов до симуляторов. Он требует аккуратной настройки и множества проб, но, разобравшись, вы получите гибкого агента, способного на очень тонкие действия.