глоссарий

Dueling DQN

Dueling DQN

Dueling DQN — улучшение классического DQN, которое позволяет оценивать ценность действий быстрее и точнее. Вместо прямой оценки полезности каждого действия алгоритм разделяет её на ценность состояния V(s) и преимущество действия A(s,a): насколько выгодно находиться в этой ситуации и насколько конкретное действие лучше среднего. Это похоже на выбор ресторана: отдельно оценивается атмосфера места и отдельно — что заказать.

Подход особенно полезен, когда многие действия не влияют на результат. Например, в видеоигре пустая комната или враг — поворот камеры одинаково бесполезен. Обычный DQN тратит ресурсы на изучение всех нюансов, что медленно и нестабильно. Dueling DQN быстро выучивает, какие состояния опасны или выгодны, и лишь затем уточняет значимые действия, что ускоряет и стабилизирует обучение при огромном числе состояний.

Архитектура сети представляет два «рукава» после общего слоя: один вычисляет V(s), второй — A(s,a). Итог — сумма V + A минус среднее преимущество, чтобы избежать дублирования и тривиальных решений. Агенту не нужно перепробовать все действия, чтобы понять безнадёжность состояния.

Пример — гоночный симулятор: на прямой руль нейтрален, важны только повороты. Dueling DQN быстро усваивает, что быть на прямой хорошо, в стене плохо, и настраивает повороты. Обычный DQN тратит время на исследование каждого нажатия педалей и руля даже там, где это не влияет. В итоге Dueling DQN сокращает время обучения и часто даёт более высокий результат на сложных задачах с редкими наградами. Это простое улучшение широко используется в современных исследованиях и игровых ботах.