Dueling DQN
Подход особенно полезен, когда многие действия не влияют на результат. Например, в видеоигре пустая комната или враг — поворот камеры одинаково бесполезен. Обычный DQN тратит ресурсы на изучение всех нюансов, что медленно и нестабильно. Dueling DQN быстро выучивает, какие состояния опасны или выгодны, и лишь затем уточняет значимые действия, что ускоряет и стабилизирует обучение при огромном числе состояний.
Архитектура сети представляет два «рукава» после общего слоя: один вычисляет V(s), второй — A(s,a). Итог — сумма V + A минус среднее преимущество, чтобы избежать дублирования и тривиальных решений. Агенту не нужно перепробовать все действия, чтобы понять безнадёжность состояния.
Пример — гоночный симулятор: на прямой руль нейтрален, важны только повороты. Dueling DQN быстро усваивает, что быть на прямой хорошо, в стене плохо, и настраивает повороты. Обычный DQN тратит время на исследование каждого нажатия педалей и руля даже там, где это не влияет. В итоге Dueling DQN сокращает время обучения и часто даёт более высокий результат на сложных задачах с редкими наградами. Это простое улучшение широко используется в современных исследованиях и игровых ботах.
Поделиться