Double DQN
Интуитивно это напоминает работу двух специалистов. Один предлагает кандидатов, другой оценивает их независимо. В DQN один и тот же эксперт и выбирает, и оценивает действие, поэтому он непроизвольно завышает оценку. В Double DQN сеть, которая выбирает действие, и сеть, которая вычисляет его ценность, разделены: первая указывает, какой шаг кажется лучшим, а вторая даёт этому конкретному шагу объективную оценку. Такой приём уменьшает смещение, и алгоритм не обманывает сам себя.
Представьте робота, собирающего детали на конвейере. Простой DQN может посчитать, что схватить блестящую деталь — всегда отличная идея, но иногда она лишь отвлекает от главной цели. Double DQN помогает избегать подобных ловушек: робот оценивает реальную пользу каждого движения и строит более надёжный план, даже когда вознаграждение запаздывает.
Кратко: Double DQN — это простая, но мощная поправка к DQN, которая повышает стабильность обучения и качество решений в сложных средах, от видеоигр до промышленных роботов.
Поделиться