глоссарий

Double DQN

Double DQN

Double DQN — это алгоритм обучения с подкреплением, наследник классической Deep Q-Network (DQN). Он помогает агенту выбирать действия, но исправляет главный недостаток предшественника: склонность переоценивать вознаграждение. Эта ошибка возникает из-за операции максимума, которая всегда выбирает самый яркий вариант, даже если он случаен. Систематическая переоценка ведёт к плохой стратегии и нестабильному обучению. Поэтому Double DQN важен: он делает оценку ценности действий честнее, обеспечивая более правильные решения.

Интуитивно это напоминает работу двух специалистов. Один предлагает кандидатов, другой оценивает их независимо. В DQN один и тот же эксперт и выбирает, и оценивает действие, поэтому он непроизвольно завышает оценку. В Double DQN сеть, которая выбирает действие, и сеть, которая вычисляет его ценность, разделены: первая указывает, какой шаг кажется лучшим, а вторая даёт этому конкретному шагу объективную оценку. Такой приём уменьшает смещение, и алгоритм не обманывает сам себя.

Представьте робота, собирающего детали на конвейере. Простой DQN может посчитать, что схватить блестящую деталь — всегда отличная идея, но иногда она лишь отвлекает от главной цели. Double DQN помогает избегать подобных ловушек: робот оценивает реальную пользу каждого движения и строит более надёжный план, даже когда вознаграждение запаздывает.

Кратко: Double DQN — это простая, но мощная поправка к DQN, которая повышает стабильность обучения и качество решений в сложных средах, от видеоигр до промышленных роботов.