глоссарий

A2C

A2C

A2C (Advantage Actor-Critic) — алгоритм обучения с подкреплением, где агент сочетает актёра (выбор действий) и критика (оценка ситуации). Ключевая идея — преимущество: разница между реальным результатом действия и ожидаемым средним. Она показывает, лучше или хуже действие, чем обычно.

Алгоритм важен, так как решает проблему неустойчивости из-за редких и запаздывающих наград. Без критика агент тонет в шуме случайных оценок и учится медленно. A2C стабильнее и быстрее, применяется в играх и робототехнике.

Интуиция: шахматист — актёр, тренер — критик. Тренер сравнивает: «Этот ход улучшил шансы на 5% по сравнению с обычными». Разница и есть преимущество. Положительное усиливает действие, отрицательное ослабляет. Агент учится на сюрпризах.

Пример: робот учится захватывать предмет. Награда только в конце, перебор потребовал бы тысячи попыток. Критик оценивает каждый шаг: после движения кисти вероятность успеха выросла. Через сотни эпизодов робот уверенно берёт деталь.

A2C — мощный и относительно простой способ обучения в средах с неочевидной наградой, сочетающий интуицию актёра и оценку критика. Служит надёжным фундаментом для продвинутых алгоритмов.