Actor-Critic
Подход объединяет обучение через стратегию и через оценку ценности состояний, поэтому работает стабильнее и быстрее, чем методы, использующие только один принцип. На нём основаны современные алгоритмы вроде PPO и A3C, применяемые в робототехнике, играх и автономном управлении.
Интуитивно это похоже на ученика-пианиста (актор) и преподавателя (критик). Ученик играет, преподаватель даёт оценку, не указывая конкретные клавиши. Ученик корректирует игру, а преподаватель со временем оценивает точнее. Так и агент: актор получает награду от среды, но критические оценки критика помогают действовать лучше, особенно при редких наградах.
Пример — обучение робота ходить. Актор выдаёт команды на сервоприводы, критик оценивает, насколько движение удачно (не упал ли, не потратил ли энергию). Критик не знает правильной траектории, но актор постепенно находит устойчивые способы ходьбы после множества симуляций.
Итог: актор-критик — мощная схема, где одна нейросеть действует, другая оценивает. Такое разделение труда позволяет обучать сложные стратегии — от игр до управления дронами — и остаётся одним из самых практичных инструментов ИИ.
Поделиться