TD3
Интуиция: два «критика» (нейросети) оценивают действие, агент берёт минимальную оценку — как спросить двух экспертов и выбрать осторожный вариант, чтобы не переоценить успех. Актёр (сеть, выбирающая действия) обновляется реже, чем критики, — это снижает шум и ошибки, которые заставляют агента дёргаться и терять хорошие стратегии.
Пример: промышленный манипулятор обучается вставлять деталь в отверстие с точным усилием и углом. TD3 принимает изображения и данные с датчиков, выдаёт непрерывные команды моторам. За тысячи эпизодов робот выполняет операцию стабильно, не ломая хрупкие заготовки; навык переносится из симуляции в реальность.
Вывод: TD3 — стандартный и эффективный метод для непрерывного управления, от беспилотников до производственных роботов. Двойная оценка ценности и осторожное обновление политики обеспечивают устойчивость обучения при простоте идеи.
Поделиться