глоссарий

TD3

TD3

TD3 (Twin Delayed Deep Deterministic Policy Gradient) — алгоритм обучения с подкреплением для непрерывных действий: сила, угол, скорость. В отличие от дискретных выборов, каждое действие здесь — число, например «повернуть на 0,7 радиана». Главная проблема таких задач — нестабильность обучения из‑за переобучения на собственных ошибках; TD3 её решает и делает политику агента надёжной.

Интуиция: два «критика» (нейросети) оценивают действие, агент берёт минимальную оценку — как спросить двух экспертов и выбрать осторожный вариант, чтобы не переоценить успех. Актёр (сеть, выбирающая действия) обновляется реже, чем критики, — это снижает шум и ошибки, которые заставляют агента дёргаться и терять хорошие стратегии.

Пример: промышленный манипулятор обучается вставлять деталь в отверстие с точным усилием и углом. TD3 принимает изображения и данные с датчиков, выдаёт непрерывные команды моторам. За тысячи эпизодов робот выполняет операцию стабильно, не ломая хрупкие заготовки; навык переносится из симуляции в реальность.

Вывод: TD3 — стандартный и эффективный метод для непрерывного управления, от беспилотников до производственных роботов. Двойная оценка ценности и осторожное обновление политики обеспечивают устойчивость обучения при простоте идеи.