глоссарий

Action space

Action space

Пространство действий — это полный набор допустимых решений, которые агент может выбрать в конкретный момент. Проще говоря, «меню» возможных ходов: повернуть, нажать кнопку, открыть дверь. В отличие от реального мира, в задаче машинного обучения выбор всегда ограничен, и эти границы определяют, что алгоритм способен сделать.

Без чёткого пространства действий обучение невозможно: агент не может перебирать варианты, если не знает их список. От размера и типа пространства зависит сложность обучения и скорость решений. Слишком маленькое — лишает гибкости, слишком большое — требует огромных данных и времени. Инженеры проектируют пространство действий под задачу, ища баланс между свободой и эффективностью.

Как это работает? В шахматах в каждой позиции есть конечный набор легальных ходов — это и есть пространство действий. Нельзя ходить пешкой назад. Агент действует так же: смотрит на состояние, проверяет доступные действия и оценивает, какое приближает к цели. В робототехнике пространство может быть непрерывным — тогда агент выбирает не «влево-вправо», а точное значение угла поворота или силы тока.

Пример — автопилот. Его пространство действий: руль, газ, тормоз. Если сделать его дискретным, автопилот сможет лишь сказать «поверни на 20 градусов», но не сможет плавно регулировать скорость. Если непрерывным — появляется бесконечное множество комбинаций, и критически важно задать допустимые пределы, чтобы не выехать на встречную полосу. Поэтому выбору пространства действий уделяют столько внимания: оно буквально определяет безопасность.

Итог: пространство действий — фундаментальный инструмент, очерчивающий круг возможностей ИИ. Понимание его устройства объясняет, почему одни алгоритмы учатся быстро, а другие застревают, почему одни роботы ловки, а другие роняют предметы. Грамотно выбранное пространство действий — половина успеха любой системы искусственного интеллекта.