глоссарий

Q-function

Q-function

Q-функция, или Q-значение, — это понятие из обучения с подкреплением, раздела искусственного интеллекта. Она показывает, какой суммарной награды в будущем стоит ожидать агенту, если в данном состоянии он совершит конкретное действие, а затем будет действовать оптимально.

Зачем же нужна Q-функция? Без неё агент не может разумно выбирать действия. Сравнивая Q-значения для всех возможных вариантов, он всегда выбирает тот, что сулит максимум выгоды. Таким образом, задача обучения сводится к постепенной настройке таблицы Q-функции, поэтому эта функция лежит в основе многих алгоритмов искусственного интеллекта.

Интуитивно Q-функцию можно представить как навигатор в незнакомом городе. Для каждой развилки он показывает, насколько перспективен каждый поворот с учётом всего дальнейшего пути. Сначала оценки приблизительны, но с каждым новым опытом — полученной наградой или штрафом — они становятся точнее. Так работает обучение: чем больше проб и ошибок, тем надёжнее прогноз.

Вот практический пример. Робот-пылесос использует Q-функцию, чтобы решить, куда поехать. В углу комнаты, где обычно много грязи, значение будет высоким, а возле проводов — низким. Робот совершает действие с максимальным Q-значением, накапливает опыт и со временем вырабатывает эффективную стратегию уборки.

Подведём итог. Q-функция — это фундаментальный инструмент обучения с подкреплением: благодаря ей агент принимает осознанные решения, опираясь на прошлый опыт. Она превращает случайные действия в целенаправленную стратегию и широко применяется в робототехнике, автоматизации и игровых системах.