глоссарий

Q-learning

Q-learning

Q-learning (Q-обучение) — это алгоритм обучения с подкреплением, в котором агент оценивает полезность действий в каждом состоянии. Он запоминает значение Q — ожидаемую сумму будущих наград, если выбрать действие и далее действовать оптимально.

Этот термин важен потому, что лежит в основе всего современного обучения с подкреплением. Именно Q-обучение помогло создать игровые ИИ, например системы, обыгрывающие чемпионов в го и шахматах. Агент не получает готовых ответов, а сам открывает стратегию даже тогда, когда награда приходит с большой задержкой.

Интуитивно это похоже на поиск лучшего маршрута в незнакомом городе ради вкусного ужина. Вы пробуете улицы, ошибаетесь, но запоминаете, какие перекрёстки приближают к цели. Точно так же агент действует в среде: совершает действие, получает положительную или отрицательную награду и обновляет Q-значение через уравнение, смешивая свежий опыт со старыми ожиданиями. Постепенно таблица ценностей начинает указывать на лучший выбор из каждого состояния.

Практический пример: робот-пылесос учится убирать квартиру. Он случайно стукается о мебель (штраф) и находит места с грязью (награда). Через серию проб Q-таблица помогает ему избегать препятствий и эффективно покрывать все зоны, даже если итоговая награда за чистоту начисляется только в конце прохода.

Итак, Q-learning — простой, но фундаментальный метод, позволяющий агенту учиться на опыте с отложенным успехом. Он лёг в основу глубинных Q-сетей и до сих пор остаётся ключевым инструментом в арсенале искусственного интеллекта.