Q-learning
Этот термин важен потому, что лежит в основе всего современного обучения с подкреплением. Именно Q-обучение помогло создать игровые ИИ, например системы, обыгрывающие чемпионов в го и шахматах. Агент не получает готовых ответов, а сам открывает стратегию даже тогда, когда награда приходит с большой задержкой.
Интуитивно это похоже на поиск лучшего маршрута в незнакомом городе ради вкусного ужина. Вы пробуете улицы, ошибаетесь, но запоминаете, какие перекрёстки приближают к цели. Точно так же агент действует в среде: совершает действие, получает положительную или отрицательную награду и обновляет Q-значение через уравнение, смешивая свежий опыт со старыми ожиданиями. Постепенно таблица ценностей начинает указывать на лучший выбор из каждого состояния.
Практический пример: робот-пылесос учится убирать квартиру. Он случайно стукается о мебель (штраф) и находит места с грязью (награда). Через серию проб Q-таблица помогает ему избегать препятствий и эффективно покрывать все зоны, даже если итоговая награда за чистоту начисляется только в конце прохода.
Итак, Q-learning — простой, но фундаментальный метод, позволяющий агенту учиться на опыте с отложенным успехом. Он лёг в основу глубинных Q-сетей и до сих пор остаётся ключевым инструментом в арсенале искусственного интеллекта.
Поделиться