Value function
Без неё агент близорук: видит только сиюминутное вознаграждение и не понимает, что ведёт к долгосрочному успеху. Value function позволяет сравнивать стратегии ещё до применения, выбирать действия, приближающие к цели, и делает обучение стабильным. Вся современная робототехника, игры и автономные системы полагаются на неё как на компас.
Интуитивно это видно в шахматах. Новичок думает: «съесть пешку — сразу плюс очко». Опытный оценивает позицию: можно взять пешку, но потерять контроль над центром и через десять ходов проиграть. Value function — формализованный взгляд вперёд: она присваивает каждому состоянию число, которое говорит, насколько этот путь хорош в среднем при разумной игре.
Прикладной пример — робот-пылесос. Его цель — убрать квартиру с минимальным расходом энергии. Комнаты — состояния, уборка — серия действий. Value function подсказывает, что в гостиной большая грязь, но уборка «дорогая» по энергии, а в коридоре чисто, зато рядом розетка. Оценив будущие выгоды, робот сначала уберёт гостиную, потом останется у розетки, а не застрянет в дальней спальне. Без этой функции он действовал бы хаотично, хватая быстрые, но бесполезные награды.
Итог: value function — сердце обучения с подкреплением. Она превращает опыт в предвидение и позволяет агенту действовать с расчётом, а не импульсивно. Именно благодаря ей машины учатся принимать сложные решения в мире, где последствия каждого шага проявляются не сразу.
Поделиться