Как нейросеть учится играть в крестики-нолики без учителя
В основе методов лежит представление партии как процесса с отложенным вознаграждением. Все ходы до конца не получают оценки, а итоговая победа, поражение или ничья формируют сигнал для обучения. Чтобы связать ранние решения с далеким исходом, используются уравнение Беллмана и так называемая TD-ошибка. Вместо ожидания финального результата сеть оценивает текущее состояние через прогноз следующего, что позволяет учиться на каждом шаге.
Рассматриваются два принципиально разных подхода к представлению знаний. Первый — оценка ценности состояния V(s), когда сеть судит о позиции в целом и для выбора хода перебирает возможные варианты. Второй — оценка ценности действия Q(s,a), при которой сеть сразу понимает, насколько хорош конкретный ход в данной позиции. Q-learning относится ко второму типу и считается методом без модели среды, так как для выбора действия не нужно знать правила игры, достаточно уметь их применять.
Автор объясняет и важный компромисс между исследованием и использованием. Во время обучения сеть иногда делает случайные ходы, чтобы набрать больше опыта, а иногда опирается на уже накопленные знания. Такая стратегия позволяет избегать преждевременной остановки на неоптимальной тактике.
На примере крестиков-ноликов разбираются методы Monte Carlo, разные вариации TD(0) и Q-learning. Отдельно подсвечивается разница между бутстрэппингом и прямым подсчетом итогового результата: первый дает смещенную, но менее шумную оценку, второй — несмещенную, но с большей дисперсией. Материал будет полезен всем, кто хочет интуитивно понять ключевые идеи обучения с подкреплением.
Источник: habr.com
Поделиться