SARSA
Важность термина в том, что он обеспечивает обучение в реальном времени. В отличие от других методов, которые ждут полного завершения эпизода, SARSA улучшает свои оценки на каждом шагу. Благодаря этому алгоритм подходит для систем, где нужно мгновенно реагировать и где ошибки дорого обходятся.
Как это работает интуитивно? Представьте человека с закрытыми глазами, который движется по лабиринту. Он делает шаг, получает награду или дискомфорт и запоминает: «в этой точке поворот налево привёл к лёгкому уколу». Но при оценке он учитывает и следующий шаг. Это похоже на шахматиста, который оценивает ход в связке со следующим планом. SARSA обучается, следуя собственной политике, а не идеальной — поэтому осторожен и избегает рискованных зон.
Прикладной пример: робот-пылесос. SARSA позволяет ему со временем запоминать, что ковёр — хорошо, а край лестницы — плохо. Робот начинает с хаоса, но после сотен проходов формирует карту полезных действий, обходя опасности.
Вывод: SARSA — это базовый, но мощный механизм обучения, который сочетает простоту и гибкость. Он лежит в основе многих систем и показывает главную идею ИИ: знания рождаются из опыта, а не из правил.
Поделиться