Награда
Без награды алгоритм не знает, к чему стремиться. Ему приходится перебирать миллиарды вариантов вслепую. Награда превращает хаотичный поиск в осмысленное движение. Именно она отличает обучение с учителем от обучения с подкреплением, где есть только сигнал о качестве действий.
Как работает на интуитивном уровне? Представьте щенка: принёс мяч — получил лакомство, значит, «таскать мяч — хорошо»; окрик — связь ослабевает. В ИИ то же самое: агент делает шаг, получает число — положительное или отрицательное — и обновляет свою «карту ценности» состояний. Награда может быть мгновенной, как конфета, или отложенной, как зарплата. Главное — сумма наград должна отражать то, что мы действительно хотим.
Классический пример — робот-курьер. За доставленную вовремя посылку — плюс десять, за столкновение — минус пять, за лишний крюк — минус один. Робот быстро находит стратегию: кратчайший путь, без аварий, максимум доставок. Обратите внимание: мы не говорим ему, как идти, — только оцениваем результат. Это и есть магия награды: она позволяет решать задачи, которые сложно описать алгоритмом.
Вывод прост: награда — это способ передать машине цель, не объясняя пути. Чем точнее правила начисления очков, тем умнее искусственный интеллект.
Поделиться