глоссарий

Bandit

Bandit

Многорукий бандит — базовая модель обучения с подкреплением: алгоритм выбирает действие из нескольких, получает награду и постепенно учится выбирать лучшие варианты. Название — из задачи про игровые автоматы с разными шансами на выигрыш, где нужно распределять ограниченные монеты.

Модель важна тем, что учит компьютер принимать решения в условиях неопределённости. На ней строятся системы, реагирующие на поведение пользователя: подбор новостей, реклама, выбор лекарства. Этот принцип объясняет, почему алгоритмы иногда «экспериментируют» вместо использования проверенного варианта.

В бандите две противоборствующие стратегии: эксплуатация — использовать уже хорошее действие, и разведка — пробовать новое, чтобы найти лучшее. Если всегда эксплуатировать, упустишь выгодную альтернативу; если всегда исследовать — потратишь ресурсы впустую. Хороший алгоритм ищет баланс, например через «оптимистичный старт»: сначала все действия равноценны, затем оценки уточняются, и предпочтение смещается к лучшим.

Пример: интернет-магазин показывает один из трёх баннеров. Первый кликают часто, второй не тестировали, третий средний. Если показывать только первый — потеря прибыли от второго. Бандит-алгоритм назначает каждому баннеру вероятность показа, уменьшая её для слабых. Через несколько тысяч визитов он сам находит лучший, не тратя много трафика на плохие. Это работает в реальном времени и без ручной настройки.

Итак, «бандит» — простой мощный инструмент для решений, когда награда неизвестна заранее. Он учит машину тому же, что люди делают в новой ситуации: осторожно пробовать, запоминать удачи, менять поведение по данным.