глоссарий

Epsilon-greedy

Epsilon-greedy

Эпсилон-жадная стратегия — простой способ балансировать между исследованием и использованием в обучении с подкреплением. Агент в большинстве случаев выбирает лучшее из известных действий, но с вероятностью ε действует случайно, чтобы открыть новое. Без такого «шума» алгоритм застревает в локальном оптимуме: повторяет проверенное и не узнаёт, что чуть худший вариант может дать больший выигрыш.

Представьте кафе: вы всегда берёте капучино, но однажды случайно пробуете раф — и он нравится больше. Так и стратегия: иногда намеренно «ошибается», даже если уверена в выборе. Обычно ε = 0.1, то есть 90% времени агент действует жадно, 10% — разведывает. Со временем ε уменьшают: сначала мир неизвестен — нужно активное исследование, потом достаточно редких проб.

Пример — онлайн-кинотеатр. Сервис знает, что вы любите комедии, и в 90% случаев предлагает комедийные хиты. Но 10% рекомендаций случайны — документалка или артхаус. Если случайный фильм понравится, алгоритм расширит вашу ленту. Польза обоюдная: вам лучше, платформе — больше данных о скрытых предпочтениях.

Итог: epsilon-greedy — простое правило для обучения в неопределённом мире. Без сложной математики, легко реализуется, даёт надёжный результат. Главная идея — не бояться пробовать новое, даже когда кажется, что всё известно. Алгоритм действует как умный человек: уверенно использует лучший опыт, но оставляет место для случайных открытий.