Оптимизация рекомендаций за сессию: метод на базе обучения с подкреплением для KDD 2026
Статья под названием Session-Level Optimization for Large-Scale Retrieval using REINFORCE with Multi-Step Off-Policy Correction описывает метод, который позволяет модели рекомендаций оценивать не отдельные взаимодействия пользователя с контентом, а весь его путь в рамках одной сессии. Это дает возможность оптимизировать долгосрочную удовлетворенность, учитывая последовательность действий. Авторы используют подход обучения с подкреплением REINFORCE и модифицируют его для работы с большими массивами данных, применяя коррекцию смещения при многошаговом сборе данных.
Главная идея заключается в том, что рекомендации должны быть полезны не только в моменте, но и на протяжении всего пользовательского сценария. Такой подход приближает работу алгоритмов к реальным задачам бизнеса, где важна не отдельная покупка, а лояльность и повторные взаимодействия.
Источник: habr.com
Поделиться