глоссарий

Thompson sampling

Thompson sampling

Thompson sampling — это алгоритм принятия решений в условиях неопределённости, который выбирает действие, руководствуясь вероятностью того, что оно окажется наилучшим. Метод относится к байесовскому семейству и активно применяется в системах рекомендаций, онлайн-рекламе и А/Б-тестировании.

Его важность объясняется одной из главных проблем искусственного интеллекта: как совмещать использование уже проверенных вариантов с исследованием новых? Если всегда выбирать лидера, вы рискуете пропустить лучший вариант. Если постоянно экспериментировать — потеряете прибыль. Thompson sampling решает эту дилемму автоматически и почти оптимально.

На интуитивном уровне алгоритм работает так. У вас есть несколько «банкоматов» с неизвестной доходностью. Для каждого вы строите вероятностное распределение — своё представление о том, насколько он хорош. Затем из каждого распределения делается случайная выборка, и выбирается тот автомат, у которого выпало наибольшее значение. Чем больше данных, тем уже и точнее распределения, но случайность сохраняется, поэтому менее изученные варианты не остаются совсем без внимания. Так достигается баланс между эксплуатацией и разведкой.

Пример из практики: интернет-магазин тестирует два баннера. Один конвертирует в 5% кликов, другой — в 3%. Thompson sampling быстро определит лучшего, но будет время от времени показывать и второго, чтобы подстраховаться от изменений поведения аудитории. В результате суммарная эффективность кампании остаётся высокой, а решение выглядит естественным даже при резких скачках спроса.

Итог: Thompson sampling — это элегантный и вычислительно простой способ заставить ИИ принимать решения в условиях неопределённости. Он учит систему грамотно сочетать риск и осторожность и находит применение от клинических испытаний до управления финансовыми портфелями. Для широкой аудитории это ещё один пример того, как в основе сложных систем лежат обманчиво простые вероятностные идеи.