Thompson sampling
Его важность объясняется одной из главных проблем искусственного интеллекта: как совмещать использование уже проверенных вариантов с исследованием новых? Если всегда выбирать лидера, вы рискуете пропустить лучший вариант. Если постоянно экспериментировать — потеряете прибыль. Thompson sampling решает эту дилемму автоматически и почти оптимально.
На интуитивном уровне алгоритм работает так. У вас есть несколько «банкоматов» с неизвестной доходностью. Для каждого вы строите вероятностное распределение — своё представление о том, насколько он хорош. Затем из каждого распределения делается случайная выборка, и выбирается тот автомат, у которого выпало наибольшее значение. Чем больше данных, тем уже и точнее распределения, но случайность сохраняется, поэтому менее изученные варианты не остаются совсем без внимания. Так достигается баланс между эксплуатацией и разведкой.
Пример из практики: интернет-магазин тестирует два баннера. Один конвертирует в 5% кликов, другой — в 3%. Thompson sampling быстро определит лучшего, но будет время от времени показывать и второго, чтобы подстраховаться от изменений поведения аудитории. В результате суммарная эффективность кампании остаётся высокой, а решение выглядит естественным даже при резких скачках спроса.
Итог: Thompson sampling — это элегантный и вычислительно простой способ заставить ИИ принимать решения в условиях неопределённости. Он учит систему грамотно сочетать риск и осторожность и находит применение от клинических испытаний до управления финансовыми портфелями. Для широкой аудитории это ещё один пример того, как в основе сложных систем лежат обманчиво простые вероятностные идеи.
Поделиться