глоссарий

Expectation-Maximization

Expectation-Maximization

EM-алгоритм (Expectation-Maximization) — итеративный статистический метод для оценки параметров моделей, когда часть данных скрыта или ненаблюдаема. Это не один алгоритм, а общий рецепт вычисления максимума правдоподобия, даже если видны не все влияющие переменные.

Метод важен, потому что реальные данные часто неполны: неизвестны темы документов, границы объектов на изображениях, есть пропуски в медицинских тестах. Классические оценки тут пасуют, а EM даёт рабочий способ справиться с неопределённостью. Он лежит в основе гауссовых смесей, скрытых марковских моделей и анализа пропущенных значений.

Интуитивная логика проста. Представьте два перемешанных круга точек на плоскости, где неизвестно, какая точка к какому кругу относится. На шаге E алгоритм по текущим параметрам оценивает вероятность принадлежности каждой точки каждому кругу. На шаге M обновляет центры и дисперсии кругов так, чтобы максимизировать ожидаемое правдоподобие данных. Затем цикл повторяется: с новыми параметрами снова пересчитываются вероятности, и так до сходимости. Алгоритм гарантированно сходится, хотя может найти локальный, а не глобальный максимум.

Классический пример — сегментация клиентов по покупкам. Есть история транзакций, но нет меток «активный» или «редкий» покупатель. EM строит несколько гауссовых кривых частот покупок, на шаге E вычисляя для каждого клиента вероятность принадлежности к сегменту, а на шаге M уточняя средние и разбросы. После нескольких итераций получается чёткое разбиение, которое можно использовать для персонализации.

Кратко: EM — это гибкий инструмент для извлечения скрытой структуры из неполных данных. Он не быстр и чувствителен к начальному приближению, но прост и надёжен, поэтому остаётся одним из самых широко используемых подходов в машинном обучении. Если данные содержат пропуски или латентные переменные — EM почти наверняка будет первым разумным решением.