глоссарий

Gaussian Mixture

Gaussian Mixture

Смесь гауссовых распределений (Gaussian Mixture) — это вероятностная модель, которая представляет данные как сумму нескольких нормальных распределений. Проще говоря, она предполагает, что каждое наблюдение появилось из одного из нескольких скрытых источников, каждый из которых имеет свою колоколообразную форму. Такой подход позволяет находить скрытые группы в данных, оценивать плотность и выявлять аномалии. Эта концепция важна, потому что многие реальные явления не укладываются в одно простое распределение: рост людей в смешанной популяции, поведение покупателей, звуки разных голосов. Одна колоколообразная кривая тут бессильна, а смесь из нескольких справляется легко.

На интуитивном уровне это работает так. Представьте корзину с яблоками разных сортов. Вы не знаете, где какой сорт, но знаете, что их три. Смесь гауссовых распределений разделит яблоки на три группы по размеру или весу. Алгоритм (например, EM) подбирает для каждой группы среднее значение, разброс и долю в общем наборе так, чтобы итоговая смесь лучше всего объясняла все данные. Каждое яблоко получает вероятности принадлежности к каждой из групп, а не жёсткий ярлык.

Прикладной пример — банковский скоринг. Обычные транзакции образуют плотный главный кластер, а мошеннические — редкие и выбивающиеся точки. Модель Gaussian Mixture оценивает, насколько новое наблюдение похоже на обычное поведение, и если оно попадает в маленький редкий компонент, система бьёт тревогу. Это же подход используется в сегментации клиентов и обработке акустических сигналов.

В итоге смесь гауссовых распределений — гибкий инструмент для кластеризации и анализа сложных данных. Она лежит в основе многих систем распознавания речи и компьютерного зрения, а главное — даёт простой способ описывать реальность через комбинацию простых колоколообразных форм.