Gaussian Mixture
На интуитивном уровне это работает так. Представьте корзину с яблоками разных сортов. Вы не знаете, где какой сорт, но знаете, что их три. Смесь гауссовых распределений разделит яблоки на три группы по размеру или весу. Алгоритм (например, EM) подбирает для каждой группы среднее значение, разброс и долю в общем наборе так, чтобы итоговая смесь лучше всего объясняла все данные. Каждое яблоко получает вероятности принадлежности к каждой из групп, а не жёсткий ярлык.
Прикладной пример — банковский скоринг. Обычные транзакции образуют плотный главный кластер, а мошеннические — редкие и выбивающиеся точки. Модель Gaussian Mixture оценивает, насколько новое наблюдение похоже на обычное поведение, и если оно попадает в маленький редкий компонент, система бьёт тревогу. Это же подход используется в сегментации клиентов и обработке акустических сигналов.
В итоге смесь гауссовых распределений — гибкий инструмент для кластеризации и анализа сложных данных. Она лежит в основе многих систем распознавания речи и компьютерного зрения, а главное — даёт простой способ описывать реальность через комбинацию простых колоколообразных форм.
Поделиться