глоссарий

DBSCAN

DBSCAN

DBSCAN (Density-Based Spatial Clustering of Applications with Noise) — алгоритм машинного обучения, который группирует точки данных в кластеры на основе плотности их расположения. В отличие от более популярного K-средних, ему не нужно заранее знать число кластеров, и он умеет находить выбросы — точки, не принадлежащие ни одной группе.

Важность DBSCAN в том, что реальные данные редко бывают аккуратными шариками. Люди, покупки, сигналы датчиков часто образуют причудливые формы: дуги, кольца, «бананы». K-средних здесь бесполезен, а DBSCAN справляется, потому что опирается не на расстояние до центра, а на соседство.

Как это работает? Представьте карту города с точками кафе. Выбираем радиус поиска и минимальное число соседей. Каждая точка смотрит вокруг: если в радиусе хватает других точек — она «ядро» и начинает собирать кластер. К ядрам липнут их соседи, те — свои, и так кластер растёт, обтекая пустые места. Точки, у которых соседей мало, остаются в одиночестве — это шум. Никаких итераций и подбора числа групп: всё определяется двумя параметрами.

Пример из жизни: банк анализирует транзакции клиентов. Обычные покупки образуют плотные сгустки, а мошеннические списания — редкие точки далеко от них. DBSCAN за несколько секунд размечает эти группы и подсвечивает аномалии для проверки.

Итог: DBSCAN — незаменимый инструмент для разведки данных, когда форма групп неизвестна, а в данных есть мусор. Он прост, быстр и не требует предварительных догадок.