глоссарий

Hierarchical clustering

Hierarchical clustering

Иерархическая кластеризация — это метод обучения без учителя, который группирует объекты не в один плоский набор кластеров, а в дерево вложенных групп, называемое дендрограммой. Проще говоря, она строит «родословную» данных: на нижнем уровне каждый объект сам по себе, а на верхнем — все объединены в один общий класс.

Важность метода в том, что он не требует заранее указывать число кластеров. В отличие от алгоритма k-средних, где вы должны сказать «раздели на пять групп», иерархический подход показывает всю картину сразу: вы сами решаете, на каком уровне «срезать» дендрограмму, чтобы получить нужную детализацию. Это критично для исследовательских задач, где о структуре данных неизвестно ничего.

Как это работает интуитивно? Представьте, что каждая точка данных — это отдельный человек на площади. Сначала вы соединяете самых близких попарно в маленькие компании. Затем эти компании сливаются с ближайшими соседями в более крупные группы, и так повторяется, пока все не соберутся в толпу. На каждом шаге расстояние между группами пересчитывается (например, по ближайшим или дальним точкам). Результат — дендрограмма, где высота ветвей показывает степень сходства: чем ниже ветвь, тем более родственны объекты.

Прикладной пример — биология. Учёные измеряют уровень активности тысяч генов в разных клетках. Иерархическая кластеризация строит дерево, где листья — это гены, а ветви объединяют гены со схожими «профилями поведения». Так исследователи находят группы генов, которые работают сообща, например, отвечают за развитие болезни, и выявляют новые биомаркеры, не имея готовых гипотез.

Краткий вывод: иерархическая кластеризация — это гибкий и наглядный инструмент разведки данных, который помогает понять внутреннюю структуру без предварительных настроек. Его главный недостаток — высокая вычислительная сложность на больших объёмах, но для средних выборок он незаменим.