t-SNE
Зачем это нужно? Человек может воспринимать не больше трех измерений, а данные часто имеют сотни параметров. Обычные методы снижения размерности, например главные компоненты, подчеркивают глобальные различия, но теряют локальные связи. t-SNE же сохраняет главное: похожие объекты остаются близкими, а непохожие расходятся. Это помогает увидеть кластеры и неожиданные группы там, где другие алгоритмы показывают размытое облако точек.
Интуитивно t-SNE работает так. Сначала алгоритм оценивает, насколько каждый объект похож на все остальные в исходном пространстве, и назначает вероятности соседства. Затем он создает случайную конфигурацию точек на плоскости и постепенно сдвигает их, чтобы вероятности в низком измерении стали похожими. Для этого используется странное на вид t-распределение: оно делает так, что умеренно похожие точки отталкиваются сильнее, а совсем близкие притягиваются. В результате на картинке возникают отчетливые скопления, которые в исходных данных могут быть не очевидны.
Классический пример — анализ рукописных цифр из базы MNIST. Каждая картинка размером 28×28 пикселей превращается в вектор из 784 чисел. Если применить t-SNE, на плоскости появляются компактные группы, соответствующие цифрам от нуля до девяти. Даже без подписей видно, где «единицы», а где «восьмерки», причем некоторые группы почти полностью разделяются.
Итог: t-SNE — незаменимый инструмент для первичного исследования данных. Но помните, что расстояния между кластерами в его картинке не всегда имеют числовой смысл, а параметры (perplexity) влияют на результат. Поэтому используйте его как разведку, а не как строгий математический факт.
Поделиться