глоссарий

t-SNE

t-SNE

t-SNE (стохастическое вложение соседей с t-распределением) — это алгоритм машинного обучения, который превращает многомерные данные в наглядную картинку из двух или трех измерений. Он особенно полезен, когда нужно обнаружить скрытые закономерности в сложных наборах данных, например, в результатах генетических анализов или в признаках изображений.

Зачем это нужно? Человек может воспринимать не больше трех измерений, а данные часто имеют сотни параметров. Обычные методы снижения размерности, например главные компоненты, подчеркивают глобальные различия, но теряют локальные связи. t-SNE же сохраняет главное: похожие объекты остаются близкими, а непохожие расходятся. Это помогает увидеть кластеры и неожиданные группы там, где другие алгоритмы показывают размытое облако точек.

Интуитивно t-SNE работает так. Сначала алгоритм оценивает, насколько каждый объект похож на все остальные в исходном пространстве, и назначает вероятности соседства. Затем он создает случайную конфигурацию точек на плоскости и постепенно сдвигает их, чтобы вероятности в низком измерении стали похожими. Для этого используется странное на вид t-распределение: оно делает так, что умеренно похожие точки отталкиваются сильнее, а совсем близкие притягиваются. В результате на картинке возникают отчетливые скопления, которые в исходных данных могут быть не очевидны.

Классический пример — анализ рукописных цифр из базы MNIST. Каждая картинка размером 28×28 пикселей превращается в вектор из 784 чисел. Если применить t-SNE, на плоскости появляются компактные группы, соответствующие цифрам от нуля до девяти. Даже без подписей видно, где «единицы», а где «восьмерки», причем некоторые группы почти полностью разделяются.

Итог: t-SNE — незаменимый инструмент для первичного исследования данных. Но помните, что расстояния между кластерами в его картинке не всегда имеют числовой смысл, а параметры (perplexity) влияют на результат. Поэтому используйте его как разведку, а не как строгий математический факт.