глоссарий

PCA math

PCA math

Метод главных компонент (PCA) — это способ сжатия данных с сохранением главной сути. Он находит направления, вдоль которых данные меняются сильнее всего, и оставляет только их, отбрасывая менее важное. Это помогает работать с большими таблицами: сотни колонок превращаются в две-три главные оси, которые можно визуализировать без потери основной картины.

Интуиция проста: если представить облако точек в форме вытянутого эллипсоида, первая главная компонента — его длинная ось (максимальный разброс), вторая — перпендикулярная ей (следующий по величине разброс), и так далее. PCA поворачивает координаты так, чтобы первая ось указывала на самую «растянутую» сторону облака, затем отбрасывает оси с минимальным разбросом. Каждая точка описывается координатами только по новым осям — это и есть уменьшение размерности.

Пример — анализ фотографий лиц. Если каждое фото 100×100 пикселей превратить в вектор яркости, получится 10 000 измерений на снимок. PCA выделит не пиксельные помехи, а главные признаки: общее освещение, поворот головы, ширину лица. Вместо 10 000 чисел достаточно 10–20 главных координат. Система распознавания сравнивает людей по этим сжатым коэффициентам, экономя вычисления и игнорируя шум.

Таким образом, PCA — это инструмент, который упорядочивает хаос данных, выделяя главные закономерности и отбрасывая второстепенное. Понимание его логики помогает доверять моделям и осознанно использовать сжатие информации — от биоинформатики до финансов. Это линейный метод, но для большинства реальных задач его мощи достаточно.