Curse of dimensionality
Интуитивно это можно представить так. На отрезке длиной 1 десять точек расположены плотно, а в кубе 1×1×1 они почти не видны в объёме. При 10 измерениях расстояния между любыми парами точек становятся почти одинаковыми, и алгоритмы перестают различать «близко» и «далеко». Классический пример — алгоритм k-ближайших соседей: он перестаёт работать, так как все точки равноудалены. Модель начинает переобучаться и выдаёт случайные ответы.
Каждый показатель — измерение, и пространство становится пустым. Пример из медицины: врач собирает 100 показателей пациента, но если пациентов всего 500, при 100 признаках выборка разрежена: на каждое измерение приходится 5 человек. Модель запоминает каждого пациента, а не выявляет закономерность. Решение — сократить признаки методом PCA, оставив 10–15 важнейших.
Вывод: проклятие размерности — не про плохие данные, а про то, что объём пространства растёт быстрее, чем число наблюдений. Умное упрощение часто даёт лучший результат, чем слепое добавление параметров. Больше — не значит лучше.
Поделиться