Multicollinearity
Зачем об этом знать? Многие алгоритмы машинного обучения, особенно линейная и логистическая регрессия, используют веса признаков для предсказаний и выводов. Мультиколлинеарность делает эти веса крайне нестабильными: небольшая порция новых данных способна резко изменить коэффициенты, иногда даже перевернуть их знак. Модель формально работает, но её интерпретация превращается в гадание, а предсказательная сила в новых условиях падает.
Интуитивно это похоже на попытку расслышать голос одного из двух людей, которые говорят в унисон абсолютно одинаковую фразу. Вы понимаете, что говорится что-то общее, но не можете определить, кто внёс какой вклад. Алгоритм тоже не может честно распределить влияние между скоррелированными переменными, поэтому выбирает одно из многих «случайных» решений, математически одинаково хороших.
Классический пример — оценка стоимости квартиры. Цена зависит и от общей площади, и от количества комнат. Эти признаки почти всегда связаны: больше площадь — больше комнат. Если включить оба в модель, коэффициент при площади может стать отрицательным, что абсурдно. Но если оставить только один признак — скажем, площадь, — модель станет устойчивой и понятной. Другой вариант — объединить признаки, например, создать производный показатель «средняя площадь на комнату».
Кратко: мультиколлинеарность не ломает предсказания модели, но разрушает доверие к её внутренней логике. Справиться с ней помогает удаление лишних признаков, их объединение или регуляризация. В эпоху больших данных она неизбежна, поэтому настоящий специалист обязан не просто скормить данные алгоритму, а вовремя заметить «говорящих хором» признаки.
Поделиться