Outlier
Чем важен термин? Выбросы могут кардинально искажать результаты анализа и обучения моделей искусственного интеллекта. Большинство статистических методов и алгоритмов машинного обучения построены на предположении, что данные подчиняются некоторой закономерности. Одна экстремальная точка способна сдвинуть среднее, увеличить дисперсию или заставить модель подстраиваться под шум, ухудшая её точность на нормальных данных. Поэтому умение находить и правильно обрабатывать выбросы — обязательный шаг в подготовке данных.
Как это работает интуитивно? Представьте, что вы пытаетесь вывести типичную скорость автомобилей на трассе. Если один участник движения едет 250 километров в час, а остальные — около 90, то средняя скорость резко подскочит. Ваше представление о дороге станет неверным. Выбросы часто видны на графиках как одинокие точки, далёкие от основного облака данных.
Прикладной пример: в кредитном скоринге банк собирает данные о заёмщиках — возраст, доход, история платежей. Одна запись с доходом в миллиард рублей и нулевыми просрочками может быть опечаткой или реальным очень богатым клиентом. Если модель обучить на таких данных, она может научиться игнорировать важные сигналы или, наоборот, принимать слишком рискованные решения. Правильная стратегия — сначала выявить выброс с помощью методов, например, правила трёх сигм, и решить: удалить его, заменить на медианное значение или проанализировать отдельно как особый случай.
Итог: выброс — не просто «мусор» в данных, а сигнал о необычном событии или ошибке. Осознанное обращение с ним позволяет строить более устойчивые и честные модели, которые не обманываются редкостями.
Поделиться