Target leakage
Это опасно тем, что незаметно обесценивает модель. Можно потратить недели на очистку данных и подбор гиперпараметров, получить 98% точности на контрольной выборке, запустить модель в продакшн, но через месяц оказаться, что на реальных запросах она работает не лучше монетки. Утечку трудно заметить: метрики идеальны, поэтому повода усомниться нет.
Аналогия: вы готовите друга к экзамену по истории, а он тренируется на тех же вопросах, где ответы написаны мелким шрифтом внизу. На пробных попытках он отвечает мгновенно, но на настоящем экзамене без подсказок не может решить ничего. Шпаргалка — это утечка.
Пример из финансов. Банк прогнозирует возврат кредита. В исторических данных есть столбец «успел ли клиент взять новую ссуду на погашение долга». Модель почти безошибочно предсказывает дефолт, но при рассмотрении заявки этого события ещё нет — клиент не брал ссуду. Модель бесполезна, банк получает убыток из-за доверия к мифической точности.
Вывод: при построении модели каждый признак нужно спрашивать, знаю ли я его значение в момент реального прогноза. Если нет — отбросить, даже если это мельчайшая деталь. Утечку ищите через анализ самых сильных переменных и проверку на отложенном периоде с честным разрывом во времени. Чем раньше это сделаете, тем меньше шансов, что «шпаргалка» просочится в данные и обманет вас, команду и пользователей.
Поделиться