глоссарий

Target leakage

Target leakage

Утечка целевой переменной (target leakage) — ошибка в машинном обучении, когда в обучающие данные попадает информация, которая на момент прогноза в реальной жизни неизвестна, но содержит ответ на вопрос. Модель «подглядывает» правильное решение при обучении: на тестах она блестяща, а на новых данных полностью разваливается.

Это опасно тем, что незаметно обесценивает модель. Можно потратить недели на очистку данных и подбор гиперпараметров, получить 98% точности на контрольной выборке, запустить модель в продакшн, но через месяц оказаться, что на реальных запросах она работает не лучше монетки. Утечку трудно заметить: метрики идеальны, поэтому повода усомниться нет.

Аналогия: вы готовите друга к экзамену по истории, а он тренируется на тех же вопросах, где ответы написаны мелким шрифтом внизу. На пробных попытках он отвечает мгновенно, но на настоящем экзамене без подсказок не может решить ничего. Шпаргалка — это утечка.

Пример из финансов. Банк прогнозирует возврат кредита. В исторических данных есть столбец «успел ли клиент взять новую ссуду на погашение долга». Модель почти безошибочно предсказывает дефолт, но при рассмотрении заявки этого события ещё нет — клиент не брал ссуду. Модель бесполезна, банк получает убыток из-за доверия к мифической точности.

Вывод: при построении модели каждый признак нужно спрашивать, знаю ли я его значение в момент реального прогноза. Если нет — отбросить, даже если это мельчайшая деталь. Утечку ищите через анализ самых сильных переменных и проверку на отложенном периоде с честным разрывом во времени. Чем раньше это сделаете, тем меньше шансов, что «шпаргалка» просочится в данные и обманет вас, команду и пользователей.