глоссарий

Training-serving skew

Training-serving skew

Training-serving skew — расхождение между условиями обучения модели и её реальной работой. Модель готовится на одних данных, а в жизни получает другие, как спортсмен, тренировавшийся в идеальном зале и вышедший на мокрый асфальт: навыки те же, результат хуже.

Это важно, потому что на тестах модель может быть блестящей, а в реальном продукте — ошибаться: странные рекомендации, неверные диагнозы, отказы в кредите. Часто виноват не алгоритм, а именно разрыв между обучением и применением, и его игнорирование обесценивает разработку.

Интуитивный пример: вы учите язык по чётким аудиозаписям, всё понимаете на экзамене, но в стране слышите быструю речь с акцентом, шум и жаргон. Мозг обучен на чистом материале, а вокруг живой хаос. Так и модель встречает грязные, изменчивые, неполные данные: помехи с датчиков, опечатки, изменения названий товаров.

Конкретный случай: сервис рекомендаций фильмов. На обучении у модели идеально размеченная история кликов, а на сайте — автовоспроизведение, случайные нажатия, мусорные сигналы. Модель начинает советовать боевики из-за случайного клика, хотя на тренировке такого не было. Без учёта сдвига качество падает.

Вывод: training-serving skew — не дефект, а естественное свойство реального мира. Главный способ борьбы — постоянно контролировать входные данные, сравнивать с обучающими и обновлять модель или окружение. Понимание термина помогает инженерам не винить модель, а вовремя замечать изменившиеся условия — как переобуть машину на зиму и продолжать ехать безопасно.