Training-serving skew
Это важно, потому что на тестах модель может быть блестящей, а в реальном продукте — ошибаться: странные рекомендации, неверные диагнозы, отказы в кредите. Часто виноват не алгоритм, а именно разрыв между обучением и применением, и его игнорирование обесценивает разработку.
Интуитивный пример: вы учите язык по чётким аудиозаписям, всё понимаете на экзамене, но в стране слышите быструю речь с акцентом, шум и жаргон. Мозг обучен на чистом материале, а вокруг живой хаос. Так и модель встречает грязные, изменчивые, неполные данные: помехи с датчиков, опечатки, изменения названий товаров.
Конкретный случай: сервис рекомендаций фильмов. На обучении у модели идеально размеченная история кликов, а на сайте — автовоспроизведение, случайные нажатия, мусорные сигналы. Модель начинает советовать боевики из-за случайного клика, хотя на тренировке такого не было. Без учёта сдвига качество падает.
Вывод: training-serving skew — не дефект, а естественное свойство реального мира. Главный способ борьбы — постоянно контролировать входные данные, сравнивать с обучающими и обновлять модель или окружение. Понимание термина помогает инженерам не винить модель, а вовремя замечать изменившиеся условия — как переобуть машину на зиму и продолжать ехать безопасно.
Поделиться