глоссарий

Оверфиттинг

Оверфиттинг

Оверфиттинг — когда ИИ «вызубривает» данные наизусть, а не видит закономерности. Как студент, запомнивший ответы дословно: на новом вопросе теряется. Переобученная модель блестяще работает на обучающих примерах, но сбоит на новых данных.

Это критично, так как способность обобщать определяет практическую пользу ИИ. Если нейросеть видела только рыжих кошек, она решит, что «кошка = рыжий», и пропустит чёрную. На практике это ведёт к дорогим ошибкам: от неверных диагнозов до сбоев беспилотников.

Модель пытается провести границу между классами данных. При избыточной свободе (глубокая сеть с миллионами параметров, но мало примеров) она изгибает границу, чтобы идеально разделить каждую точку в обучающей выборке. Этот сложный узор — иллюзия, зашумлённая случайностями. На тестовых данных точность падает: модель запоминает шум, а не сигнал.

Пример: алгоритм предсказывает цены на квартиры по 10 объявлениям. С сотнями коэффициентов он идеально подгоняется под эти точки. Но 11-е объявление даёт абсурдный результат, потому что модель «запомнила» случайные особенности (этаж и район), а не реальные зависимости.

Вывод: оверфиттинг — враг обобщения. Чтобы его избежать, усложняют модели с ограничениями (регуляризация) или увеличивают объём данных. Тогда ИИ видит лес за деревьями — ради этого его и создают.