глоссарий

Недообучение

Недообучение

Недообучение — это ситуация в машинном обучении, когда модель оказывается слишком простой, чтобы уловить закономерности в данных. Такой алгоритм словно школьник, который выучил только базовые правила и не может решить задачу посложнее, потому что не понял суть. Важно отличать это от переобучения, когда модель, наоборот, запоминает всё до мелочей и теряет способность обобщать. Недообучение — это проблема «недостаточной сложности» или слишком строгих ограничений.

На интуитивном уровне представьте, что вы пытаетесь описать форму облака одним прямым отрезком. Вы получите грубую линию, которая пройдёт мимо большинства изгибов и пушистых краёв. Аналогично, модель с малым числом параметров или слишком коротким обучением видит лишь верхушку айсберга, игнорируя нюансы. Её ошибки на обучающих данных будут большими, и на новых данных она покажет себя не лучше.

Прикладной пример: банк обучает скоринговую модель определять надёжных заёмщиков. Если использовать всего один признак, например возраст, модель недообучится. Она будет выдавать кредит всем молодым людям с плохой историей и отказывать пожилым с отличной репутацией. Чтобы исправить ситуацию, нужно добавить больше признаков, усложнить модель или увеличить число эпох обучения — и тогда она начнёт улавливать важные сочетания факторов.

Вывод: недообучение — это сигнал, что модель слишком примитивна для задачи. Его легко диагностировать по высокой ошибке на обучающей выборке, и он лечится увеличением сложности модели. Умение вовремя заметить эту проблему — ключевой навык специалиста по данным, ведь баланс между простотой и точностью определяет, насколько хорошо алгоритм будет работать в реальном мире.