глоссарий

Bias-variance tradeoff

Bias-variance tradeoff

Смещение и разброс — это два источника ошибок в моделях машинного обучения. Проще говоря, смещение — это уверенность модели в том, что мир устроен просто, а разброс — это её чрезмерная чувствительность к случайностям в данных. Компромисс между ними показывает, что модель нужно настраивать так, чтобы она не была ни слишком наивной, ни слишком капризной.

Почему это важно? Любая модель предсказывает по примерам, и если она ошибается, то причина либо в её собственной простоте, либо в том, что она выучила шум. Если мы не управляем этим соотношением, мы получаем либо тупую модель, которая всё усредняет, либо «зубрёжку», которая помнит каждый пример, но бесполезна в новых ситуациях. Понимание этого баланса помогает заранее выбирать сложность алгоритма и понимать, почему он ведёт себя так или иначе.

Интуитивно это похоже на рисование портрета. Если художник использует только грубые линии и базовые цвета — это высокое смещение: портрет простой, но потеряны детали. Если же он пытается перенести каждую пору и ворсинку на холст — это высокий разброс: он точно скопирует конкретное фото, но стоит лишь сделать новое фото с другим освещением, и всё рассыплется. Идеальный художник находит золотую середину, передавая характер, а не случайные блики.

Вот конкретный пример: врач строит модель для прогноза болезни по десяти показателям крови. Если модель — простое правило «более 40% пациентов больны», она не видит зависимостей (высокое смещение). Если же это сложное дерево решений с сотнями веток, оно вплоть до единиц подгонит историю каждого пациента, включая ошибки лабораторий, — и на новых данных даст абсурд. Компромисс достигается, например, ограничением глубины дерева: оно уловит основные закономерности, но не будет цепляться за шум.

Короткий итог: bias-variance tradeoff напоминает, что в машинном обучении нет идеальной модели — есть выбор между недоучтой и переобучением, и оптимум всегда посередине, где ошибка на реальных данных минимальна.