глоссарий

Дисбаланс классов

Дисбаланс классов

Дисбаланс классов — это ситуация в машинном обучении, когда один класс объектов встречается в данных значительно реже, чем другой. Такое неравенство — не просто статистический курьёз, а серьёзная проблема: модель часто игнорирует редкий класс, стремясь к высокой общей точности. Для задач, где редкий класс важен — диагностика болезней, поиск мошенничества, — это критично. Без учёта дисбаланса модель становится бесполезной для практики.

Представьте учителя, который показывает классу 990 фотографий кошек и только 10 собак. На экзамене просят угадать животное на картинке — проще всего отвечать «кошка», так как это верно в 99% случаев. Но такой ученик не распознает собаку в реальной жизни. Так же и алгоритм: он выбирает правило «все объекты — большинство», показывая высокую точность на обучении, но проваливаясь на реальных данных, где редкий класс важен.

В банковской сфере это выглядит так: из 10000 транзакций лишь одна бывает мошеннической. Если модель просто отклонит все подозрения, её точность составит 99,99%, но банк потеряет деньги. Это происходит потому, что модель оценивает точность, а не стоимость ошибки. Чтобы справиться с дисбалансом, используют взвешивание классов, методы синтетического увеличения выборки и метрики вроде F1-score или ROC-AUC, учитывающие и полноту, и точность.

Подводя итог, дисбаланс классов — не приговор, а вызов. Важно помнить, что это свойство задачи, а не ошибка данных. Правильно выбранные методы позволяют извлечь ценную информацию даже из крайне редких событий.