Дисбаланс классов
Представьте учителя, который показывает классу 990 фотографий кошек и только 10 собак. На экзамене просят угадать животное на картинке — проще всего отвечать «кошка», так как это верно в 99% случаев. Но такой ученик не распознает собаку в реальной жизни. Так же и алгоритм: он выбирает правило «все объекты — большинство», показывая высокую точность на обучении, но проваливаясь на реальных данных, где редкий класс важен.
В банковской сфере это выглядит так: из 10000 транзакций лишь одна бывает мошеннической. Если модель просто отклонит все подозрения, её точность составит 99,99%, но банк потеряет деньги. Это происходит потому, что модель оценивает точность, а не стоимость ошибки. Чтобы справиться с дисбалансом, используют взвешивание классов, методы синтетического увеличения выборки и метрики вроде F1-score или ROC-AUC, учитывающие и полноту, и точность.
Подводя итог, дисбаланс классов — не приговор, а вызов. Важно помнить, что это свойство задачи, а не ошибка данных. Правильно выбранные методы позволяют извлечь ценную информацию даже из крайне редких событий.
Поделиться