глоссарий

AUC

AUC

AUC (Area Under the ROC Curve) — метрика качества бинарной классификации: она показывает, насколько хорошо модель разделяет два класса. Проще говоря, это вероятность того, что случайно выбранный положительный объект получит от модели более высокий балл, чем случайно выбранный отрицательный. Значение AUC лежит от 0 до 1: 0,5 означает «не лучше подбрасывания монеты», 1 — идеальное разделение.

Метрика важна тем, что не требует выбора порога. В реальных задачах порог заранее неизвестен: в диагностике рака важнее не пропустить болезнь, в спам-фильтрах — не удалить нужное письмо. AUC оценивает модель сразу для всех порогов, поэтому удобна для сравнения алгоритмов: выше AUC — лучше ранжирование объектов в целом.

Интуиция: представьте карточки с котиками и собачками. Модель присваивает каждой балл — чем больше похоже на котика, тем выше. Случайно берём пару «котик и собачка» и проверяем, получил ли котик больший балл. Доля таких побед и есть AUC.

Пример: банк строит скоринг. Слишком строгий порог отсекает хороших клиентов, слишком мягкий — даёт дефолты. AUC позволяет выбрать модель, которая при любом допустимом уровне риска отсеивает больше проблемных кредитов. Высокий AUC означает меньше просрочек при том же одобрении заявок, что прямо влияет на прибыль.

Вывод: AUC — мощный и наглядный стандарт сравнения бинарных классификаторов, особенно когда важен порядок объектов, а не конкретный порог. Но помните: AUC не оценивает точность предсказанных вероятностей и может вводить в заблуждение при сильном дисбалансе классов.