Slice-based evaluation
Зачем это важно? Модель машинного обучения учится на исторических примерах, и если какая-то категория в них была представлена слабо или с искажениями, модель начнёт ошибаться именно на ней. Общий средний показатель успешности при этом может оставаться высоким, потому что промахи небольшого среза разбавляются большим количеством верных предсказаний для других групп. В результате есть риск принять некачественную модель за отличную и не заметить её систематических ошибок.
Как это работает интуитивно? Представьте преподавателя, который ставит студенту один общий балл — допустим, 4,8. Но если разделить задачи на лёгкие и сложные, окажется, что все сложные решены неверно. Общая оценка это скрыла. Срез для ИИ — это способ проверить, не является ли модель «хорошистом в среднем, но троечником в важных деталях». Для этого инженеры группируют ошибки по выбранным признакам и сравнивают метрики между группами.
Прикладной пример: кредитный скоринг. Модель, оценивающая вероятность возврата кредита, может показывать 95% точности на всех заявителях. Но срез по возрасту выявляет, что у людей до 25 лет точность падает до 70% — из-за того, что в обучающих данных таких заёмщиков было слишком мало. Благодаря slice-based evaluation компания замечает эту проблему и либо собирает дополнительные данные для сегмента, либо меняет порог решения.
Вывод: оценка по срезам — это простой и мощный инструмент, который делает выводы о качестве ИИ более честными. Она помогает находить слепые зоны модели и устранять их, прежде чем они приведут к реальному ущербу.
Поделиться