Cohen's kappa
Зачем это важно? В машинном обучении качество разметки — фундамент. Обучая модель распознавать опухоли или спам, мы полагаемся на асессоров. Если их мнения расходятся, модель учится на шуме. Простой процент согласия обманчив: при двух категориях случайное совпадение возможно в половине случаев. Каппа отличает истинное взаимопонимание от везения.
Как работает интуитивно? Формула: каппа = (наблюдаемое согласие − случайное) / (1 − случайное). Представьте двух судей. Они согласились в 90% оценок, но один почти всем ставит «отлично», другой — «хорошо». Часть совпадений тривиальна. Каппа вычитает ложные совпадения, оставляя «сухую» согласованность. 0 — случайность, 0.7–0.8 — хорошо, 1 — полное единодушие.
Пример. Два рентгенолога разметили 100 снимков на «пневмония» / «норма» и сошлись на 85. Выглядит отлично. Но пневмония редка, оба чаще писали «норма», случайное согласие ожидалось в 65%. Каппа = (0.85 − 0.65) / (1 − 0.65) = 0.57 — умеренный уровень. Значит, критерии размыты, и модель будет учиться на противоречиях.
Вывод. Каппа Коэна защищает от самообмана при создании датасетов. Применяйте её, когда два человека или две модели оценивают одно и то же.
Поделиться