глоссарий

Cohen's kappa

Cohen's kappa

Каппа Коэна — это статистический показатель согласованности между двумя экспертами или алгоритмами, который вычитает долю случайных совпадений. Если два врача ставят одинаковые диагнозы в 80% случаев, каппа может быть гораздо ниже: часть совпадений объясняется везением.

Зачем это важно? В машинном обучении качество разметки — фундамент. Обучая модель распознавать опухоли или спам, мы полагаемся на асессоров. Если их мнения расходятся, модель учится на шуме. Простой процент согласия обманчив: при двух категориях случайное совпадение возможно в половине случаев. Каппа отличает истинное взаимопонимание от везения.

Как работает интуитивно? Формула: каппа = (наблюдаемое согласие − случайное) / (1 − случайное). Представьте двух судей. Они согласились в 90% оценок, но один почти всем ставит «отлично», другой — «хорошо». Часть совпадений тривиальна. Каппа вычитает ложные совпадения, оставляя «сухую» согласованность. 0 — случайность, 0.7–0.8 — хорошо, 1 — полное единодушие.

Пример. Два рентгенолога разметили 100 снимков на «пневмония» / «норма» и сошлись на 85. Выглядит отлично. Но пневмония редка, оба чаще писали «норма», случайное согласие ожидалось в 65%. Каппа = (0.85 − 0.65) / (1 − 0.65) = 0.57 — умеренный уровень. Значит, критерии размыты, и модель будет учиться на противоречиях.

Вывод. Каппа Коэна защищает от самообмана при создании датасетов. Применяйте её, когда два человека или две модели оценивают одно и то же.