глоссарий

Confusion matrix

Confusion matrix

Матрица ошибок — таблица, показывающая, где модель ИИ перепутала ответы. Например, для распознавания котов фиксируются случаи, когда модель верно назвала кота котом, собаку собакой, а также ошибки: приняла кота за собаку и наоборот. Это базовый инструмент проверки любой классификации.

Одна общая точность часто врет. Если врач ищет редкую болезнь (1 случай на 1000), модель, которая всегда говорит «здоров», права в 99,9% случаев, но бесполезна. Матрица ошибок это вскрывает: больных верно распознано ноль, зато все здоровые попали в «правильно здоровые». Сразу видно, что алгоритм просто угадывает частую категорию, игнорируя суть. Поэтому смотрят не на общую точность, а на четыре числа, из которых вычисляются чувствительность и специфичность — насколько модель ловит болезнь и не паникует зря.

Интуитивно матрица — это оси: реальное состояние (столбцы) и предсказание (строки). Верхний левый угол — истинно положительные (правда и предсказание совпали). Нижний правый — истинно отрицательные (тоже совпали). Две другие клетки — ошибки первого и второго рода: ложноположительный («кот» там, где собака) и ложноотрицательный (кота пропустили). Чем меньше числа в этих клетках, тем лучше.

Пример с почтовым фильтром: было 100 спамов и 900 обычных писем. Модель заблокировала 90 спамов, пропустила 10 (ложноотрицательные), и случайно отправила в спам 5 важных писем (ложноположительные). Матрица 2×2 сразу показывает: если нельзя терять письма от клиентов, нужно снижать ложноположительные, даже если придется пропустить больше спама. По одной общей точности таких выводов не сделать.

Коротко: матрица ошибок — рентген модели. Она показывает, что и в какую сторону перепутал алгоритм, помогая улучшать слабые места. Без нее легко попасть в ловушку высокой точности при полной бесполезности для реальной задачи.