Precision и Recall
Интуитивно это похоже на поиск в интернете. Представьте, что вы ищете книги по искусственному интеллекту. Precision — доля релевантных книг среди всех выданных результатов. Если из 10 ссылок 8 подходят, precision равен 0.8. Recall — доля найденных релевантных книг от всех, что существуют в библиотеке. Если она содержит 100 таких книг, а поисковик показал 50, recall равен 0.5. Хороший поиск должен сочетать оба качества, но реальный мир заставляет выбирать: широта охвата или чистота выдачи.
Прикладной пример — медицинский скрининг. Предположим, модель ищет признаки редкой болезни. Высокий recall означает, что пропущено мало больных, что важно для раннего лечения. Высокий precision означает, что мало здоровых получат ошибочный диагноз и лишние процедуры. Увеличивая recall, мы часто снижаем precision: чтобы поймать всех больных, модель начинает подозревать и здоровых. Выбор приоритета зависит от цены ошибки. В онкологии важнее не пропустить болезнь, в спам-фильтре — не потерять нужное письмо.
Итак, precision и recall — не конкуренты, а две стороны одного процесса. Они помогают понять, как настроить модель под конкретную задачу и какие ошибки допустимы.
Поделиться