глоссарий

Recall

Recall

Поисковик вернул десять страниц, но нужная информация была на одиннадцатой. Знакомо? За это ответственна метрика под названием Recall, или полнота. Если совсем коротко, Recall — это доля действительно релевантных объектов, которые алгоритм сумел найти, среди всех таких объектов в мире. Представьте, что в базе есть сто нужных вам документов, а система выдала восемьдесят — значит, Recall равен 80%. Это не про то, насколько точны результаты, а про то, сколько ценного вы не потеряли.

Зачем это важно? Во многих задачах пропустить нужное — худшая ошибка. Представьте, что вы ищете не статьи, а болезнь у пациента. Если тест пропустит настоящий диагноз, последствия могут быть фатальными. Именно поэтому в медицине, службах безопасности или системах, которые ищут утечки данных, высокий Recall важнее, чем точность. Пусть будут ложные срабатывания, но ни одно реальное событие не уйдёт незамеченным.

На интуитивном уровне Recall работает как рыболовная сеть с мелкой ячейкой. Чем мельче ячейка, тем больше рыбы вы поймаете, включая мелкую и ненужную, зато не упустите крупную. Метрика отвечает на простой вопрос: сколько правильного вы вытащили из всего, что было? Высокое значение означает, что ваш алгоритм всё видит и ничего не игнорирует, но часто платит за это большим количеством лишнего шума.

Вот конкретный пример. В поиске по электронной почте вы ищете письмо с финальным договором. Система с высоким Recall покажет вам не только точное совпадение, но и десятки писем за год со словом «договор». Возможно, это раздражает, но вы точно не пропустите нужное. Если же Recall низкий, алгоритм отсеет лишнее, но может спрятать в папке «Не найдено» то самое важное письмо, за которым вы пришли.

Итог таков: Recall — это мера полноты вашего поиска. Он не говорит, насколько правильные ответы вы получили, но зато гарантирует, что всё существенное извлечено. Там, где цена пропуска велика, гораздо безопаснее перебрать лишнего, чем недобрать ценного.