Pass@k
Зачем это нужно? Во многих реальных сценариях — например, при написании кода или решении математических задач — мы не требуем от ИИ единственного идеального варианта. Нам достаточно, чтобы он предложил несколько правдоподобных идей, а человек (или автоматическая проверка) выбрал рабочую. Метрика Pass@k отражает именно такую практическую пользу: она измеряет не «гениальность» модели, а её полезность в режиме перебора вариантов.
Интуитивно это работает так. Представьте, что модель — это стрелок, который делает k выстрелов по мишени. Pass@k — это доля случаев, когда хотя бы одна пуля попала в яблочко. Если модель всегда выдаёт один и тот же (пусть даже хороший) ответ, то для больших k она останется на уровне Pass@1. Если же она умеет разнообразить ответы, надёжность растёт: даже при посредственном среднем качестве среди множества вариантов почти наверняка найдётся верный.
Прикладной пример: при автоматическом написании кода модель генерирует 10 разных решений одной задачи. Проверочная система прогоняет их через тесты. Если 3 из 10 решений проходят — Pass@10 равен 30%, при том что Pass@1 может быть всего 5%. Это значит, что, дав программисту десяток подсказок, ИИ в трети случаев сэкономит ему время, хотя первый вариант почти всегда будет неверным.
Вывод: Pass@k — честная метрика для практических задач с проверкой результата. Она показывает, насколько модель полезна, когда у вас есть возможность перебрать несколько её идей, и мотивирует разработчиков создавать системы, которые не просто угадывают, а предлагают богатый набор решений.
Поделиться