Pass@1
Зачем это нужно? В реальной жизни у пользователя обычно нет времени перебирать десять вариантов ответа. Если ассистент написал код, который сразу работает, или перевёл фразу без грубой ошибки — это удобно и экономит часы. Поэтому разработчики используют Pass@1, чтобы понять, насколько модель готова к практическому использованию, а не только к лабораторным тестам.
Как это работает интуитивно? Допустим, у нас есть сто задач на написание программы. Для каждой задачи модель делает ровно одно предсказание. Если она правильно решила восемьдесят задач, Pass@1 равен 80%. Если же мы позволяли модели пробовать несколько раз и потом выбирали лучший результат, цифры были бы выше, но это нечестно: в жизни у вас нет «читерского» перебора. Поэтому Pass@1 — это честный экзамен без права на ошибку.
Прикладной пример: представьте, что вы используете ИИ-помощника, чтобы он написал функцию для вычисления налога. Если Pass@1 равен 70%, это значит, что в трёх случаях из десяти код будет содержать ошибку, и вам придётся вручную её искать. А если Pass@1 равен 95%, можно смело доверять первой версии и лишь изредка проверять. Компании, встраивающие ИИ в свои инструменты, часто требуют высокий Pass@1, потому что каждая ошибка — это потерянное время клиента и репутации.
Короче говоря, Pass@1 — это простой и строгий показатель надёжности: сколько раз модель оказывается права, когда ей дают лишь один шанс. Чем он выше, тем меньше вам придётся переделывать работу за ней.
Поделиться