LiveCodeBench
Это как экзамен с новыми билетами. Школьник, вызубривший старые ответы, провалится, если вопросы изменят. Так и модель: честный тест заставляет её писать код с нуля, а не воспроизводить заученное. LiveCodeBench генерирует или выбирает задачи, которые модель не встречала, и смотрит, решит ли она их.
Прикладной пример: команда разработчиков выбирает между двумя ИИ-помощниками для написания кода. Оба отлично проходят старый бенчмарк HumanEval, но на LiveCodeBench результаты расходятся: первый решает 42% свежих задач, второй — 71%. Это значит, что первый, скорее всего, запомнил популярные решения, а второй действительно понимает алгоритмы. Выбрав второго, команда получает надёжного помощника, который справится с уникальными задачами.
В итоге LiveCodeBench — это инструмент честной оценки, который помогает отличать настоящие способности модели программировать от простого запоминания данных. Он стал стандартом де-факто в индустрии, так как даёт разработчикам уверенность, что цифры в отчётах не обманывают.
Поделиться