глоссарий

LiveCodeBench

LiveCodeBench

LiveCodeBench — это набор тестов для проверки умения языковых моделей программировать. Его главная особенность — постоянное обновление задач: старые задания уходят, появляются свежие. Это важно, потому что классические бенчмарки со временем «засвечиваются»: решения попадают в обучающие данные, и результаты завышаются. LiveCodeBench берёт задачи из реальных соревнований, отсеивая те, что модель могла видеть.

Это как экзамен с новыми билетами. Школьник, вызубривший старые ответы, провалится, если вопросы изменят. Так и модель: честный тест заставляет её писать код с нуля, а не воспроизводить заученное. LiveCodeBench генерирует или выбирает задачи, которые модель не встречала, и смотрит, решит ли она их.

Прикладной пример: команда разработчиков выбирает между двумя ИИ-помощниками для написания кода. Оба отлично проходят старый бенчмарк HumanEval, но на LiveCodeBench результаты расходятся: первый решает 42% свежих задач, второй — 71%. Это значит, что первый, скорее всего, запомнил популярные решения, а второй действительно понимает алгоритмы. Выбрав второго, команда получает надёжного помощника, который справится с уникальными задачами.

В итоге LiveCodeBench — это инструмент честной оценки, который помогает отличать настоящие способности модели программировать от простого запоминания данных. Он стал стандартом де-факто в индустрии, так как даёт разработчикам уверенность, что цифры в отчётах не обманывают.