глоссарий

HumanEval

HumanEval

HumanEval — это набор из 164 задач по программированию, разработанный исследователями OpenAI для проверки того, насколько хорошо языковые модели умеют писать код. Важность этого термина в том, что он стал своеобразным экзаменом для искусственного интеллекта, позволяющим объективно сравнивать разные нейросети между собой. До его появления оценить качество генерации кода было сложно: модели могли показывать впечатляющие примеры, но не было единого стандарта.

Работает HumanEval интуитивно просто. Каждая задача — это описание функции на английском языке, пример ввода и вывода, а также набор скрытых тестов. Модель получает условие, она должна написать код, который затем автоматически прогоняется через эти тесты. Если все проверки пройдены — задача считается решённой. Такой подход позволяет измерить не способность к заучиванию, а реальное умение применять логику и синтаксис языка.

Прикладной пример: представьте, что вы просите модель написать функцию, которая возвращает чётные числа из списка. HumanEval подставит разные списки — пустые, с отрицательными числами, большие — и проверит, корректно ли работает код. Если модель справляется в большинстве случаев, она получает высокий балл.

В итоге HumanEval стал стандартом де-факто для оценки генерации кода, хотя и не лишён недостатков: он проверяет только отдельные функции, а не целые проекты. Тем не менее именно с него начинают путь большинство современных моделей программирования.