HumanEval
Работает HumanEval интуитивно просто. Каждая задача — это описание функции на английском языке, пример ввода и вывода, а также набор скрытых тестов. Модель получает условие, она должна написать код, который затем автоматически прогоняется через эти тесты. Если все проверки пройдены — задача считается решённой. Такой подход позволяет измерить не способность к заучиванию, а реальное умение применять логику и синтаксис языка.
Прикладной пример: представьте, что вы просите модель написать функцию, которая возвращает чётные числа из списка. HumanEval подставит разные списки — пустые, с отрицательными числами, большие — и проверит, корректно ли работает код. Если модель справляется в большинстве случаев, она получает высокий балл.
В итоге HumanEval стал стандартом де-факто для оценки генерации кода, хотя и не лишён недостатков: он проверяет только отдельные функции, а не целые проекты. Тем не менее именно с него начинают путь большинство современных моделей программирования.
Поделиться