глоссарий

SWE-bench

SWE-bench

SWE-bench — это бенчмарк для оценки инженерных навыков ИИ (Software Engineering Benchmark). Вместо абстрактных задач вроде «выведи строку» он использует реальные баги из открытых GitHub-проектов. ИИ получает описание ошибки от пользователей и весь код, должен найти причину и написать исправление. Строгим судьёй выступают скрытые тесты: если после правки всё работает — задача решена, иначе — провал.

Раньше идеальным считался ИИ, который красиво пишет код с нуля, но в реальной жизни разработчик чаще работает с чужим кодом и неочевидными проблемами. SWE-bench стал точкой отсчёта для честного сравнения моделей вроде GPT-4 и Claude, позволяя оценить, насколько машины способны взять на себя поддержку программ.

Интуитивно это похоже на ремонт механических часов. Дают сломанный механизм и жалобу владельца: «При переводе стрелок минутная прыгает, бой не срабатывает». Нужно разобраться в схеме шестерёнок, найти поломку и предложить замену. После ремонта инженер прогоняет часы через тесты: бьют ли, не прыгает ли стрелка. Если все проверки пройдены — задача решена.

Прикладной пример: в библиотеке обработки изображений пользователи жалуются, что при повороте фото на 90 градусов резко падает скорость. ИИ изучает код обработки пикселей, находит неоптимальный алгоритм и переписывает его. Правка засчитывается, только если скрытые тесты подтвердят ускорение и корректность цветопередачи.

Вывод: SWE-bench — важный шаг к тому, чтобы ИИ стал полезным коллегой. Он показывает разницу между «написать код» и «понять, починить и не сломать». Пока модели не стабильно решают реальные задачи, говорить о полной автоматизации программирования преждевременно.