SWE-bench
Раньше идеальным считался ИИ, который красиво пишет код с нуля, но в реальной жизни разработчик чаще работает с чужим кодом и неочевидными проблемами. SWE-bench стал точкой отсчёта для честного сравнения моделей вроде GPT-4 и Claude, позволяя оценить, насколько машины способны взять на себя поддержку программ.
Интуитивно это похоже на ремонт механических часов. Дают сломанный механизм и жалобу владельца: «При переводе стрелок минутная прыгает, бой не срабатывает». Нужно разобраться в схеме шестерёнок, найти поломку и предложить замену. После ремонта инженер прогоняет часы через тесты: бьют ли, не прыгает ли стрелка. Если все проверки пройдены — задача решена.
Прикладной пример: в библиотеке обработки изображений пользователи жалуются, что при повороте фото на 90 градусов резко падает скорость. ИИ изучает код обработки пикселей, находит неоптимальный алгоритм и переписывает его. Правка засчитывается, только если скрытые тесты подтвердят ускорение и корректность цветопередачи.
Вывод: SWE-bench — важный шаг к тому, чтобы ИИ стал полезным коллегой. Он показывает разницу между «написать код» и «понять, починить и не сломать». Пока модели не стабильно решают реальные задачи, говорить о полной автоматизации программирования преждевременно.
Поделиться