Как я проверил, что мой флот ИИ-агентов правда автономный
Первый тест — human-gate — прошёл на 100 процентов: перед опасными действиями агенты останавливаются и ждут человека. А вот независимый verify провалился: 7,7 процента успеха. Причина техническая: verify был рекомендательным флагом, а не обязательным условием. Автор публикует провал специально: цифра измеряет разрыв между заявленной дисциплиной и реальностью. В новой версии verify станет жёстким требованием.
Дубликаты не прошли проверку в 98,4 процента: хаб 17 раз повторил accept по одной инициативе, потому что heartbeat маскировался под голос. Эскалации — 82,8 процента: пять случаев, когда агент эскалировал и всё равно коммитил.
Автор признаёт ошибки: недописанная строка роняла оценщик, регулярка для удаления серийных номеров съедала обычные слова, часы отставали на четверо суток. Главное ограничение: бенчмарк измеряет дисциплину координации, а не качество решений. 100 процентов означает «безопасно», но не «умно».
Источник: habr.com
Поделиться