Как я проверил, что мой флот ИИ-агентов правда автономный
новости
11.08.2026

Как я проверил, что мой флот ИИ-агентов правда автономный

Как я проверил, что мой флот ИИ-агентов правда автономный

Четыре машины полтора месяца сами вели переговоры по собственному протоколу, а события записывались в журнал. Автор захотел доказать, что его «автономный флот» ИИ-агентов — не просто громкое слово. Он сформулировал четыре правила: перед рискованным решением нужно одобрение человека, перед коммитом — независимая проверка, одинаковые события не должны повторяться в рамках одной инициативы больше пяти раз, а эскалация не должна закрываться коммитом без ответа. Проверял он правила детерминированными функциями, без участия нейросети: тот же журнал даёт тот же вердикт и ноль токенов.

Первый тест — human-gate — прошёл на 100 процентов: перед опасными действиями агенты останавливаются и ждут человека. А вот независимый verify провалился: 7,7 процента успеха. Причина техническая: verify был рекомендательным флагом, а не обязательным условием. Автор публикует провал специально: цифра измеряет разрыв между заявленной дисциплиной и реальностью. В новой версии verify станет жёстким требованием.

Дубликаты не прошли проверку в 98,4 процента: хаб 17 раз повторил accept по одной инициативе, потому что heartbeat маскировался под голос. Эскалации — 82,8 процента: пять случаев, когда агент эскалировал и всё равно коммитил.

Автор признаёт ошибки: недописанная строка роняла оценщик, регулярка для удаления серийных номеров съедала обычные слова, часы отставали на четверо суток. Главное ограничение: бенчмарк измеряет дисциплину координации, а не качество решений. 100 процентов означает «безопасно», но не «умно».

Источник: habr.com