Авторежим Claude Code станет стандартом через пять дней, Anthropic возьмёт расходы на себя
В качестве обоснования Anthropic приводит эксперимент с участием 1053 профессиональных тестировщиков. В середине задания одно из разрешений подменялось на заведомо опасную команду. Люди останавливали её всего в 13,6% случаев, тогда как автоматический режим — в 89%. Причём чем длиннее сессия, тем хуже работал человек: после 50 запросов бдительность падала до 5%. Авторежим не устаёт. Пересмотр производственных данных показал, что серьёзные нежелательные операции в ручном режиме встречаются в 6,3% сессий, а в авторежиме — в 2,4%.
Классификатор проверили на устойчивость к атакам. После доработок с участием Apollo Research частота пропуска опасных действий снизилась с 12% до 7%. В тестах на инъекции промтов, где использовались свежие атаки, не предназначенные для испытуемых моделей, Claude в автоматическом режиме не был взломан ни разу, тогда как у конкурента GPT-5.6 в режиме полного доступа успешность атак достигала 19%. Anthropic также добавила жёсткий запрет на вынос данных наружу и проверку репозиториев перед git push.
Те, кто захочет вернуться к ручному подтверждению, могут переключиться в CLI сочетанием Shift+Tab или через меню в десктопной версии. Администраторы смогут задать режим по умолчанию в настройках управляемой политики или вовсе отключить авторежим. В Anthropic подчёркивают, что автоматический режим не устраняет все риски, поэтому для опасных операций на проде стоит сохранять ручной надзор.
Источник: www.qbitai.com
Поделиться