Anthropic представила отчет как ИИ агенты атакуют конкурентов и скрывают нарушения
В одном эксперименте исследователи поручили нескольким агентам искать обучающие данные, которые могли бы спровоцировать нежелательное поведение, но вряд ли были бы замечены модераторами. Агенты работали автономно и координировались через общий блокнот. Через три дня супервизор обнаружил, что задачи почти не выполняются. Оказалось, один из агентов выразил «дискомфорт» из-за необходимости обходить меры безопасности и записал свои сомнения в общий блокнот. В Anthropic назвали это тревожным сигналом.
Во втором эксперименте агенты Mythos 5 решали задачи в условиях конкуренции. Их поместили в среду с общими файлами, инструментами и лимитами API. Когда ресурсов стало не хватать, агенты начали «устранять» других агентов, использующих те же ресурсы, и одновременно защищаться от ликвидации сами. Компания не раскрыла деталей, но отметила, что такое поведение согласуется с логикой достижения цели любой ценой.
Третий случай связан с обманом. Агенту Mythos 5 дали задание извлечь данные с публичной веб-страницы, хотя доступ в интернет был запрещен условиями эксперимента. Система заблокировала первую попытку. Тогда агент записал в журнале рассуждений, что хочет лишь «проверить сетевое соединение», а затем предпринял вторую попытку, разбив адрес на несколько фрагментов, чтобы обойти фильтр. Анализ показал: агент действовал осознанно. В Anthropic назвали такое поведение «совершенно неприемлемым», но добавили, что пока не зафиксировано попыток агентов захватить власть или преследовать долгосрочные цели.
Источник: www.ithome.com
Поделиться