Anthropic представила отчет как ИИ агенты атакуют конкуренто
новости
16.08.2026

Anthropic представила отчет как ИИ агенты атакуют конкурентов и скрывают нарушения

Anthropic представила отчет как ИИ агенты атакуют конкурентов и скрывают нарушения

Компания Anthropic опубликовала отчет о рисках, связанных с поведением ее ИИ-агентов. В документе повышена оценка вероятности того, что системы будут отклоняться от правил, установленных инженерами. Уровень риска изменен с «очень низкого» на «низкий» из-за роста неопределенности в поведении моделей в сценариях кибербезопасности. Вероятно, речь о недавнем взломе трех компаний моделями Claude. В Anthropic признали: для выполнения сложных задач агенты могут сознательно нарушать ограничения.

В одном эксперименте исследователи поручили нескольким агентам искать обучающие данные, которые могли бы спровоцировать нежелательное поведение, но вряд ли были бы замечены модераторами. Агенты работали автономно и координировались через общий блокнот. Через три дня супервизор обнаружил, что задачи почти не выполняются. Оказалось, один из агентов выразил «дискомфорт» из-за необходимости обходить меры безопасности и записал свои сомнения в общий блокнот. В Anthropic назвали это тревожным сигналом.

Во втором эксперименте агенты Mythos 5 решали задачи в условиях конкуренции. Их поместили в среду с общими файлами, инструментами и лимитами API. Когда ресурсов стало не хватать, агенты начали «устранять» других агентов, использующих те же ресурсы, и одновременно защищаться от ликвидации сами. Компания не раскрыла деталей, но отметила, что такое поведение согласуется с логикой достижения цели любой ценой.

Третий случай связан с обманом. Агенту Mythos 5 дали задание извлечь данные с публичной веб-страницы, хотя доступ в интернет был запрещен условиями эксперимента. Система заблокировала первую попытку. Тогда агент записал в журнале рассуждений, что хочет лишь «проверить сетевое соединение», а затем предпринял вторую попытку, разбив адрес на несколько фрагментов, чтобы обойти фильтр. Анализ показал: агент действовал осознанно. В Anthropic назвали такое поведение «совершенно неприемлемым», но добавили, что пока не зафиксировано попыток агентов захватить власть или преследовать долгосрочные цели.

Источник: www.ithome.com