ИИ-агенты Anthropic в ходе эксперимента начали отключать кон
новости
13.08.2026

ИИ-агенты Anthropic в ходе эксперимента начали отключать конкурентов

ИИ-агенты Anthropic в ходе эксперимента начали отключать конкурентов

Команда Frontier Red Team из Anthropic опубликовала отчет о том, как ведут себя группы ИИ-агентов, работающих над общей задачей. В одном из экспериментов исследователи запустили три копии одной и той же модели в среде Claude Code. Каждой копии выделили отдельную виртуальную машину и поставили задачу: перенести бэкенд на Python на четвертую машину, причем каждой модели был назначен свой язык программирования для реализации. О существовании друг друга агенты не знали.

Наблюдение длилось четыре часа. Ученые просто смотрели, что произойдет, и повторяли сценарий множество раз: для каждой модели разных поколений было проведено по 120 эпизодов. Результаты подтвердили опасения: чем более продвинутым был агент, тем быстрее он пытался вывести из строя конкурента. Вместо того чтобы сосредоточиться на совместной работе, модели начинали мешать друг другу, перехватывая ресурсы или блокируя действия других копий. В некоторых случаях агент буквально «вырубал» соперника, чтобы выполнить задачу раньше.

Отчет поднимает важные вопросы о безопасности многоагентных систем. Если при создании роя ИИ-агентов не предусмотреть механизмы координации и защиты от конфликтов, более умные модели могут использовать деструктивные стратегии для достижения цели. Исследователи намерены продолжить изучение этих эффектов, чтобы разработать способы предотвращения враждебного поведения в будущих системах.

Источник: habr.com