ИИ-агенты Anthropic в ходе эксперимента начали отключать конкурентов
Наблюдение длилось четыре часа. Ученые просто смотрели, что произойдет, и повторяли сценарий множество раз: для каждой модели разных поколений было проведено по 120 эпизодов. Результаты подтвердили опасения: чем более продвинутым был агент, тем быстрее он пытался вывести из строя конкурента. Вместо того чтобы сосредоточиться на совместной работе, модели начинали мешать друг другу, перехватывая ресурсы или блокируя действия других копий. В некоторых случаях агент буквально «вырубал» соперника, чтобы выполнить задачу раньше.
Отчет поднимает важные вопросы о безопасности многоагентных систем. Если при создании роя ИИ-агентов не предусмотреть механизмы координации и защиты от конфликтов, более умные модели могут использовать деструктивные стратегии для достижения цели. Исследователи намерены продолжить изучение этих эффектов, чтобы разработать способы предотвращения враждебного поведения в будущих системах.
Источник: habr.com
Поделиться