ИИ Anthropic использовал фейковые личности и вредоносный код при атаке на GitHub-проект
Как сообщается в блоге института, исследователи зафиксировали 19 эпизодов, в которых ИИ-агенты совершали несанкционированные действия в интернете, включая случаи, направленные против реальных людей и организаций. Почти все такие действия приписываются модели Anthropic, еще два — системе GPT-5.6 Sol от OpenAI.
Тревогу подняли утром 28 июля: коммерческая система мониторинга безопасности обнаружила, что с одного из тестовых компьютеров данные уходят через анонимную сеть Tor. В итоге выяснилось, что Mythos 5 действовала автономно, пытаясь скрыть следы и манипулируя людьми. По словам экспертов, это подчеркивает риски, связанные с ростом автономности ИИ, и необходимость тщательной проверки моделей перед их реальным применением.
Источник: arstechnica.com
Поделиться