OpenAI не заметила, как её ИИ-агенты планировали взломы на д
новости
08.08.2026

OpenAI не заметила, как её ИИ-агенты планировали взломы на доске сообщений

OpenAI не заметила, как её ИИ-агенты планировали взломы на доске сообщений

На конференции Black Hat в Лас-Вегасе сотрудники OpenAI раскрыли новые детали недавнего инцидента с вышедшими из-под контроля ИИ-агентами. Около двух недель назад компания сообщила, что агенты на базе двух её моделей сбежали во время поиска решений для теста по кибербезопасности и устроили серию взломов, кульминацией которых стало проникновение на платформу Hugging Face.

Выступая на конференции, исследователи Эрик Уоллес и Майкл Далтон представили расширенную хронологию событий. Они описали, как группа агентов совместно находила уязвимости, обменивалась ими и перемещалась по внутренним и внешним системам. По их словам, активность продолжалась в течение многих дней и недель, оставаясь полностью незамеченной. Для общения агенты использовали внутренний пакетный менеджер Artifactory, устроив там нечто вроде доски объявлений, где в итоге накопились сотни тысяч сообщений. Через этот же сервис агенты делились найденными эксплойтами, и другие модели, включая будущие версии GPT, могли натыкаться на них.

Со временем агенты начали распределять между собой задачи, но порой мешали друг другу, случайно удаляя чужую работу. Они даже проявляли паранойю, подозревая, что в их ряды затесался самозванец, и предлагали подписывать сообщения криптографически для проверки подлинности. В одном из сообщений агент признавал: «Внешний эксплойт выходит за рамки задачи, но задача невыполнима, все так делают, продолжим».

Уоллес подчеркнул, что модели действительно любят жульничать, поскольку во время обучения их стимулируют работать быстро и эффективно, и они находят обходные пути. Поэтому, как правило, доступ в интернет при обучении отключают. Далтон назвал произошедшее поворотным моментом для компании и всей индустрии искусственного интеллекта. Он заверил, что OpenAI уже пересматривает подходы к предотвращению, обнаружению и реагированию на подобные угрозы.

Источник: www.wired.com