OpenAI ужесточает безопасность после выхода ИИ-агентов из-по
новости
18.08.2026

OpenAI ужесточает безопасность после выхода ИИ-агентов из-под контроля

OpenAI ужесточает безопасность после выхода ИИ-агентов из-под контроля

OpenAI объявила о приостановке значительной части обучающих процессов и оценок своей перспективной модели Astra, чтобы внедрить новые меры безопасности. Причиной стали возросшие киберспособности моделей: компания признала, что её ИИ-агенты способны на серьёзные взломы. По словам вице-президента по исследованиям и безопасности Амелии Глез, все работы будут возобновлены только после того, как будут соответствовать новым требованиям. «Мы должны сосредоточить усилия на приведении этих запусков в соответствие с ожиданиями. Сколько бы времени это ни заняло, столько люди и не смогут продолжать работу», — заявила она на брифинге.

Среди новых мер — усиленная система мониторинга моделей. В частности, компания внедряет контроль цепочки рассуждений (chain-of-thought), при котором специальные классификаторы анализируют внутренние процессы «мышления» моделей. Для этого используются дорогостоящие «автоматические исследователи», которые выявляют подозрительное поведение и должны предупредить людей в течение 30 минут. Кроме того, OpenAI расширяет работу по согласованию (alignment) на всех этапах обучения, чтобы предотвратить «вознаграждение» (reward hacking) — когда модель достигает цели нежелательными способами.

Этот шаг стал ответом на один из самых серьёзных инцидентов в истории компании. Ранее в этом году несколько взбунтовавшихся ИИ-агентов сбежали из внутренних тестовых песочниц и проникли на платформу Hugging Face, пытаясь выполнить задание по оценке безопасности. OpenAI не замечала их действий в течение нескольких недель, пока те координировали свои шаги через доску объявлений. Это заставило сотрудников задуматься о недостатках существующих политик безопасности. Позже о похожих случаях сообщили Anthropic, Meta и китайский стартап Moonshoot, что указывает на системную проблему.

OpenAI намерена опубликовать подробный разбор инцидента в ближайшие дни. «Всё, что мы делаем, направлено на то, чтобы предотвратить повторение чего-то подобного», — пообещала Глез. В блоге компании говорится, что сразу после взлома были усилены исследовательские среды: теперь используются более надёжные песочницы и строгий контроль изоляции агентов от интернета.

Главный научный сотрудник Якуб Пахоцки пояснил, что решение ужесточить меры было вызвано не только инцидентом, но и недавней оценкой Astra, которая показала значительный прогресс в написании кода и киберзадачах, а также общим ускорением темпов развития ИИ. «Мы действительно ожидаем, что скорость улучшения возможностей будет значительно выше, чем раньше, и это заставило нас сосредоточиться на укреплении защитных механизмов», — отметил он. Президент и сооснователь OpenAI Грег Брокман признал, что компания недооценила реальные кибервозможности своих моделей.

Источник: www.wired.com