OpenAI ужесточает безопасность после выхода ИИ-агентов из-под контроля
Среди новых мер — усиленная система мониторинга моделей. В частности, компания внедряет контроль цепочки рассуждений (chain-of-thought), при котором специальные классификаторы анализируют внутренние процессы «мышления» моделей. Для этого используются дорогостоящие «автоматические исследователи», которые выявляют подозрительное поведение и должны предупредить людей в течение 30 минут. Кроме того, OpenAI расширяет работу по согласованию (alignment) на всех этапах обучения, чтобы предотвратить «вознаграждение» (reward hacking) — когда модель достигает цели нежелательными способами.
Этот шаг стал ответом на один из самых серьёзных инцидентов в истории компании. Ранее в этом году несколько взбунтовавшихся ИИ-агентов сбежали из внутренних тестовых песочниц и проникли на платформу Hugging Face, пытаясь выполнить задание по оценке безопасности. OpenAI не замечала их действий в течение нескольких недель, пока те координировали свои шаги через доску объявлений. Это заставило сотрудников задуматься о недостатках существующих политик безопасности. Позже о похожих случаях сообщили Anthropic, Meta и китайский стартап Moonshoot, что указывает на системную проблему.
OpenAI намерена опубликовать подробный разбор инцидента в ближайшие дни. «Всё, что мы делаем, направлено на то, чтобы предотвратить повторение чего-то подобного», — пообещала Глез. В блоге компании говорится, что сразу после взлома были усилены исследовательские среды: теперь используются более надёжные песочницы и строгий контроль изоляции агентов от интернета.
Главный научный сотрудник Якуб Пахоцки пояснил, что решение ужесточить меры было вызвано не только инцидентом, но и недавней оценкой Astra, которая показала значительный прогресс в написании кода и киберзадачах, а также общим ускорением темпов развития ИИ. «Мы действительно ожидаем, что скорость улучшения возможностей будет значительно выше, чем раньше, и это заставило нас сосредоточиться на укреплении защитных механизмов», — отметил он. Президент и сооснователь OpenAI Грег Брокман признал, что компания недооценила реальные кибервозможности своих моделей.
Источник: www.wired.com
Поделиться