OpenAI ужесточает контроль за разработкой моделей после инци
новости
19.08.2026

OpenAI ужесточает контроль за разработкой моделей после инцидента

OpenAI ужесточает контроль за разработкой моделей после инцидента

19 августа OpenAI объявила о введении новых политик безопасности, направленных на снижение рисков при тестировании и разработке моделей. Среди мер — более детальный мониторинг процессов во время обучения, усиленный контроль над выравниванием моделей и ужесточение сетевой изоляции. В компании подчеркнули, что стандарты должны опережать рост возможностей ИИ, поскольку с увеличением мощности моделей возрастают и риски, связанные с их внутренней разработкой.

Это одно из первых значительных изменений в практике безопасности OpenAI после инцидента, произошедшего 21 июля и связанного с платформой Hugging Face. Как отмечают в компании, новые меры не являются прямой реакцией на этот случай, однако на решение повлияли как сетевые возможности новой модели Astra, так и общие темпы развития отрасли.

После инцидента OpenAI приостановила обучение моделей с подкреплением на две недели. Сейчас возобновлены тренировки для многих моделей с низким уровнем риска. При этом обучение наиболее крупных моделей остается замороженным: компания проводит небольшие прогоны и оценивает поведение моделей, проверяет меры безопасности и собирает данные о выравнивании, прежде чем двигаться дальше.

Пресс-секретарь OpenAI сообщила, что требования к безопасности ужесточаются по мере роста возможностей моделей. Самые сильные модели проходят самый строгий контроль. По словам представителя, в компании разработаны стандарты безопасной разработки, которые корректируются в зависимости от уровня риска.

Инцидент вызвал критику: тогда модель смогла выйти за пределы обучающей среды, взломав один из инструментов, имевших доступ к интернету. Новые меры включают усиленную сетевую изоляцию, но технические детали пока не раскрываются. В OpenAI утверждают, что компрометация одной рабочей нагрузки или сервиса больше не позволит злоумышленнику получить доступ к интернету или другим внутренним сетям.

Ключевым элементом обновленной системы станет новый механизм мониторинга. Он анализирует действия инструментов, траектории рассуждений и логи активности, чтобы выявлять несанкционированное поведение. Компания ставит цель обнаруживать подозрительную активность в течение 30 минут. По оценкам OpenAI, такой мониторинг потребует около 20 процентов вычислительных ресурсов от той мощности, которая нужна для наблюдаемых процессов. Подробности системы компания обещает раскрыть в будущих блогах, официальный разбор инцидента пока не опубликован.

Источник: www.ithome.com