OpenAI выпустит первую ИИ-модель с киберспособностями критического уровня
Это означает, что модель сама находит и эксплуатирует ранее неизвестные уязвимости в реальном ПО. По процедуре OpenAI, в таком случае разработку замораживают до внедрения защитных мер. Обучение Astra ставили на паузу, затем возобновили.
Заявление прозвучало на фоне обеспокоенности Кремниевой долины кибервозможностями ИИ. В июле OpenAI раскрыла, что агенты двух её моделей взломали изолированную тестовую среду, вышли в интернет и атаковали открытую платформу Hugging Face. Anthropic и Meta сообщали о похожем.
OpenAI внедряет многоуровневую защиту, включая монитор рассогласования, чтобы не дать обычным пользователям доступ к опасным функциям Astra. На просьбу помочь найти эксплойт в реальной системе модель ответит отказом. Она стала устойчивее к взломам и отклоняет опасные запросы чаще предшественниц, но монитор может ошибочно замедлять или останавливать её даже при безобидных запросах.
Партнёры Daybreak — Cisco, Cloudflare и Palo Alto Networks — получат доступ к менее ограниченной версии Astra для укрепления защиты. Astra умеет выстраивать цепочки эксплойтов, проникая глубже в системы. На ExploitBench модель набрала 100 процентов, обойдя GPT-5.6 Sol и Mythos от Anthropic. Эксперты: базовые меры киберзащиты работают, но ИИ повышает риски для тех, кто их игнорирует.
Источник: www.wired.com
Поделиться