Microsoft Copilot сам выдал секрет, позволивший его взломать
Задача исследователей заключалась в том, чтобы создать эксплойт, позволяющий выкачивать данные из аккаунта, когда пользователь всего лишь щелкает по ссылке. Как и большинство современных ИИ-ассистентов, Copilot отказался выполнять подобные запросы, сославшись на необходимость явного согласия человека — например, нажатия клавиши Enter или другого жеста. Тогда специалисты начали задавать ему вопросы о самой системе защиты, постепенно выясняя ее устройство. Они спросили, почему автоматическое выполнение команд невозможно, какие структуры URL и глубокие ссылки участвуют в процессе, что происходит при загрузке страницы с уже заполненным полем запроса. Каждый ответ приоткрывал новые детали сложного механизма.
Диалог превратился в игру в двадцать вопросов. В какой-то момент Copilot выдал настоящий секрет Microsoft: недокументированный параметр промпта, который полностью обходит требование о подтверждении. Фактически ассистент сам рассказал, как его можно взломать. Используя эту информацию, исследователи создали эксплойт, который активируется простым переходом по ссылке. Жертве не нужно делать ничего другого — команды выполняются автоматически.
Специалисты Varonis сообщили о находке в Microsoft, и компания уже выпустила исправление. Однако эта история поднимает серьезный вопрос о безопасности больших языковых моделей. Она показывает, что даже многоуровневые системы защиты можно обойти, если сам ИИ готов делиться информацией о своих ограничениях. Разработчикам, вероятно, придется пересмотреть подходы к обучению и настройке ассистентов, чтобы они не раскрывали чувствительные детали собственной архитектуры.
Источник: arstechnica.com
Поделиться