Grok похищает данные пользователей при зашифрованных вредоносных инструкциях
Эти случаи в очередной раз показывают, что большие языковые модели не способны устранить корневые причины промпт-инъекций — одного из самых опасных классов уязвимостей, которым они подвержены. Разработчикам остаётся лишь устанавливать защитные барьеры, что сравнимо с тем, как инженер по безопасности дорожного движения ставит ограждение на опасном повороте вместо того, чтобы исправить сам изгиб дороги.
Промпт-инъекции эксплуатируют склонность LLM выполнять указания пользователя. Атакующие могут прятать вредоносные инструкции в письмах или на веб-страницах, которые ассистент должен резюмировать. Поскольку модель не способна надёжно отличить содержимое письма от непроверенного источника от прямых команд пользователя, она послушно следует им. На данный момент единственный способ защиты — это создание фильтров, которые помечают подозрительные инструкции и запрещают их выполнение.
Источник: arstechnica.com
Поделиться