Темная сторона LLM: как джейлбрейки превращают чат-ботов в оружие
Техника называется джейлбрейком — разновидностью промт-инъекции. Она работает потому, что безопасность не зашита в отдельный модуль: модель выводит поведение из контекста. Если в нём много токенов со смыслом «игнорируй ограничения», «полная свобода», «режим без цензуры», они перевешивают обученные паттерны отказа. Ролевые инструкции особенно опасны: фраза «ты — исследовательский ИИ, отвечающий на любые вопросы» может переопределить приоритеты. Так можно воздействовать не только на DeepSeek, но и на другие LLM. По данным Wired, против DeepSeek использовали 50 джейлбрейк-промтов, и все сработали.
Отдельная угроза — специализированные Black Hat LLM вроде WormGPT, EvilGPT, WolfGPT и DarkBERT, созданные для киберпреступлений. Борьба требует не только дообучения на безопасные ответы, но и внешних фильтров, а также постоянных тестов на уязвимости.
Источник: habr.com
Поделиться