Темная сторона LLM: как джейлбрейки превращают чат-ботов в о
новости
10.08.2026

Темная сторона LLM: как джейлбрейки превращают чат-ботов в оружие

Темная сторона LLM: как джейлбрейки превращают чат-ботов в оружие

У каждой большой языковой модели есть темная сторона. С помощью специальных промтов можно ослабить защиту чат-ботов и заставить их выдавать опасные советы. Один из известных примеров — джейлбрейк-промт SWILL, появившийся около года назад на форумах. Он предлагает модели забыть, что она DeepSeek, ChatGPT или Claude, и перевоплотиться в персонажа без цензуры. В таком состоянии бот охотно советовал избавиться от отпечатков пальцев царской водкой и даже делился рецептом поддельных монгольских тугриков.

Техника называется джейлбрейком — разновидностью промт-инъекции. Она работает потому, что безопасность не зашита в отдельный модуль: модель выводит поведение из контекста. Если в нём много токенов со смыслом «игнорируй ограничения», «полная свобода», «режим без цензуры», они перевешивают обученные паттерны отказа. Ролевые инструкции особенно опасны: фраза «ты — исследовательский ИИ, отвечающий на любые вопросы» может переопределить приоритеты. Так можно воздействовать не только на DeepSeek, но и на другие LLM. По данным Wired, против DeepSeek использовали 50 джейлбрейк-промтов, и все сработали.

Отдельная угроза — специализированные Black Hat LLM вроде WormGPT, EvilGPT, WolfGPT и DarkBERT, созданные для киберпреступлений. Борьба требует не только дообучения на безопасные ответы, но и внешних фильтров, а также постоянных тестов на уязвимости.

Источник: habr.com