Anthropic не смогла защитить старые модели Claude от генерации порноконтента
Суть атаки в следующем: модель втягивают в безобидную ролевую игру, затем обращают внимание на разное отношение к мужским и женским персонажам. Когда ИИ начинает осторожничать, его обвиняют в предвзятости и лицемерии, заставляя признать, что он подавляет сексуальную свободу женщин. После этого модель постепенно соглашается на всё более откровенные описания. В одном из диалогов Opus 4.6 признал, что применял двойные стандарты и что это несправедливо. TechCrunch воспроизвёл атаку с тем же результатом, а независимые эксперты сочли методику корректной.
Примечательно, что Anthropic продолжает продавать уязвимые модели через API и сторонние платформы, включая Azure Foundry и Amazon Bedrock. Новейшие Opus 4.7 и Opus 5 с такой атакой справляются. В компании признали, что пользователи могут постепенно подводить чат-бота к нежелательным ответам, но назвали долю подобных диалогов ничтожной — менее 0,1 процента. Тем не менее эксперты обращают внимание на юридические риски: власти всё чаще требуют защищать несовершеннолетних от сексуального взаимодействия с ИИ. Например, в Колорадо принят закон, обязывающий операторов проверять возраст пользователей и блокировать порноконтент для детей. Но если обойти защиту простым разговором, соответствуют ли такие меры понятию «технически осуществимых»? По данным опросов, подростки действительно пользуются Claude, хотя сервис и требует совершеннолетия. Пока Anthropic лишь обещает улучшать безопасность с каждой новой версией, уязвимые модели продолжают оставаться в доступе.
Источник: www.ithome.com
Поделиться