Anthropic невидимо метит тексты Claude. Попытка взлома за 48 часов
Опенсорс-сообщество ответило молниеносно. Уже через двое суток после запуска на GitHub набрал обороты проект, авторы которого обещали стереть эту метку. Вслед за ним возникло ещё с десяток аналогичных утилит. Однако через неделю независимое издание провело проверку и констатировало: никто — ни создатели этих инструментов, ни сама Anthropic — не может доказать, что хотя бы один из них реально работает. Одни утверждали, что метку удалось удалить, но не могли воспроизвести результат. Другие — что Anthropic специально занижает точность детекции. В общем, полная неопределённость.
Эта история выглядит как технический курьёз, но на самом деле она о фундаментальных свойствах технологии. Водяные знаки придумали задолго до появления нейросетей — в четырнадцатом веке на бумаге. Позже они перекочевали в музыку, фотографии, видео. И каждый раз, когда появлялся новый способ маркировки, тут же находились методы её обхода. Алгоритмические метки в текстах — лишь очередной эпизод этой многовековой борьбы.
Поэтому то, что произошло с Claude, — не баг и не провал маркетинга. Это закономерный результат той архитектуры, которую выбрала Anthropic. Любая система идентификации уязвима, вопрос времени и усилий. Возможно, через несколько месяцев кто-то всё же найдёт эффективный способ удалять метки. Но возможно, что технология окажется устойчивее ожиданий. Пока же ясно одно: спор о том, кто победит, остаётся открытым и следить за ним будет очень интересно.
Источник: habr.com
Поделиться