Новый трюк раскрыл внутренние мысли ИИ-моделей
Авторы работы, представляющие Университет Тюбингена, Институт Макса Планка, организацию MATS Research и компанию Snyk, обнаружили, что подмена зашифрованных данных и отправка их в меньшую версию той же модели позволяют раскрыть скрытые шаги рассуждений. Младшие модели получают меньше выравнивания и охотнее делятся внутренними вычислениями. Такой приём помог заметить, что открытая китайская модель Kimi K3 от Moonshot AI выдаёт для некоторых запросов результаты, подозрительно похожие на цепочки рассуждений Claude Opus 4.8 и GPT 5.6 Sol.
Впрочем, авторы подчёркивают: это не окончательное доказательство дистилляции, поскольку сходство не позволяет установить причинно-следственную связь. Две другие открытые модели — DeepSeek и созданная американской компанией Thinking Machines модель Inkling — подобного сходства с Claude не показали. OpenAI, Anthropic и Google уже внесли изменения в свои API, чтобы закрыть уязвимость. Представитель Anthropic сообщил, что компания начала внедрять краткосрочные меры защиты, а само исследование не затрагивало её инфраструктуру и личные данные пользователей.
Тема дистилляции приобрела политический оттенок: западные политики и компании подозревают китайских разработчиков в копировании лучших американских моделей. Однако сама техника давно и широко применяется для быстрого улучшения способностей ИИ, и в новой работе нет утверждений, что китайские компании использовали именно этот метод. По словам специалистов, полное устранение риска потребовало бы фундаментальной перестройки того, как устроены API крупнейших производителей моделей.
Источник: www.wired.com
Поделиться