Новый трюк раскрыл внутренние мысли ИИ-моделей
новости
11.08.2026

Новый трюк раскрыл внутренние мысли ИИ-моделей

Новый трюк раскрыл внутренние мысли ИИ-моделей

Исследователи нашли способ извлекать скрытые цепочки рассуждений, которые передовые нейросети строят при решении сложных задач. Метод, описанный в статье (A New Trick Reveals AI Models’ Inner Thoughts), сработал против API-версий моделей OpenAI, Anthropic и Google. По словам учёных, он не только показывает «мысли» алгоритмов, но и открывает путь к масштабной дистилляции рассуждений, а также позволял вытаскивать из моделей личные данные — вплоть до паролей и API-ключей.

Авторы работы, представляющие Университет Тюбингена, Институт Макса Планка, организацию MATS Research и компанию Snyk, обнаружили, что подмена зашифрованных данных и отправка их в меньшую версию той же модели позволяют раскрыть скрытые шаги рассуждений. Младшие модели получают меньше выравнивания и охотнее делятся внутренними вычислениями. Такой приём помог заметить, что открытая китайская модель Kimi K3 от Moonshot AI выдаёт для некоторых запросов результаты, подозрительно похожие на цепочки рассуждений Claude Opus 4.8 и GPT 5.6 Sol.

Впрочем, авторы подчёркивают: это не окончательное доказательство дистилляции, поскольку сходство не позволяет установить причинно-следственную связь. Две другие открытые модели — DeepSeek и созданная американской компанией Thinking Machines модель Inkling — подобного сходства с Claude не показали. OpenAI, Anthropic и Google уже внесли изменения в свои API, чтобы закрыть уязвимость. Представитель Anthropic сообщил, что компания начала внедрять краткосрочные меры защиты, а само исследование не затрагивало её инфраструктуру и личные данные пользователей.

Тема дистилляции приобрела политический оттенок: западные политики и компании подозревают китайских разработчиков в копировании лучших американских моделей. Однако сама техника давно и широко применяется для быстрого улучшения способностей ИИ, и в новой работе нет утверждений, что китайские компании использовали именно этот метод. По словам специалистов, полное устранение риска потребовало бы фундаментальной перестройки того, как устроены API крупнейших производителей моделей.

Источник: www.wired.com