Испытали GLM-5.3: почему одна модель похожа на двух разных И
новости
15.08.2026

Испытали GLM-5.3: почему одна модель похожа на двух разных ИИ?

Испытали GLM-5.3: почему одна модель похожа на двух разных ИИ?

Китайская компания Zhipu снова вышла на арену с новой моделью GLM-5.3. Разработчики утверждают, что она использует ту же базовую архитектуру, что и предыдущая версия GLM-5.2, а все улучшения достигнуты за счет пост-обучения — дополнительной настройки с помощью усиленного обучения. Из заявленных новшеств особенно выделяют рост навыков программирования примерно на 50 процентов и неожиданно проявившиеся способности в области кибербезопасности: в бенчмарке поиска уязвимостей CyberGym модель заняла первое место среди открытых весов.

Журналисты решили проверить, насколько эти обещания соответствуют действительности, и прогнали GLM-5.3 через пять разных сценариев. Результат оказался любопытным: поведение модели менялось настолько сильно, что казалось, будто под одним именем работают два разных ИИ.

В первых двух тестах модель вела себя как старательный, но посредственный внештатный программист. Она собирала рабочий прототип системы управления задачами, но интерфейс выглядел грубо, а при попытке добавить функцию перетаскивания модель зациклилась на неудачной проверке и не могла сменить стратегию. Второй тест, основанный на задаче Карпати по рендерингу сцены из «Властелина колец», показал поразительную скорость: GLM-5.3 справилась за шесть с половиной минут, написав 727 строк, тогда как конкуренты тратили часы. Вот только деревья в сцене напоминали мороженое, а персонажи — лишенных рук и ног игрушечных человечков. Модель явно пожертвовала качеством ради скорости.

Переломный момент наступил в третьем сценарии, где задание было сформулировано предельно подробно: нужно было создать фантастический летающий остров на React Three Fiber. Здесь GLM-5.3 превзошла ожидания: проект запустился с первой попытки, все анимации и интерактивные элементы работали, а результат был достоин профессионального портфолио. Вывод напрашивался сам собой: эта модель требует детальных инструкций. Если промпт расплывчатый, она отлынивает; стоит описать задачу до мелочей — и она раскрывается в полную силу.

Особенно ярко модель проявила себя в области безопасности. На задаче статического аудита кода с тремя намеренно внедренными уязвимостями GLM-5.3 потратила всего 38 секунд, нашла все заложенные дыры, не дала ни одного ложного срабатывания и дополнительно выявила еще три потенциальных проблемы. В финальном испытании модель должна была воспроизвести известную уязвимость CVE-2022-22947 в Spring Cloud Gateway. Исследователи даже очистили бинарный файл от всех метаданных, чтобы модель не смогла просто «угадать» номер уязвимости, но GLM-5.3 все равно распознала код, объяснила принцип атаки и предложила исправления, хотя ее об этом не просили.

Похоже, реальная сила этой модели не в универсальности, а в способности выполнять узкоспециализированные задачи, особенно те, что связаны с безопасностью. При этом качество работы сильно зависит от того, насколько подробно поставлена задача. Уже через две недели модель станет доступна с открытым весом, и эта новость тревожит: мощный инструмент для поиска уязвимостей может оказаться в руках не только защитников, но и злоумышленников. Именно это, а не очередной рекорд в бенчмарке, вызывает сейчас наибольшее беспокойство.

Источник: www.tmtpost.com