GLM-5.3 без переобучения базовой модели: скачок в коде и кибербезопасности

Z.ai выпустила GLM-5.3 — новую версию своей языковой модели, которая работает на той же базовой модели с 743B параметров, что и GLM-5.2. Все улучшения получены за счёт масштабирования пост-обучения: больше сред выполнения задач, больше их типов и более длительное обучение. Результаты впечатляют в двух областях — написании кода и кибербезопасности. Веса модели пока не опубликованы.

Как устроена GLM-5.3

Ключевая особенность релиза в том, что базовая модель не переобучалась. Это значит, что все заявленные улучшения — следствие пост-обучения, а не изменения архитектуры или датасета предобучения. Такой подход позволяет быстрее выпускать обновления и экономить вычислительные ресурсы.

Наибольший скачок в кодинге заметен на самых сложных долгосрочных бенчмарках. Terminal-Bench 3.0 вырос с 4.6 до 28.3, DeepSWE v1.1 — с 46.2 до 66.9, Agents’ Last Exam (CLI) — с 23.8 до 28.5. На GDPval-AA v2, охватывающем 44 профессии, модель набрала 1 769 баллов.

На внутреннем бенчмарке Z.ai Code Bench компания сообщает об улучшении на 50% по сравнению с GLM-5.2: 31.4% при примерно 50 000 выходных токенов на задачу. Для сравнения, Claude Opus 4.8 показывает 29.5% при 120 000 токенов, а Claude Fable 5 лидирует с 39.5% при максимальных усилиях. В Z.ai отмечают, что частный бенчмарк снижает риск загрязнения данных.

На публичных тестах GLM-5.3 уступает GPT-5.6 Sol и Fable 5 на нескольких сложных задачах по программированию. Все цифры предоставлены вендором, параметры тестов задокументированы в анонсе.

Неожиданный результат в кибербезопасности

В Z.ai признают, что результат в кибербезопасности оказался незапланированным. Компания добавила данные по поиску уязвимостей, ожидая улучшения рассуждений об отдельных ошибках, но вместо этого способности модели продолжили расти по мере масштабирования обучения. Модель начала строить связные планы полных цепочек эксплуатации.

На CyberGym, который тестирует обнаружение и валидацию уязвимостей по исходному коду, результат вырос с 77.2% до 84.5%, обойдя Mythos 5 (83.8%) и GPT-5.6 Sol (83.6%). ExploitBench, требующий анализа первопричины и рабочего эксплойта, вырос с 24.4% до 54.4%, хотя Mythos 5 держится на 78.0%. На ExploitGym GLM-5.3 выполнила 105 задач за два часа и 130 за шесть, тогда как GLM-5.2 — 29 и 39 соответственно. Mythos 5 выполнила 181 и 247.

Закономерность устойчивая: чем глубже бенчмарк находится в цепочке эксплуатации, тем больше прирост относительно GLM-5.2. При этом разрыв с закрытыми frontier-моделями также увеличивается.

Доступность и развёртывание

GLM-5.3 доступна частично: модель уже работает через Z.ai API, GLM Coding Plan и ZCode. Веса пока не опубликованы — компания обещает выпустить их примерно через две недели после запуска, когда завершатся оценка безопасности и ужесточение защиты.

Стартапы и инженерные организации среднего размера могут внедрить модель уже сегодня через Coding Plan или API. Предприятиям с требованиями к резидентности данных или правилами проверки вендоров стоит дождаться весов. Наибольший сигнал и одновременно наибольший политический риск получают вендоры безопасности и MSSP.

Сферы применения: рефакторинг на уровне репозиториев, долгосрочные CLI-агенты, разбор сбоев CI, выявление уязвимостей «в белую», разбор крахов и безопасный ревью кода. Для сравнения с открытыми альтернативами стоит посмотреть, как устроен запуск крупных моделей на серверном железе, например разбор Qwen3.8-2.4T-A95B на GB300 NVL72.

Отдельного внимания заслуживает направление специализированных моделей: если GLM-5.3 показывает сильные результаты в кибербезопасности как побочный эффект общего обучения, то существуют и узкоспециализированные решения, например модель Fugu-Cyber от Sakana AI для задач кибербезопасности.

Частые вопросы

Что такое GLM-5.3 и чем она отличается от GLM-5.2?

GLM-5.3 — новая версия модели Z.ai, которая использует ту же базовую модель на 743B параметров, что и GLM-5.2. Все улучшения достигнуты за счёт масштабирования пост-обучения, а не переобучения базовой модели.

Насколько выросли показатели в кодинге?

Terminal-Bench 3.0 вырос с 4.6 до 28.3, DeepSWE v1.1 — с 46.2 до 66.9, Agents’ Last Exam (CLI) — с 23.8 до 28.5. На внутреннем бенчмарке Z.ai Code Bench улучшение составило 50%.

Почему результат в кибербезопасности называют неожиданным?

Z.ai добавляла данные по поиску уязвимостей, ожидая улучшения рассуждений об отдельных ошибках, но вместо этого способности модели к построению полных цепочек эксплуатации продолжили расти по мере масштабирования обучения.

Когда будут доступны веса модели?

Z.ai обещает опубликовать веса примерно через две недели после запуска, после завершения оценки безопасности и ужесточения защиты.

Кому стоит внедрять GLM-5.3 уже сейчас?

Стартапам и инженерным организациям среднего размера — через Coding Plan или API. Предприятиям с требованиями к резидентности данных стоит дождаться публикации весов.

Какие конкурирующие модели показывают лучшие результаты?

На публичных тестах GLM-5.3 уступает GPT-5.6 Sol и Claude Fable 5 на нескольких сложных задачах по программированию. В кибербезопасности Mythos 5 опережает её на ExploitBench и ExploitGym.

В чём преимущество частного бенчмарка Z.ai Code Bench?

По утверждению компании, частный бенчмарк снижает риск загрязнения данных, когда модель видит тестовые примеры во время обучения.

Источник: marktechpost.com