1. VEGA
  2. Блог
  3. GLM-5.3: кодинг на фронтире и неожиданные кибер-способности
14 августа 2026 г.

GLM-5.3: кодинг на фронтире и неожиданные кибер-способности

Z.ai выпустила GLM-5.3 — и это не просто точечный апдейт. Базовая модель осталась прежней (та же, что у GLM-5.2), но вся сила пошла в post-training: больше сред, больше задач, больше вычислений. Результат — модель, которая ощутимо лучше справляется со сложным кодингом и длинными агентными задачами.

Что нового

  • Кодинг стал мощнее: GLM-5.3 — самая сильная open-weights модель для программирования. На внутреннем бенчмарке Z.ai Code Bench прирост составил 50% относительно GLM-5.2. На публичных бенчмарках — Terminal Bench 3.0 и Agents' Last Exam — модель забирает open-source SOTA.
  • Неожиданные кибер-способности: когда мы масштабировали post-training, кибер-навыки выросли быстрее, чем мы ожидали. GLM-5.3 — лучшая на рынке для поиска уязвимостей (CyberGym), а на exploitation-бенчмарках она более чем удваивает результат GLM-5.2.
  • Open Source: веса выложим через две недели после релиза — после завершения safety-эвалюации и харденинга.
Сравнение производительности GLM-5.3 с другими моделями

Кодинг: дальше — больше

Для GLM-5.3 мы выкатили среды, которые выглядят не как учебные задачки, а как настоящая работа инженера. Некоторые задания представляют собой несколько дней работы опытного разработчика. Например, модель получает доступ к кластерам вычислений, хранилищам, документации, кодовым базам и результатам экспериментов — и должна найти узкие места в тренировочном стеке, внедрить оптимизации, прогнать эксперименты и выдать измеримый end-to-end прирост скорости, не сломав корректность.

Когда агентские способности растут, главная сложность переходит с модели на среду. Нужны задачи, которые запускаются, проверяются и похожи на реальную работу — и их нужно много, а не с десяток hand-made. Чтобы это масштабировать, мы построили пайплайны, которые синтезируют среды end-to-end. Исследовательские агенты собирают паттерны задач из реальной работы и превращают их в runnable long-horizon среды с многошаговыми зависимостями и скрытым состоянием. Затем judge-агент пытается решить задачу — если получается, среда годится для тренировки.

GLM-5.3 переняла RL-стратегии из GLM-5.2, включая SAO с компактизацией — это помогает удерживать gains на длинных задачах, а не только на коротких. Результат: Terminal-Bench 3.0 подскочил с 4.6 до 28.3, DeepSWE v1.1 — с 46.2 до 66.9, Agents' Last Exam — с 23.8 до 28.5.

Z.ai Code Bench: производительность и токен-эффективность

На внутреннем Z.ai Code Bench GLM-5.3 обходит GLM-5.2 на каждом уровне усилий, тратя при этом меньше выходных токенов. На Max-режиме модель набирает 34.5% при ~75K токенов на задачу — против 23.4% при 96K у GLM-5.2. На High-режиме GLM-5.3 достигает 31.4% при ~50K токенов, обгоняя Claude Opus 4.8 (29.5% при 120K). Пока впереди только Claude Fable 5 с 39.5% на Max.

Кибер-способности: сюрприз пост-тренинга

В post-training мы добавили данные и среды для поиска уязвимостей. Ожидали, что модель станет лучше находить и анализировать баги. Но то, как быстро навык развивался по мере масштабирования — это стало сюрпризом. GLM-5.3 не просто научилась находить отдельные дыры: она начала выстраивать целые цепочки эксплойтов, связывая несколько стадий эксплуатации в единый план.

Кибер-возможности GLM-5.3

Три бенчмарка — три стадии анализа уязвимостей:

  • CyberGym (white-box анализ исходного кода): GLM-5.3 набирает 84.5% — лучший результат, впереди Mythos 5 (83.8%) и GPT-5.6 Sol (83.6%). У GLM-5.2 было 77.2%.
  • ExploitBench (глубокий анализ реальных уязвимостей): 54.4% — больше чем в два раза против 24.4% у GLM-5.2.
  • ExploitGym (эксплойты под временным бюджетом): 105 задач за 2 часа и 130 за 6 часов — против 29 и 39 у GLM-5.2.

Потом мы проверили, переносится ли это на реальный код. Начиная с GLM-5.2, мы работали с несколькими security-командами в Китае и гоняли модель на реальных кодовых базах. После экспертизы и дедупликации модель нашла 2,436 уязвимостей в 269 проектах, включая 1,097 средних и критических. Дыры нашлись в системных ядрах, ОС, браузерных движках, опенсорс-инфраструктуре, веб-приложениях и сетевых протоколах. Многие жили незамеченными годами или даже десятилетиями — самая старая датируется примерно 1981 годом.

Мы запустили Z.ai Security Disclosure Ledger — публичный реестр находок, который обновляется по мере прохождения disclosure-процесса.

slime: фреймворк для RL-масштабирования

Всё это работает на slime — нашем open-source post-training фреймворке. Megatron на стороне тренировки, SGLang на стороне rollout. Дизайн держит тренировку, rollout и буфер данных на едином dataflow — поэтому математика, код, песочницы, верификаторы и long-horizon среды подключаются как генерация данных, а не как изменения в тренировочном цикле.

Через GLM-5.3 мы развивали slime в двух направлениях. Алгоритмически — добавили top-p mask, top-k и full-vocabulary OPD, а также конфигурации для согласованности training-rollout (R3-style setup, полное числовое выравнивание). Средняя разница в log-prob контролируется на уровне 1e-7 — это снижение более чем на 99.99% по сравнению с предыдущими настройками.

Системно — локальное хранилище как дополнительный кэш-слой для состояний модели, что критично для multi-teacher OPD. Улучшена совместная маршрутизация и балансировка нагрузки между роутером и slime для rollout-запросов с сильно разной длиной. В итоге end-to-end throughput RL-тренировки вырос более чем в 2.3 раза.

API: что изменилось

GLM-5.3 поддерживает три уровня thinking: low, high и max. Отключить thinking больше нельзя — запрос с thinking.type: "disabled" упадёт с ошибкой. Для кодинга рекомендуется max.

{
  "model": "glm-5.3",
  "thinking": { "type": "enabled" },
  "reasoning_effort": "max"
}

Миграция: если у вас сейчас thinking.type: "disabled", поменяйте на enabled и поставьте reasoning_effort: "low" — иначе после обновления model ID до glm-5.3 запрос сломается.

GLM Coding Plan и ZCode

GLM-5.3 уже доступна всем подписчикам GLM Coding Plan. Новый план работает по поинтовой системе: отдельно считаются input, cached input и output токены. Вне пиковых часов (пик — 14:00–18:00 UTC+8, пн–пт) расход поинтов снижен на 50%.

ZCode даёт дополнительные плюсы: 98%+ cache hit rate, полуторный буст квоты до конца августа, Goal mode для долгих задач и удалённый контроль через WeChat или Feishu.

Веса GLM-5.3 будут опубликованы через две недели после релиза.

VEGA - создано в getmyai
ОфертаПолитика обработки ПДПолитика рассылки