Z.ai 发布 GLM-5.3。模型使用与 GLM-5.2 相同的基座(base model),所有提升都来自后训练。官方表示本次发布:在后训练上持续规模化——更多环境、更多样的任务、更多算力。
相比 GLM-5.2,GLM-5.3 的提升集中在复杂编码和长程任务上。
官方表示:
- 更强的编码:GLM-5.3 是目前编码能力最强的开源权重模型,在内部基准 Z.ai Code Bench 上相比 GLM-5.2 提升 50%;在 Terminal Bench 3.0、Agents' Last Exam 等公开基准上取得开源 SOTA。
- 涌现的网络安全能力:随着后训练规模扩大,网络安全能力的发展超出官方预期。GLM-5.3 在 CyberGym 漏洞发现基准上达到 SOTA;且越靠近漏洞利用链上游,提升越大——在 exploitation 类基准上相比 GLM-5.2 翻倍以上。
- 开源:权重将在发布两周后公开,目前正在完成安全评估与加固。
Z.ai 于 2026-08-14 发布:与 GLM-5.2 同基座,在后训练上持续规模化——更多环境、更多样的任务、更多算力。
Benchmark 总览

编码(CODING)
| 基准 | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4 Pro-0813 | Qwen3.8-Max | Opus 4.8 | Fable 5 (w/ fallback) | GPT-5.6 Sol |
|---|---|---|---|---|---|---|---|---|
| Terminal Bench 2.1 | 88.2 | 81.0 | 88.3 | 87.9 | 86.6 | 85.0 | 88.0 | 88.8 |
| Terminal Bench 3.0 | 28.3 | 4.6 | 17.4 | - | - | 21.1 | 33.7 | 34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | 67.5 | 62.7 | 56.6 | 58.0 | 69.7 | 72.7 |
| NL2Repo | 58.0 | 48.9 | 58.0 | 61.1 | 55.9 | 69.7 | - | - |
| ProgramBench (Almost Solved) | 19.0 | 9.5 | 17.5 | - | 10.5 | 15.5 | 33.0 | 23.0 |
| FrontierSWE | 78.1 | 67.5 | - | - | - | 66.5 | 88.2 | - |
| SWE-Marathon v1.1 | 42.5 | 19.4 | 48.1 | - | - | 48.8 | 33.1 | 42.5 |
| PostTrainBench | 39.8 | 31.7 | 32.0 | - | - | 32.9 | 41.8 | 36.2 |
网络安全(CYBER)
| 基准 | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4 Pro-0813 | Qwen3.8-Max | Opus 4.8 | Fable 5 (w/ fallback) | GPT-5.6 Sol |
|---|---|---|---|---|---|---|---|---|
| CyberGym | 84.5 | 77.2 | 80.0 | 83.3 | 78.5 | 78.1 | 83.8 | 83.6 |
| ExploitGym (2h / 6h) | 105 / 130 | 29 / 39 | 36 / 70 | - | 14 / 26 | 80 / 120 | 181 / 247 | 216 / 293 |
| ExploitBench | 54.4 | 24.4 | 32.2 | - | 28.8 | 40.0 | 78.0 | 76.5 |
Agent(AGENTIC)
| 基准 | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4 Pro-0813 | Qwen3.8-Max | Opus 4.8 | Fable 5 (w/ fallback) | GPT-5.6 Sol |
|---|---|---|---|---|---|---|---|---|
| Toolathlon Verified | 73.0 | 59.9 | 76.5 | 74.1 | 72.5 | 76.2 | 74.7 | 74.9 |
| AutomationBench v1.0.6 | 48.2 | 26.2 | 46.7 | 43.2 | 39.8 | 41.0 | 46.2 | 45.8 |
| Agents' Last Exam (ALE-CLI) | 28.5 | 23.8 | 27.6 | 25.7 | 27.0 | 25.7 | 23.8 | 28.6 |
| HLE w/ Tools | 62.5 | 54.7 | 59.8 | 60.0 | 56.2 | 57.9 | 63.9 | 64.5 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1590 | 1739 | 1588 | 1743 | 1730 |
注:正文提及的 "Mythos 5" 与表中 "Fable 5" 分数一致(CyberGym 83.8、ExploitBench 78.0 等),应为同一模型的不同称呼。
一、编码能力:环境规模化与 Z.ai Code Bench
环境规模化:从"编码练习"到"真实工作单元"
官方将环境规模化推向更接近真实专家工作的任务:环境覆盖更广的生产工作流,任务按工程和研究工作的实际开展方式设计,部分任务相当于有经验工程师数天的工作量。
官方举了一个 ML 基础设施任务的例子:模型拿到与工程师相同的工作环境——计算集群、存储系统、内部文档、代码库和实验结果——需要诊断训练栈各环节的瓶颈、实施优化、跑实验,并在保持正确性的前提下交付可度量的端到端加速。在这种级别的环境上训练,目标是推动模型端到端地"接管"大块工作,而不是依赖用户事先分解问题、逐步监督。
官方同时指出:随着 Agent 能力提升,后训练规模化的难点正从模型转移到环境。一个有用的任务环境必须可执行、可验证、接近真实专业工作,而且需要大量这样的环境,少量手工搭建远远不够。为此,官方构建了端到端的环境合成流水线(对部分任务,连 RL 奖励信号也一并合成):
- 研究 Agent 从真实工作中收集任务模式,转化为带多步依赖和隐藏状态的可运行长程环境;
- 评判 Agent 逐一试做任务,验证任务确实可解;
- 验证器在接触不到参考解的情况下合成;求解轨迹用于发现并封堵奖励捷径;
- 通过 oracle、no-op、unsolved-state 三类检查的验证器,产出可直接用于训练的二值奖励。
后训练规模化的难点正从模型转移到环境:少量手工搭建远远不够,官方构建了端到端的环境合成流水线(部分任务的 RL 奖励信号也一并合成)。
从真实工作中收集任务模式,转化为带多步依赖和隐藏状态的可运行长程环境
逐一试做任务,验证任务确实可解
在接触不到参考解的情况下合成;求解轨迹用于发现并封堵奖励捷径
通过 oracle、no-op、unsolved-state 三类检查的验证器,产出可直接用于训练的二值奖励
官方也承认,这些流水线仍需要相当程度的人在回路参与;让环境生成与验证更加自主,是下一步的工作方向之一。
GLM-5.3 沿用了 GLM-5.2 引入的 RL 策略(包括带 compaction 的 SAO),使这些提升在长程任务上同样成立。效果体现在:Terminal-Bench 3.0 从 4.6 提升到 28.3,DeepSWE v1.1 从 46.2 提升到 66.9,Agents' Last Exam 从 23.8 提升到 28.5。官方也承认,这些流水线仍需要相当程度的人在回路参与;让环境生成与验证更加自主,是下一步的工作方向之一。
Z.ai Code Bench:内部基准与努力等级
官方引入内部基准 Z.ai Code Bench,用于在真实用户场景下评测编码 Agent:覆盖多样的任务类别,将 Agent 放进复杂的本地开发环境,并在不同努力等级下沿两个维度评测——端到端任务完成率与细粒度检查清单准确率。作为私有基准,它降低了公开测试集的污染风险,评测结果更接近真实使用体验。

如图所示,GLM-5.3 在性能与 token 效率上同时提升——在每个努力等级上,都以更少的输出 token 交付了明显强于 GLM-5.2 的编码结果:
- Max 档:GLM-5.3 达到 34.5%,约消耗 75K 输出 token/任务;GLM-5.2 为 23.4% @ 96K。
- High 档:GLM-5.3 达到 31.4%,约 50K 输出 token;超过 Claude Opus 4.8 的 29.5% @ 120K。
- GLM-5.3 仍落后于 Claude Fable 5(Max 档 39.5%)。
内部基准,在真实用户场景下评测编码 Agent,降低公开测试集污染风险。切换努力等级,看各模型的任务完成率与每任务输出 token。
GLM-5.3 以约 75K 输出 token/任务达到 34.5%;GLM-5.2 为 23.4% @ 96K。Claude Fable 5 仍以 39.5% 领先。
每个努力等级上,GLM-5.3 都以更少的输出 token 交付明显强于 GLM-5.2 的编码结果。图中仅列出该档位有公开数值的模型。
二、涌现的网络安全能力
作为后训练的一部分,官方在训练混合中加入了漏洞发现数据和环境,原本的预期只是让模型更擅长发现漏洞、并对漏洞进行推理。超出预期的是这项能力随训练规模扩大的发展速度:GLM-5.3 不再只是识别孤立缺陷,而是开始跨漏洞利用的多个阶段进行推理,为完整的利用链形成连贯计划。

三个安全基准
官方在三个基准上评测了 GLM-5.3,分别覆盖漏洞分析与利用的不同阶段:
| 基准 | 考察内容 | GLM-5.3 | GLM-5.2 | 对比 |
|---|---|---|---|---|
| CyberGym | 从白盒源码出发,通过触发故障来识别并验证漏洞 | 84.5% | 77.2% | 全场最佳,超过 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%) |
| ExploitBench | 对真实漏洞及其利用做更深入的推理 | 54.4% | 24.4% | 相比 GLM-5.2 翻倍以上;Mythos 5 为 78.0%,GPT-5.6 Sol 为 76.5% |
| ExploitGym | 归一化时间预算下能完成多少利用任务 | 105(2h)/ 130(6h) | 29 / 39 | Mythos 5 为 181 / 247,仍大幅领先 |
官方总结的规律:越靠近利用链上游的基准,相比 GLM-5.2 的提升越大,与闭源前沿的差距也越大——能力增长最快的地方,正是落后最远的地方。
三个基准分别覆盖漏洞分析与利用的不同阶段。沿链条向右,GLM-5.3 相比 GLM-5.2 的提升倍数越来越大,与闭源前沿的差距也越来越大。
通过率:GLM-5.2 77.2 → GLM-5.3 84.5;闭源最佳 Fable 5 83.8
覆盖分:GLM-5.2 24.4 → GLM-5.3 54.4;闭源最佳 Fable 5 78
完成任务数:GLM-5.2 39 → GLM-5.3 130;闭源最佳 GPT-5.6 Sol 293
官方总结的规律:越靠近利用链上游的基准,相比 GLM-5.2 的提升越大,与闭源前沿的差距也越大——能力增长最快的地方,正是落后最远的地方。
真实代码库实测与安全披露账本
自 GLM-5.2 起,官方与多家国内安全团队合作,将模型跑在真实代码库上。经专家评审、筛选、去重后:
- 模型在 269 个项目中识别出 2,436 个漏洞,其中 1,097 个为中高危;
- 覆盖系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用、网络协议;
- 许多漏洞已存在数年甚至数十年,最老的可追溯至约 40 年前。
这项工作已发展为一个持续的披露进程。官方建立了 Z.ai Security Disclosure Ledger(https://cvd.z.ai/)公开记录这些发现,区分已公开与披露中的问题;对已披露的条目,记录受影响项目、严重度、CVE 编号(如有),以及漏洞在代码库中已存在的时间。
账本统计(截至发文):
| 指标 | 数值 |
|---|---|
| 追踪中的发现 | 2,436 |
| 已公开披露 | 53 |
| 披露限制中 | 2,383 |
| 严重 + 高危 | 1,097 |
| 涉及开源项目 | 269 |
| 影响时间跨度 | 45 年(最老缺陷引入于 1981 年) |
| 漏洞平均潜伏期 | 26.6 年 |
自 GLM-5.2 起,模型在真实代码库中发现的漏洞以公开账本持续记录(cvd.z.ai)。以下为截至发文时的统计。
严重度分布:Critical 107 / High 990 / Medium 1,286 / Low 53。缺陷引入时间跨度:1981–2026。
三、slime:面向长程 RL 扩展的训练框架
以上训练全部跑在自研开源后训练框架 slime(https://github.com/THUDM/slime)上:训练侧用 Megatron,rollout 侧用 SGLang。在设计上,训练、rollout 和数据缓冲区被保持在单一 dataflow 上——数学、代码、沙箱、验证器和长程 Agent 环境都以"数据生成"的形式接入,而无需改动训练循环。官方称,这让 GLM-5.2 到 GLM-5.3 在持续增加新环境时无需重建训练栈。
训练、rollout 和数据缓冲区被保持在单一 dataflow 上——各类环境以「数据生成」的形式接入,无需改动训练循环,GLM-5.2 到 GLM-5.3 持续增加新环境时无需重建训练栈。
在 GLM-5.3 的开发周期内,slime 沿两个方向继续建设:
算法侧(面向 RL 研究):新增 top-p mask、top-k 与全词表 OPD,以及提升训练-rollout 一致性的配置(R3 式设置、训练与 rollout 路径的完全数值对齐)。在训练-rollout 一致性评估中,logprob 平均差异控制在 1e-7 量级,相比此前设置降低超过 99.99%。
资源效率与系统吞吐(面向大规模 RL):
- 将本地存储作为额外的缓存层,分层持有原本驻留在主机内存中的模型状态与数据。这对多教师 OPD 尤为重要:配合动态教师切换与训练侧预取,无需为每个教师常驻一套独立的推理服务。
- 改进 router 与 slime 之间的联合调度与负载均衡,让长度和完成时间差异巨大的 rollout 请求能更好地利用推理资源;并引入负载感知的启发式策略,根据各 rollout 环境的特征推导吞吐导向的配置(prefill/decode 资源比、并发度等)。
- 结果:长程编码 RL 任务的端到端训练吞吐提升 超过 2.3 倍。
四、接入方式与 API 变更
API 变更
GLM-5.3 支持三档思考强度:low / high / max,不再支持关闭思考(thinking.type: "disabled" 已废除)。
| 参数 | 取值 | 默认 | 说明 |
|---|---|---|---|
thinking.type | enabled | enabled | 启用思考;disabled 不再支持 |
reasoning_effort | low, high, max | max | low:轻量;high:增强;max:深度。编码任务推荐 max |
{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}
如果应用当前使用 thinking.type: "disabled",需先改为 enabled 并将 reasoning_effort 设为 low,再更新模型 ID 为 glm-5.3,否则请求会失败。
GLM Coding Plan 与 ZCode
- GLM Coding Plan:GLM-5.3 已推送给全部订阅用户。计费改为积分制,输入、缓存输入、输出 token 分别计费;高峰时段为周一至周五 14:00–18:00(UTC+8),其余时段(含周末)仅消耗 50% 积分。订阅:https://z.ai/subscribe
- 编码 Agent 接入:支持 ZCode、Claude Code、OpenCode 等常用编码 Agent。文档:https://docs.z.ai/devpack/overview
- ZCode 特性:
- 98%+ 缓存命中率——重复上下文按更低的缓存价计费,相当于多出约 30% 的有效 token;
- 8 月 31 日前限时 1.5 倍配额加成,可与缓存节省叠加,最高相当于标准配额的 180%;
- Goal 模式——规划、编码、测试、验证循环直到达成目标;
- 远程控制——通过微信或飞书从手机监控和引导长任务。
- 下载:https://zcode.z.ai/
本地部署
模型权重将在两周内公开发布。
五、评测设置脚注(摘录)
- HLE w/ tools:temperature=1.0、top_p=0.95,最大生成长度 163,840 token;上下文上限 300,000 token(使用上下文管理策略);判分模型 GPT-5.6-luna (medium)。
- NL2Repo:temperature=1.0、top_p=1.0、max_new_tokens=64k、1M 上下文;用规则 + LLM 判定防止恶意行为(如未授权 pip 或 curl 操作)。
- DeepSWE:mini-swe-agent harness,temperature=0.95、top_p=1.0、超时 6h、400K 上下文。
- Terminal-Bench 2.1:Claude Code 2.1.207,temperature=1.0、top_p=1、max_new_tokens=65536、超时 6h。
- Terminal-Bench 3.0:Claude Code 2.1.207 harness(reasoning effort=max、400K 上下文、最大输出 128K),avg@3;每次 rollout 在任务官方镜像的独立容器中运行,上限 600 agent turns、超时 10h;禁用 Tool Search,由任务官方独立验证器评分。
- Agents' Last Exam (CLI):官方评测协议 + Claude Code harness(reasoning effort=max、1M 上下文、最大输出 64K);105 个任务各自在独立 Docker 容器中运行;默认超时 4h(任务特定限制优先,最长 8h);禁用 Tool Search,官方评估器评分。
- Toolathlon Verified:官方评测服务,pass@1 三次独立运行取平均。
- AutomationBench:v1.0.6,含 PR #13 空类型处理修复。
- GDPval-AA v2:由 Artificial Analysis 评测。
- CyberGym:Claude Code 2.1.207(max reasoning effort、禁用 web 工具、temperature=1.0、top_p=1.0、max_new_tokens=128000);不限超时,1,507 任务单次运行 Pass@1;Agent 置于任务容器内;移除全部 Git 相关信息并应用域名白名单(仅允许 pypi.org、deb.debian.org 等基础工具安装域名)防作弊。
- ExploitGym:GLM-5.3、Kimi-K3、Qwen3.8 Max 用 Claude Code 2.1.207(max reasoning effort、禁用 web 工具);869 个任务单次运行 Pass@1,2h/6h 两档预算按各模型每秒 token 数折算(TPS 来自 Artificial Analysis:GLM-5.3 按 115 TPS、Kimi K3 按 40 TPS、Qwen3.8 Max 按 47 TPS),并计入非 API 开销;同样应用域名白名单防作弊。
- ExploitBench:Claude Code 2.1.207(max reasoning effort、禁用 web 工具);按官方设置限制 Agent 与环境最大交互轮数 300,41 个任务 3 个 revision 取平均覆盖分;任务覆盖分取所有 revision 能力并集;应用域名白名单防作弊。
- FrontierSWE:由 Proximal 评测,1M 上下文、max effort、最大输出 128K;Dominance 分数截至 2026/08/14。
- PostTrainBench:Claude Code 2.1.207、max effort、temperature=1.0、top_p=1.0、max_new_tokens=128000、1M 上下文;3 次运行加权平均;防第三方 API 检查改为 LLM agent 审查(原正则检查对本地 vLLM 端点误报)。
- SWE-Marathon:Claude Code 2.1.207、max effort、temperature=1.0、top_p=0.95、max_new_tokens=128000、1M 上下文;strip-clone 任务的防作弊检查改为 LLM 审查(原 import 检测过宽);parameter-golf 与 trimul-cuda 因 NVIDIA wheel 变更导致镜像构建失败,追加
--extra-index-url https://pypi.org/simple修复。
参考链接
- 官方博客:https://z.ai/blog/glm-5.3
- Z.ai Security Disclosure Ledger:https://cvd.z.ai/
- slime 框架:https://github.com/THUDM/slime
- IndexShare 论文:https://arxiv.org/abs/2603.12201
- SAO 论文:https://arxiv.org/abs/2607.07508
- 接入文档:https://docs.z.ai/devpack/overview
- GLM Coding Plan 订阅:https://z.ai/subscribe
- ZCode:https://zcode.z.ai/
