Luxsynthesis Blog
返回全部
模型

GLM-5.3 发布:最强开源权重编码模型,网络安全能力超预期涌现

Z.ai 发布 GLM-5.3:与 GLM-5.2 同基座,全部提升来自后训练规模化。Terminal Bench 3.0 从 4.6 升至 28.3,CyberGym 84.5% 全场最佳,ExploitBench 相比 GLM-5.2 翻倍以上,权重两周内开源。本文整理官方 Benchmark、环境合成流水线、安全披露账本与接入变更。

作者
Luxsynthesis
发布日期
阅读时长
14 分钟阅读
GLM-5.3 发布:最强开源权重编码模型,网络安全能力超预期涌现

Z.ai 发布 GLM-5.3。模型使用与 GLM-5.2 相同的基座(base model),所有提升都来自后训练。官方表示本次发布:在后训练上持续规模化——更多环境、更多样的任务、更多算力。

相比 GLM-5.2,GLM-5.3 的提升集中在复杂编码和长程任务上。

官方表示:

  • 更强的编码:GLM-5.3 是目前编码能力最强的开源权重模型,在内部基准 Z.ai Code Bench 上相比 GLM-5.2 提升 50%;在 Terminal Bench 3.0、Agents' Last Exam 等公开基准上取得开源 SOTA。
  • 涌现的网络安全能力:随着后训练规模扩大,网络安全能力的发展超出官方预期。GLM-5.3 在 CyberGym 漏洞发现基准上达到 SOTA;且越靠近漏洞利用链上游,提升越大——在 exploitation 类基准上相比 GLM-5.2 翻倍以上。
  • 开源:权重将在发布两周后公开,目前正在完成安全评估与加固。
GLM-5.3 核心规格

Z.ai 于 2026-08-14 发布:与 GLM-5.2 同基座,在后训练上持续规模化——更多环境、更多样的任务、更多算力。

基座模型同基座与 GLM-5.2 同基座,全部提升来自后训练
Terminal Bench 3.04.6 → 28.3DeepSWE 46.2 → 66.9;Z.ai Code Bench 相比 GLM-5.2 +50%开源权重 SOTA
CyberGym84.5%漏洞发现基准 SOTA;ExploitBench 相比 GLM-5.2 翻倍以上全场最佳
权重开源两周内安全评估与加固进行中
要点:思考强度 low / high / max思考不可关闭(disabled 已废除)slime 后训练框架GLM Coding Plan 积分制计费

Benchmark 总览

Performance across comparison models:GLM-5.3 与各对比模型在编码、安全、Agent 三类基准上的成绩总览

编码(CODING)

基准GLM-5.3GLM-5.2Kimi K3DeepSeek-V4 Pro-0813Qwen3.8-MaxOpus 4.8Fable 5 (w/ fallback)GPT-5.6 Sol
Terminal Bench 2.188.281.088.387.986.685.088.088.8
Terminal Bench 3.028.34.617.4--21.133.734.6
DeepSWE v1.166.946.267.562.756.658.069.772.7
NL2Repo58.048.958.061.155.969.7--
ProgramBench (Almost Solved)19.09.517.5-10.515.533.023.0
FrontierSWE78.167.5---66.588.2-
SWE-Marathon v1.142.519.448.1--48.833.142.5
PostTrainBench39.831.732.0--32.941.836.2

网络安全(CYBER)

基准GLM-5.3GLM-5.2Kimi K3DeepSeek-V4 Pro-0813Qwen3.8-MaxOpus 4.8Fable 5 (w/ fallback)GPT-5.6 Sol
CyberGym84.577.280.083.378.578.183.883.6
ExploitGym (2h / 6h)105 / 13029 / 3936 / 70-14 / 2680 / 120181 / 247216 / 293
ExploitBench54.424.432.2-28.840.078.076.5

Agent(AGENTIC)

基准GLM-5.3GLM-5.2Kimi K3DeepSeek-V4 Pro-0813Qwen3.8-MaxOpus 4.8Fable 5 (w/ fallback)GPT-5.6 Sol
Toolathlon Verified73.059.976.574.172.576.274.774.9
AutomationBench v1.0.648.226.246.743.239.841.046.245.8
Agents' Last Exam (ALE-CLI)28.523.827.625.727.025.723.828.6
HLE w/ Tools62.554.759.860.056.257.963.964.5
GDPval-AA v217691508168215901739158817431730

注:正文提及的 "Mythos 5" 与表中 "Fable 5" 分数一致(CyberGym 83.8、ExploitBench 78.0 等),应为同一模型的不同称呼。

一、编码能力:环境规模化与 Z.ai Code Bench

环境规模化:从"编码练习"到"真实工作单元"

官方将环境规模化推向更接近真实专家工作的任务:环境覆盖更广的生产工作流,任务按工程和研究工作的实际开展方式设计,部分任务相当于有经验工程师数天的工作量。

官方举了一个 ML 基础设施任务的例子:模型拿到与工程师相同的工作环境——计算集群、存储系统、内部文档、代码库和实验结果——需要诊断训练栈各环节的瓶颈、实施优化、跑实验,并在保持正确性的前提下交付可度量的端到端加速。在这种级别的环境上训练,目标是推动模型端到端地"接管"大块工作,而不是依赖用户事先分解问题、逐步监督。

官方同时指出:随着 Agent 能力提升,后训练规模化的难点正从模型转移到环境。一个有用的任务环境必须可执行、可验证、接近真实专业工作,而且需要大量这样的环境,少量手工搭建远远不够。为此,官方构建了端到端的环境合成流水线(对部分任务,连 RL 奖励信号也一并合成):

  • 研究 Agent 从真实工作中收集任务模式,转化为带多步依赖和隐藏状态的可运行长程环境;
  • 评判 Agent 逐一试做任务,验证任务确实可解;
  • 验证器在接触不到参考解的情况下合成;求解轨迹用于发现并封堵奖励捷径;
  • 通过 oracle、no-op、unsolved-state 三类检查的验证器,产出可直接用于训练的二值奖励。
环境合成流水线

后训练规模化的难点正从模型转移到环境:少量手工搭建远远不够,官方构建了端到端的环境合成流水线(部分任务的 RL 奖励信号也一并合成)。

1
研究 Agent

从真实工作中收集任务模式,转化为带多步依赖和隐藏状态的可运行长程环境

2
评判 Agent

逐一试做任务,验证任务确实可解

3
验证器合成

在接触不到参考解的情况下合成;求解轨迹用于发现并封堵奖励捷径

4
三重检查 → 二值奖励

通过 oracle、no-op、unsolved-state 三类检查的验证器,产出可直接用于训练的二值奖励

官方也承认,这些流水线仍需要相当程度的人在回路参与;让环境生成与验证更加自主,是下一步的工作方向之一。

GLM-5.3 沿用了 GLM-5.2 引入的 RL 策略(包括带 compaction 的 SAO),使这些提升在长程任务上同样成立。效果体现在:Terminal-Bench 3.0 从 4.6 提升到 28.3,DeepSWE v1.1 从 46.2 提升到 66.9,Agents' Last Exam 从 23.8 提升到 28.5。官方也承认,这些流水线仍需要相当程度的人在回路参与;让环境生成与验证更加自主,是下一步的工作方向之一。

Z.ai Code Bench:内部基准与努力等级

官方引入内部基准 Z.ai Code Bench,用于在真实用户场景下评测编码 Agent:覆盖多样的任务类别,将 Agent 放进复杂的本地开发环境,并在不同努力等级下沿两个维度评测——端到端任务完成率与细粒度检查清单准确率。作为私有基准,它降低了公开测试集的污染风险,评测结果更接近真实使用体验。

Z.ai Code Bench:不同努力等级下各模型任务完成率与输出 token 消耗的对比

如图所示,GLM-5.3 在性能与 token 效率上同时提升——在每个努力等级上,都以更少的输出 token 交付了明显强于 GLM-5.2 的编码结果:

  • Max 档:GLM-5.3 达到 34.5%,约消耗 75K 输出 token/任务;GLM-5.2 为 23.4% @ 96K。
  • High 档:GLM-5.3 达到 31.4%,约 50K 输出 token;超过 Claude Opus 4.8 的 29.5% @ 120K。
  • GLM-5.3 仍落后于 Claude Fable 5(Max 档 39.5%)。
Z.ai Code Bench:努力等级对比

内部基准,在真实用户场景下评测编码 Agent,降低公开测试集污染风险。切换努力等级,看各模型的任务完成率与每任务输出 token。

Claude Fable 5
39.5%
token 未公布
GLM-5.3
34.5%
≈75K tok/任务
GLM-5.2
23.4%
≈96K tok/任务

GLM-5.3 以约 75K 输出 token/任务达到 34.5%;GLM-5.2 为 23.4% @ 96K。Claude Fable 5 仍以 39.5% 领先。

每个努力等级上,GLM-5.3 都以更少的输出 token 交付明显强于 GLM-5.2 的编码结果。图中仅列出该档位有公开数值的模型。

二、涌现的网络安全能力

作为后训练的一部分,官方在训练混合中加入了漏洞发现数据和环境,原本的预期只是让模型更擅长发现漏洞、并对漏洞进行推理。超出预期的是这项能力随训练规模扩大的发展速度:GLM-5.3 不再只是识别孤立缺陷,而是开始跨漏洞利用的多个阶段进行推理,为完整的利用链形成连贯计划。

网络安全能力配图:三个安全基准(CyberGym / ExploitBench / ExploitGym)覆盖漏洞分析与利用的不同阶段

三个安全基准

官方在三个基准上评测了 GLM-5.3,分别覆盖漏洞分析与利用的不同阶段:

基准考察内容GLM-5.3GLM-5.2对比
CyberGym从白盒源码出发,通过触发故障来识别并验证漏洞84.5%77.2%全场最佳,超过 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)
ExploitBench对真实漏洞及其利用做更深入的推理54.4%24.4%相比 GLM-5.2 翻倍以上;Mythos 5 为 78.0%,GPT-5.6 Sol 为 76.5%
ExploitGym归一化时间预算下能完成多少利用任务105(2h)/ 130(6h)29 / 39Mythos 5 为 181 / 247,仍大幅领先

官方总结的规律:越靠近利用链上游的基准,相比 GLM-5.2 的提升越大,与闭源前沿的差距也越大——能力增长最快的地方,正是落后最远的地方。

三个安全基准:发现 → 推理 → 利用

三个基准分别覆盖漏洞分析与利用的不同阶段。沿链条向右,GLM-5.3 相比 GLM-5.2 的提升倍数越来越大,与闭源前沿的差距也越来越大。

漏洞发现提升 ×1.09
CyberGym全场最佳
GLM-5.2
77.2
GLM-5.3
84.5
Fable 5
83.8

通过率:GLM-5.2 77.2 → GLM-5.3 84.5;闭源最佳 Fable 5 83.8

漏洞推理提升 ×2.23
ExploitBench
GLM-5.2
24.4
GLM-5.3
54.4
Fable 5
78

覆盖分:GLM-5.2 24.4 → GLM-5.3 54.4;闭源最佳 Fable 5 78

漏洞利用提升 ×3.33
ExploitGym (6h)
GLM-5.2
39
GLM-5.3
130
GPT-5.6 Sol
293

完成任务数:GLM-5.2 39 → GLM-5.3 130;闭源最佳 GPT-5.6 Sol 293

官方总结的规律:越靠近利用链上游的基准,相比 GLM-5.2 的提升越大,与闭源前沿的差距也越大——能力增长最快的地方,正是落后最远的地方。

真实代码库实测与安全披露账本

自 GLM-5.2 起,官方与多家国内安全团队合作,将模型跑在真实代码库上。经专家评审、筛选、去重后:

  • 模型在 269 个项目中识别出 2,436 个漏洞,其中 1,097 个为中高危
  • 覆盖系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用、网络协议;
  • 许多漏洞已存在数年甚至数十年,最老的可追溯至约 40 年前。

这项工作已发展为一个持续的披露进程。官方建立了 Z.ai Security Disclosure Ledgerhttps://cvd.z.ai/)公开记录这些发现,区分已公开与披露中的问题;对已披露的条目,记录受影响项目、严重度、CVE 编号(如有),以及漏洞在代码库中已存在的时间。

账本统计(截至发文):

指标数值
追踪中的发现2,436
已公开披露53
披露限制中2,383
严重 + 高危1,097
涉及开源项目269
影响时间跨度45 年(最老缺陷引入于 1981 年)
漏洞平均潜伏期26.6 年
Z.ai 安全披露账本

自 GLM-5.2 起,模型在真实代码库中发现的漏洞以公开账本持续记录(cvd.z.ai)。以下为截至发文时的统计。

0追踪中的发现
0涉及开源项目
0严重 + 高危
0已公开披露
0.0漏洞平均潜伏期
严重度分布
严重
107
高危
990
中危
1,286
低危
53
缺陷引入时间跨度:1981 – 2026(最老缺陷已存在 45 年)
19812026

严重度分布:Critical 107 / High 990 / Medium 1,286 / Low 53。缺陷引入时间跨度:1981–2026。

三、slime:面向长程 RL 扩展的训练框架

以上训练全部跑在自研开源后训练框架 slimehttps://github.com/THUDM/slime)上:训练侧用 Megatron,rollout 侧用 SGLang。在设计上,训练、rollout 和数据缓冲区被保持在单一 dataflow 上——数学、代码、沙箱、验证器和长程 Agent 环境都以"数据生成"的形式接入,而无需改动训练循环。官方称,这让 GLM-5.2 到 GLM-5.3 在持续增加新环境时无需重建训练栈。

slime:单一 dataflow 上的长程 RL

训练、rollout 和数据缓冲区被保持在单一 dataflow 上——各类环境以「数据生成」的形式接入,无需改动训练循环,GLM-5.2 到 GLM-5.3 持续增加新环境时无需重建训练栈。

训练Megatron 训练侧
数据缓冲区同一条 dataflow
RolloutSGLang rollout 侧
以「数据生成」接入:数学代码沙箱验证器长程 Agent 环境
训练–rollout 一致性1e-7训练与 rollout 路径的 logprob 平均差异,相比此前设置降低超过 99.99%(top-p mask、top-k 与全词表 OPD、R3 式设置)
端到端吞吐>2.3×长程编码 RL 任务,来自多教师 OPD 的本地存储分层缓存,以及 router 与 slime 的联合调度和负载感知策略

在 GLM-5.3 的开发周期内,slime 沿两个方向继续建设:

算法侧(面向 RL 研究):新增 top-p mask、top-k 与全词表 OPD,以及提升训练-rollout 一致性的配置(R3 式设置、训练与 rollout 路径的完全数值对齐)。在训练-rollout 一致性评估中,logprob 平均差异控制在 1e-7 量级,相比此前设置降低超过 99.99%。

资源效率与系统吞吐(面向大规模 RL)

  • 将本地存储作为额外的缓存层,分层持有原本驻留在主机内存中的模型状态与数据。这对多教师 OPD 尤为重要:配合动态教师切换与训练侧预取,无需为每个教师常驻一套独立的推理服务。
  • 改进 router 与 slime 之间的联合调度与负载均衡,让长度和完成时间差异巨大的 rollout 请求能更好地利用推理资源;并引入负载感知的启发式策略,根据各 rollout 环境的特征推导吞吐导向的配置(prefill/decode 资源比、并发度等)。
  • 结果:长程编码 RL 任务的端到端训练吞吐提升 超过 2.3 倍

四、接入方式与 API 变更

API 变更

GLM-5.3 支持三档思考强度:low / high / max,不再支持关闭思考(thinking.type: "disabled" 已废除)。

参数取值默认说明
thinking.typeenabledenabled启用思考;disabled 不再支持
reasoning_effortlow, high, maxmaxlow:轻量;high:增强;max:深度。编码任务推荐 max
{
  "model": "glm-5.3",
  "thinking": { "type": "enabled" },
  "reasoning_effort": "max"
}

GLM Coding Plan 与 ZCode

  • GLM Coding Plan:GLM-5.3 已推送给全部订阅用户。计费改为积分制,输入、缓存输入、输出 token 分别计费;高峰时段为周一至周五 14:00–18:00(UTC+8),其余时段(含周末)仅消耗 50% 积分。订阅:https://z.ai/subscribe
  • 编码 Agent 接入:支持 ZCode、Claude Code、OpenCode 等常用编码 Agent。文档:https://docs.z.ai/devpack/overview
  • ZCode 特性
    • 98%+ 缓存命中率——重复上下文按更低的缓存价计费,相当于多出约 30% 的有效 token;
    • 8 月 31 日前限时 1.5 倍配额加成,可与缓存节省叠加,最高相当于标准配额的 180%;
    • Goal 模式——规划、编码、测试、验证循环直到达成目标;
    • 远程控制——通过微信或飞书从手机监控和引导长任务。
    • 下载:https://zcode.z.ai/

本地部署

模型权重将在两周内公开发布。

五、评测设置脚注(摘录)

  • HLE w/ tools:temperature=1.0、top_p=0.95,最大生成长度 163,840 token;上下文上限 300,000 token(使用上下文管理策略);判分模型 GPT-5.6-luna (medium)。
  • NL2Repo:temperature=1.0、top_p=1.0、max_new_tokens=64k、1M 上下文;用规则 + LLM 判定防止恶意行为(如未授权 pip 或 curl 操作)。
  • DeepSWE:mini-swe-agent harness,temperature=0.95、top_p=1.0、超时 6h、400K 上下文。
  • Terminal-Bench 2.1:Claude Code 2.1.207,temperature=1.0、top_p=1、max_new_tokens=65536、超时 6h。
  • Terminal-Bench 3.0:Claude Code 2.1.207 harness(reasoning effort=max、400K 上下文、最大输出 128K),avg@3;每次 rollout 在任务官方镜像的独立容器中运行,上限 600 agent turns、超时 10h;禁用 Tool Search,由任务官方独立验证器评分。
  • Agents' Last Exam (CLI):官方评测协议 + Claude Code harness(reasoning effort=max、1M 上下文、最大输出 64K);105 个任务各自在独立 Docker 容器中运行;默认超时 4h(任务特定限制优先,最长 8h);禁用 Tool Search,官方评估器评分。
  • Toolathlon Verified:官方评测服务,pass@1 三次独立运行取平均。
  • AutomationBench:v1.0.6,含 PR #13 空类型处理修复。
  • GDPval-AA v2:由 Artificial Analysis 评测。
  • CyberGym:Claude Code 2.1.207(max reasoning effort、禁用 web 工具、temperature=1.0、top_p=1.0、max_new_tokens=128000);不限超时,1,507 任务单次运行 Pass@1;Agent 置于任务容器内;移除全部 Git 相关信息并应用域名白名单(仅允许 pypi.org、deb.debian.org 等基础工具安装域名)防作弊。
  • ExploitGym:GLM-5.3、Kimi-K3、Qwen3.8 Max 用 Claude Code 2.1.207(max reasoning effort、禁用 web 工具);869 个任务单次运行 Pass@1,2h/6h 两档预算按各模型每秒 token 数折算(TPS 来自 Artificial Analysis:GLM-5.3 按 115 TPS、Kimi K3 按 40 TPS、Qwen3.8 Max 按 47 TPS),并计入非 API 开销;同样应用域名白名单防作弊。
  • ExploitBench:Claude Code 2.1.207(max reasoning effort、禁用 web 工具);按官方设置限制 Agent 与环境最大交互轮数 300,41 个任务 3 个 revision 取平均覆盖分;任务覆盖分取所有 revision 能力并集;应用域名白名单防作弊。
  • FrontierSWE:由 Proximal 评测,1M 上下文、max effort、最大输出 128K;Dominance 分数截至 2026/08/14。
  • PostTrainBench:Claude Code 2.1.207、max effort、temperature=1.0、top_p=1.0、max_new_tokens=128000、1M 上下文;3 次运行加权平均;防第三方 API 检查改为 LLM agent 审查(原正则检查对本地 vLLM 端点误报)。
  • SWE-Marathon:Claude Code 2.1.207、max effort、temperature=1.0、top_p=0.95、max_new_tokens=128000、1M 上下文;strip-clone 任务的防作弊检查改为 LLM 审查(原 import 检测过宽);parameter-golf 与 trimul-cuda 因 NVIDIA wheel 变更导致镜像构建失败,追加 --extra-index-url https://pypi.org/simple 修复。

参考链接

返回全部