GLM-5.3:后训练推高攻防能力

Z.ai 沿用 GLM-5.2 底模,仅扩展后训练便取得显著编码增益,同时漏洞利用能力增长快于预期;权重将延后两周开放。

✓ 已核实 来源 Z.ai official launch post and security disclosure ledger; benchmarks and vulnerability counts are vendor-reported ⚑ 模型发布

60 秒版本

GLM-5.3 沿用 GLM-5.2 底模,通过扩大长程后训练,取得厂商报告的编码和网络安全能力提升。

要点

  • Z.ai 将提升归因于更多环境、更丰富任务和更多强化学习算力,而非新一轮预训练。
  • 编码跑分增幅显著,但 GLM-5.3 并未在所有项目上领先所有闭源模型。
  • 最大相对增益出现在多阶段漏洞利用,使这次发布具有明显双重用途风险。
  • 托管服务现已上线,权重将在两周安全评估与加固后公开。
  • 思考无法关闭,生产迁移必须重新评估推理强度、延迟、token 和工具控制。

结论. 发布事实可信,但性能和安全数字仍是厂商证据;是否经得住独立复现,以及两周后的权重与安全文档,才是下一步检验。

变化来源底模没换,后训练继续扩展

GLM-5.3 与 GLM-5.2 使用相同底模。Z.ai 表示,提升全部来自一个月的继续后训练:更多可执行环境、更丰富的长程任务,以及更多强化学习算力。

这些任务不再只是孤立习题,而是接近真实专业工作的完整单元。代理需要同时检查代码、基础设施、文档和实验结果,完成修改并验证端到端收益。环境生成、评审代理和隐藏状态验证器帮助扩大训练规模,但 Z.ai 承认流程仍离不开人工。

编码表现自报增幅很大,但并非全面领先

28.3Terminal-Bench 3.0,前代为 4.6
66.9DeepSWE 1.1,前代为 46.2
28.5Agents' Last Exam,前代为 23.8

Z.ai 称 GLM-5.3 是编码能力最强的开放权重模型,尽管权重在发布当天尚未开放。其表格同时显示更复杂的现实:模型在部分开放模型评测中领先,但没有包揽第一,在若干项目上仍落后于闭源系统。

Z.ai 公布的编码、网络安全和代理评测对比。所有数值应结合脚注中的评测设置,并按厂商自报结果理解。
Z.ai 公布的编码、网络安全和代理评测对比。所有数值应结合脚注中的评测设置,并按厂商自报结果理解。 · Z.ai

双重用途利用链后段能力增长最快

Z.ai 主动加入漏洞发现环境。出乎其预期的是,模型不只更会找单点缺陷,还开始形成跨越多个阶段的连贯利用计划。

CyberGymZ.ai 报告 GLM-5.3 为 84.5%,GLM-5.2 为 77.2%。
ExploitBench54.4% 对 24.4%;部分闭源模型仍明显领先。
ExploitGym在归一化预算下,两小时完成 105 项、六小时 130 项;前代分别为 29 和 39 项。

公司还报告在 269 个开源项目中追踪到 2,436 个漏洞,其中严重和高危问题 1,097 个。公开披露账本显示相同总量,并区分 53 个已公开问题和 2,383 个保密披露中问题。账本提高了可追踪性,但仍由 Z.ai 维护,并非独立审计。

发布控制服务先上线,权重等待加固

GLM-5.3 已进入 Z.ai Coding Plan 和 ZCode,但公司称权重将在发布两周后、完成安全评估和加固后公开。届时的安全报告、许可证和实际防护措施,才能说明这次延后有多大意义。

结论评估完整代理,而不只是底模

准备采用 GLM-5.3 的团队,应把编码质量、延迟、token、工具权限、沙箱边界和安全审查一起重测。这次发布说明,同一底模经后训练后,实用性与双重用途风险都可能发生实质变化。