GLM-5.3:后训练推高攻防能力
Z.ai 沿用 GLM-5.2 底模,仅扩展后训练便取得显著编码增益,同时漏洞利用能力增长快于预期;权重将延后两周开放。
60 秒版本
GLM-5.3 沿用 GLM-5.2 底模,通过扩大长程后训练,取得厂商报告的编码和网络安全能力提升。
要点
- Z.ai 将提升归因于更多环境、更丰富任务和更多强化学习算力,而非新一轮预训练。
- 编码跑分增幅显著,但 GLM-5.3 并未在所有项目上领先所有闭源模型。
- 最大相对增益出现在多阶段漏洞利用,使这次发布具有明显双重用途风险。
- 托管服务现已上线,权重将在两周安全评估与加固后公开。
- 思考无法关闭,生产迁移必须重新评估推理强度、延迟、token 和工具控制。
结论. 发布事实可信,但性能和安全数字仍是厂商证据;是否经得住独立复现,以及两周后的权重与安全文档,才是下一步检验。
变化来源底模没换,后训练继续扩展
GLM-5.3 与 GLM-5.2 使用相同底模。Z.ai 表示,提升全部来自一个月的继续后训练:更多可执行环境、更丰富的长程任务,以及更多强化学习算力。
这些任务不再只是孤立习题,而是接近真实专业工作的完整单元。代理需要同时检查代码、基础设施、文档和实验结果,完成修改并验证端到端收益。环境生成、评审代理和隐藏状态验证器帮助扩大训练规模,但 Z.ai 承认流程仍离不开人工。
编码表现自报增幅很大,但并非全面领先
Z.ai 称 GLM-5.3 是编码能力最强的开放权重模型,尽管权重在发布当天尚未开放。其表格同时显示更复杂的现实:模型在部分开放模型评测中领先,但没有包揽第一,在若干项目上仍落后于闭源系统。

双重用途利用链后段能力增长最快
Z.ai 主动加入漏洞发现环境。出乎其预期的是,模型不只更会找单点缺陷,还开始形成跨越多个阶段的连贯利用计划。
| CyberGym | Z.ai 报告 GLM-5.3 为 84.5%,GLM-5.2 为 77.2%。 |
|---|---|
| ExploitBench | 54.4% 对 24.4%;部分闭源模型仍明显领先。 |
| ExploitGym | 在归一化预算下,两小时完成 105 项、六小时 130 项;前代分别为 29 和 39 项。 |
公司还报告在 269 个开源项目中追踪到 2,436 个漏洞,其中严重和高危问题 1,097 个。公开披露账本显示相同总量,并区分 53 个已公开问题和 2,383 个保密披露中问题。账本提高了可追踪性,但仍由 Z.ai 维护,并非独立审计。
发布控制服务先上线,权重等待加固
GLM-5.3 已进入 Z.ai Coding Plan 和 ZCode,但公司称权重将在发布两周后、完成安全评估和加固后公开。届时的安全报告、许可证和实际防护措施,才能说明这次延后有多大意义。
结论评估完整代理,而不只是底模
准备采用 GLM-5.3 的团队,应把编码质量、延迟、token、工具权限、沙箱边界和安全审查一起重测。这次发布说明,同一底模经后训练后,实用性与双重用途风险都可能发生实质变化。