GLM-5.3 发布,编程能力提升并发现长期漏洞

智谱发布新一代模型 GLM-5.3,基座未变、全部提升来自后训练:编程能力较前代提升约 50%,网络安全能力出现超预期的涌现,并在发布前协助发现潜伏 40 余年的 DNS 协议级风险。

8月14日,智谱(Z.ai)正式发布新一代模型 GLM-5.3。与此前版本相比,这次更新没有更换基座模型,全部能力提升都来自更大规模的后训练;官方同时强调,模型在网络安全方向出现了超出预期的能力,并在发布前协助发现了潜伏数十年的底层协议隐患。

GLM-5.3 发布,编程能力提升并发现长期漏洞主题相关图片
来自网络

智谱方面称,GLM-5.3 沿用与 GLM-5.2 相同的基座,基于 IndexShare、SAO 以及持续演进的新一代 Slime 框架推进强化学习,训练环境在长程任务、环境类型和后训练时间上都明显扩大。官方认为,这套基座的智能上界可能尚未被完全开发。

编程能力是本次升级的主线。按照官方数据,GLM-5.3 在内部自建体感评测中较 GLM-5.2 提升约 50%,并在 Terminal Bench 3.0、Agents' Last Exam(CLI)等公开基准中取得开源第一。几个公开基准的变化为:

  • Terminal-Bench 3.0:从 4.6 提升至 28.3;
  • DeepSWE v1.1:从 46.2 提升至 66.9;
  • Agents' Last Exam(CLI):从 23.8 提升至 28.5;
  • GDPval-AA v2:得分 1,769。

在智谱自研的 Z.ai Code Bench 评测中,GLM-5.3 在 High 档位达到 31.4% 的准确率,高于 Claude Opus 4.8 最高档位的 29.5%;每项任务平均输出约 5 万 token,远低于后者的约 12 万 token。官方因此称其在效果与 token 利用率之间取得了更好的平衡,并认为编程与智能体能力接近 Claude Fable 5。

网络安全能力被智谱称为“涌现”的结果。官方表示,原本预期加入漏洞发现相关训练环境后,模型会更好地定位和分析单个漏洞,但随着后训练规模扩大,模型开始自主规划多阶段漏洞利用链条,进攻端能力的提升幅度超出预期。

在漏洞推理评测 CyberGym 中,GLM-5.3 得分为 84.5%,高于 GLM-5.2 的 77.2%,也略高于闭源模型 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。在更接近真实利用的 ExploitBench 上,其得分从 GLM-5.2 的 24.4% 提升至 54.4%。

发布前,智谱联合清华大学、南开大学以及多家安全团队开展红队测试与安全评估,在 269 个项目中发现超过 2400 个漏洞,其中 1000 余个为中高危,覆盖系统内核、操作系统、浏览器引擎和互联网协议等基础设施。其中,清华大学 NISL 实验室与云起无垠安全研究团队借助 GLM 模型,在诞生于 1983 年的 DNS 协议中发现一类潜伏 40 余年的协议级风险:攻击者仅需发送少量特殊构造的请求,即可将服务器压力最高放大近 8 万倍,潜在影响超过 1000 万处公网 DNS 服务。智谱表示,该风险已在造成实际损害前被提前识别,并为后续修复与加固提供了依据。

开放计划方面,GLM-5.3 即日起接入 ZCode、AutoClaw 及 GLM Coding Plan,并在 Trae、WorkBuddy、Qoder、CatPaw、OpenCode 等编码平台开放体验;API 随后上线。完整模型权重计划在发布约两周后开放,官方称此前需要完成安全评估与模型加固,以尽量保留防御价值、限制潜在攻击能力。与此同时,智谱启动“开源的盾”计划,对重点开源项目开展持续安全审计,并向开源社区提供用于安全审计与防御任务的模型额度。

GLM-5.3 发布,编程能力提升并发现长期漏洞 | 秒鲨指南