GLM-5.3 据称通过 GPT-5.6 生成的编程测试

智谱 GLM-5.3 在一套由 GPT-5.6 设计的离线编程测试中完成五项任务并获得满分。报道同时指出,该测试规模较小,结果不能直接等同于模型在大型真实工程中的综合能力。

智谱 GLM-5.3 在一套由 GPT-5.6 设计的 Coding 测试中完成全部任务并获得 100 分。报道援引测试过程称,GLM-5.3 在 ZCode 中连续完成五项测试,整个过程约耗时 13 分钟。

GLM-5.3 据称通过 GPT-5.6 生成的编程测试主题相关图片
来自网络

这套测试包括五个部分:不同推理强度下的 JSON 遵循、延迟和 Token 消耗测试;运行 510 项固定、随机及性能测试的算法代码生成;涉及拓扑排序、异常处理和循环检测的小型仓库缺陷修复;检查库存预留、超卖和任务完成情况的多轮工具调用;以及针对路径穿越、符号链接逃逸等问题的受控安全审计。

报道称,GPT-5.6 对测试结果的评价为,GLM-5.3 展现出较强的“受约束工程执行能力”,评级为 A−。在测试中,模型不仅需要生成可运行代码,还要遵守文件修改范围、禁止联网和安装依赖等约束,并根据实际测试错误继续修复。GLM-5.3 最终还生成了一份任务报告。

不过,这一结果的适用范围仍然有限。报道指出,测试主要由小型、单文件、规格清晰的 Python 问题组成,尚未覆盖大型仓库、跨语言项目、并发、数据库、前端、编译系统、模糊需求或超长上下文等场景。因此,单次满分不能直接证明 GLM-5.3 已经在大型系统工程或真实安全任务中达到前沿闭源模型水平。

在模型发布信息方面,InfoQ 报道称,GLM-5.3 于 2026 年 8 月 14 日正式发布,面向全部 GLM Coding Plan 用户开放,并可用于 ZCode、Claude Code 和 OpenCode 等 Coding Agent。智谱方面表示,GLM-5.3 延续 GLM-5.2 的长程强化学习技术栈,通过增加任务环境、提升任务多样性和投入更多计算资源进行后训练。

智谱还称,GLM-5.3 在内部智谱 Code Bench 上的代码能力相比 GLM-5.2 提高约 50%。该测试用于模拟 Coding Agent 面对的复杂本地开发环境,并从端到端任务完成率和细粒度 Checklist 准确率等维度进行评估。由于这些数据来自厂商披露,仍需要更多独立、可复现的第三方测试进行验证。

除 Coding 能力外,报道还提到 GLM-5.3 在部分网络安全测试中取得进展,但不同测试的表现并不一致。以 CyberGym 为例,报道给出的 GLM-5.3 成绩为 84.5%,高于 GLM-5.2 的 77.2%和 GPT-5.6 Sol 的 83.6%;在 ExploitBench 上,GLM-5.3 得分为 54.4%,仍低于 Claude Opus 4.8 和 GPT-5.6 Sol。

从目前公开信息看,这次测试更适合被理解为一次受控环境下的编码 Agent 能力展示,而不是对通用软件工程能力的全面排名。GLM-5.3 是否能在更大规模、更复杂和更开放的开发任务中保持表现,还需要后续基准测试、模型权重开放以及用户实测结果进一步确认。