大家好,我是程序员天天困。
8 月 14 日,智谱正式甩出新一代基座模型 GLM-5.3。这个时间点很微妙——月之暗面 Kimi K3 和 DeepSeek V4 Pro 刚发布没多久,国产开源旗舰的节奏已经卷到了"月月有新版本"。
但这次最值得聊的不是又涨了几分,而是智谱在官方博客开篇就写了一句很直白的话:Scaling post-training is all we did。基座没换,参数没加,所有提升都来自后训练。
这篇就把官方技术报告和文档过一遍,聊聊 GLM-5.3 到底强在哪、哪些数字需要冷静看、API 迁移有什么坑。
一、先看结论:这次到底更新了什么
GLM-5.3 是智谱最新旗舰模型,据公开报道总参数规模 7430 亿,使用与 GLM-5.2 完全相同的基础模型。这意味着所有能力提升都来自后训练阶段——更多任务环境、更多样化的长程任务、更长的训练时间。
后训练(Post-training):基座模型完成预训练之后,用强化学习、人类反馈等方法针对性打磨能力的阶段。你可以理解为"同一个大脑,又送去集训了一个月"。
官方给了两个核心更新方向:更强的编程能力,以及意外涌现的网络安全能力。模型支持 1M 上下文窗口,最大输出 128K Tokens,目前只处理文本模态。

发布节奏上,GLM Coding Plan 已全量上线 5.3,模型 API 近期开放,完整权重计划在发布两周后(安全评估完成后)开源。
二、编程能力:内部基准涨 50%,开源 SOTA 怎么来的
先说结论:GLM-5.3 在编程上的提升是实打实的,而且不是靠刷公开榜刷出来的。
公开基准三个最有代表性的数字:
| 基准 | GLM-5.2 | GLM-5.3 | 说明 |
|---|---|---|---|
| Terminal Bench 3.0 | 4.6 | 28.3 | 开源最佳,超 Kimi K3 的 17.4 |
| DeepSWE v1.1 | 46.2 | 66.9 | 接近 Fable 5 的 69.7 |
| Agents' Last Exam (CLI) | 23.8 | 28.5 | 超 Kimi K3 的 27.6 和 Opus 4.8 的 25.7 |
Terminal Bench 3.0 从 4.6 飙到 28.3 是这次最夸张的数字。这个基准测的是模型在真实终端环境里端到端完成任务的能力,不是写个函数就完事。
但智谱自己也知道公开榜可能有污染,所以搞了个内部基准叫 Z.ai Code Bench,把智能体丢进复杂本地开发环境里,按端到端完成率和细粒度检查项准确率两个维度打分。结果是 5.3 比 5.2 提升了约 50%。
更值得关注的是 Token 效率。Max 档位下,5.3 准确率 34.5%、平均每项任务输出约 7.5 万 Token;5.2 是 23.4%、约 9.6 万 Token。花更少的 Token,办更多的事。

跟闭源模型比,High 档位下 5.3 用约 5 万 Token 拿到 31.4%,Opus 4.8 用约 12 万 Token 拿到 29.5%。不过官方也很坦诚:Max 档 Fable 5 是 39.5%,5.3 是 34.5%,差距还在。
这些提升背后的方法论,智谱总结为"任务环境规模化"。训练任务不再是传统编程题,而是接近专家真实工作的完整单元——比如给模型一个计算集群和代码库,让它定位训练栈瓶颈、实施优化、跑实验、交付可量化的加速。有些任务资深工程师也要做好几天。
说白了,前沿模型的竞争正在从"谁的模型更聪明"转向"谁能搭出更接近真实工作的训练环境"。
三、网络安全:意外涌现,但别被单一榜单带节奏
这是这次发布最有意思的部分。
智谱原话是,后训练时把漏洞发现数据和环境加进去,原本只想让模型更会找 bug,结果网络安全能力的增长速度超出了预期。5.3 不只是能识别孤立漏洞,开始能跨多个漏洞利用阶段推理,形成完整的利用链。
三个基准看下来:
| 网安基准 | GLM-5.2 | GLM-5.3 | Mythos 5 | 怎么看 |
|---|---|---|---|---|
| CyberGym | 77.2% | 84.5% | 83.8% | 白盒源码找漏洞,5.3 全场第一 |
| ExploitBench | 24.4% | 54.4% | 78.0% | 真实漏洞深度利用,翻倍但差距明显 |
| ExploitGym (6h) | 39 项 | 130 项 | 247 项 | 限时完成漏洞利用任务,仍有近一倍差距 |
CyberGym 84.5% 确实是开源第一,还略超 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。但这个基准测的是最基础的白盒场景——给源码、触发异常来验证漏洞,属于漏洞挖掘的起点。
越往漏洞利用链深处走,差距越真实。ExploitBench 上 5.3 虽然比 5.2 翻倍还多(54.4% vs 24.4%),但 Mythos 5 是 78.0%。ExploitGym 六小时完成数 5.3 是 130 项,Mythos 5 是 247 项,差了快一倍。

官方自己一句话总结得很到位:当前差距最大的方向,恰恰也是能力增长最快的方向。
真正有说服力的是真实代码库测试。从 GLM-5.2 起,智谱就联合国内多家安全团队用模型扫真实代码库。经过专家复核、筛选、去重,5.3 在 269 个项目中共发现 2436 个漏洞,其中 1097 个中高危(Critical 107 个、High 990 个)。这些漏洞横跨系统内核、浏览器引擎、开源基础设施、Web 应用和网络协议,最老的一个已在代码里潜伏约 40 年(官方台账标注最早可追溯到 1981 年)。
智谱为此建了个公开的 Z.ai 安全漏洞披露台账,目前 53 个已公开、2383 个仍在协调披露中。

这也是开源权重两周后才放的原因——一个编码和挖洞能力都在开源第一梯队的模型直接开放下载,安全评估和加固必须先做。
四、API 必看:思考模式强制开启,老代码不改会报错
GLM-5.3 的 API 有一个破坏性变更,上线前务必注意:思考功能不能关闭了。
模型始终启用思考,提供三个推理强度档位:
| 参数 | 取值 | 默认 | 说明 |
|---|---|---|---|
thinking.type |
enabled |
enabled |
仅支持开启,不再支持 disabled |
reasoning_effort |
low / high / max |
max |
low 轻量、high 增强、max 深度 |
如果你现有代码里写的是 thinking.type: "disabled",直接把 model ID 换成 glm-5.3 请求会失败。迁移办法是先改成 enabled 并把 reasoning_effort 设成 low,再切模型 ID。官方建议 Coding 等复杂任务用 max。
请求示例:
{
"model": "glm-5.3",
"thinking": {
"type": "enabled" },
"reasoning_effort": "max"
}
可能有人会问:为什么要强制开思考,不给关闭选项?
从 5.2 到 5.3 的训练路线看,智谱把 SAO(带上下文压缩的长程 RL 策略)和思考深度绑定了。关掉思考等于丢掉这套后训练带来的大部分增益,模型表现会明显退化。与其让用户踩坑,不如直接不支持。简单任务用
low档位省 Token 就行。
协议支持上,5.3 同时兼容 OpenAI Chat Completion、OpenAI Response 和 Anthropic Message 三种协议,Base URL 分别是 /api/paas/v4、/api/v1 和 /api/anthropic。不过订阅过 GLM Coding Plan(含已过期)的账号暂时只能用 OpenAI Chat Completion 协议,官方说近期迭代。
能力层面支持流式输出、Function Calling、上下文缓存、结构化输出,该有的都有。

五、什么时候能用上、怎么用最划算
目前 GLM Coding Plan 已经全量上线 GLM-5.3,可以在 ZCode、Claude Code、Cline、Cursor、Trae 等主流编程智能体里直接用。
新版 Coding Plan 改成了基于积分的配额系统,输入、缓存输入、输出 Token 分开计分。有个省钱细节:非高峰时段调用只消耗标准积分的 50%。高峰时段是工作日 14:00–18:00(UTC+8),其他时间包括周末全天都是半价。
ZCode 侧还有两个 buff:98%+ 的缓存命中率(重复上下文按缓存价计费),以及 8 月 31 日前 1.5 倍限时额度加成,叠加缓存优惠最多能到标准额度的 180%。
模型 API 官方说"近期上线",完整权重两周后开放。换句话说,8 月底之前 5.3 就会出现在 Hugging Face 上。
说句带限定的判断:GLM-5.3 是目前编程和 Agent 能力最强的开源模型之一,但"开源第一"要分场景看——CyberGym 确实第一,ExploitBench 和 ExploitGym 离闭源前沿还有明显差距;编码能力在 High 档位 Token 效率惊人,但 Max 档位和 Fable 5 仍有 5 个百分点的差距。 选型时别只看一个数字,先想清楚自己的任务在能力链的哪一层。
我是程序员天天困,持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊:GLM-5.3 两周后开源,你会第一时间拿来跑编程还是测网安?