智谱GLM-5.3发布同基座纯靠后训练编程涨50还点亮网安技能树

简介: 智谱 8 月 14 日发布 GLM-5.3,与 5.2 同基座、纯后训练,编程内部基准提升 50%,CyberGym 拿下开源第一,两周后开源权重

大家好,我是程序员天天困。

8 月 14 日,智谱正式甩出新一代基座模型 GLM-5.3。这个时间点很微妙——月之暗面 Kimi K3 和 DeepSeek V4 Pro 刚发布没多久,国产开源旗舰的节奏已经卷到了"月月有新版本"。

但这次最值得聊的不是又涨了几分,而是智谱在官方博客开篇就写了一句很直白的话:Scaling post-training is all we did。基座没换,参数没加,所有提升都来自后训练。

这篇就把官方技术报告和文档过一遍,聊聊 GLM-5.3 到底强在哪、哪些数字需要冷静看、API 迁移有什么坑。

一、先看结论:这次到底更新了什么

GLM-5.3 是智谱最新旗舰模型,据公开报道总参数规模 7430 亿,使用与 GLM-5.2 完全相同的基础模型。这意味着所有能力提升都来自后训练阶段——更多任务环境、更多样化的长程任务、更长的训练时间。

后训练(Post-training):基座模型完成预训练之后,用强化学习、人类反馈等方法针对性打磨能力的阶段。你可以理解为"同一个大脑,又送去集训了一个月"。

官方给了两个核心更新方向:更强的编程能力,以及意外涌现的网络安全能力。模型支持 1M 上下文窗口,最大输出 128K Tokens,目前只处理文本模态。

GLM-5.3 官方性能对比总表:Terminal Bench 3.0 得分 28.3、CyberGym 得分 84.5 均为开源最佳

发布节奏上,GLM Coding Plan 已全量上线 5.3,模型 API 近期开放,完整权重计划在发布两周后(安全评估完成后)开源。

二、编程能力:内部基准涨 50%,开源 SOTA 怎么来的

先说结论:GLM-5.3 在编程上的提升是实打实的,而且不是靠刷公开榜刷出来的。

公开基准三个最有代表性的数字:

基准 GLM-5.2 GLM-5.3 说明
Terminal Bench 3.0 4.6 28.3 开源最佳,超 Kimi K3 的 17.4
DeepSWE v1.1 46.2 66.9 接近 Fable 5 的 69.7
Agents' Last Exam (CLI) 23.8 28.5 超 Kimi K3 的 27.6 和 Opus 4.8 的 25.7

Terminal Bench 3.0 从 4.6 飙到 28.3 是这次最夸张的数字。这个基准测的是模型在真实终端环境里端到端完成任务的能力,不是写个函数就完事。

但智谱自己也知道公开榜可能有污染,所以搞了个内部基准叫 Z.ai Code Bench,把智能体丢进复杂本地开发环境里,按端到端完成率和细粒度检查项准确率两个维度打分。结果是 5.3 比 5.2 提升了约 50%。

更值得关注的是 Token 效率。Max 档位下,5.3 准确率 34.5%、平均每项任务输出约 7.5 万 Token;5.2 是 23.4%、约 9.6 万 Token。花更少的 Token,办更多的事

GLM-5.3 Z.ai Code Bench 各档位准确率与 Token 消耗对比:High 档 5 万 Token 达 31.4% 超 Opus 4.8 的 12 万 Token

跟闭源模型比,High 档位下 5.3 用约 5 万 Token 拿到 31.4%,Opus 4.8 用约 12 万 Token 拿到 29.5%。不过官方也很坦诚:Max 档 Fable 5 是 39.5%,5.3 是 34.5%,差距还在。

这些提升背后的方法论,智谱总结为"任务环境规模化"。训练任务不再是传统编程题,而是接近专家真实工作的完整单元——比如给模型一个计算集群和代码库,让它定位训练栈瓶颈、实施优化、跑实验、交付可量化的加速。有些任务资深工程师也要做好几天。

说白了,前沿模型的竞争正在从"谁的模型更聪明"转向"谁能搭出更接近真实工作的训练环境"

三、网络安全:意外涌现,但别被单一榜单带节奏

这是这次发布最有意思的部分。

智谱原话是,后训练时把漏洞发现数据和环境加进去,原本只想让模型更会找 bug,结果网络安全能力的增长速度超出了预期。5.3 不只是能识别孤立漏洞,开始能跨多个漏洞利用阶段推理,形成完整的利用链。

三个基准看下来:

网安基准 GLM-5.2 GLM-5.3 Mythos 5 怎么看
CyberGym 77.2% 84.5% 83.8% 白盒源码找漏洞,5.3 全场第一
ExploitBench 24.4% 54.4% 78.0% 真实漏洞深度利用,翻倍但差距明显
ExploitGym (6h) 39 项 130 项 247 项 限时完成漏洞利用任务,仍有近一倍差距

CyberGym 84.5% 确实是开源第一,还略超 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%。但这个基准测的是最基础的白盒场景——给源码、触发异常来验证漏洞,属于漏洞挖掘的起点。

越往漏洞利用链深处走,差距越真实。ExploitBench 上 5.3 虽然比 5.2 翻倍还多(54.4% vs 24.4%),但 Mythos 5 是 78.0%。ExploitGym 六小时完成数 5.3 是 130 项,Mythos 5 是 247 项,差了快一倍。

GLM-5.3 网络安全三基准对比:CyberGym 开源第一,但 ExploitBench 与 ExploitGym 离 Mythos 5 仍有差距

官方自己一句话总结得很到位:当前差距最大的方向,恰恰也是能力增长最快的方向。

真正有说服力的是真实代码库测试。从 GLM-5.2 起,智谱就联合国内多家安全团队用模型扫真实代码库。经过专家复核、筛选、去重,5.3 在 269 个项目中共发现 2436 个漏洞,其中 1097 个中高危(Critical 107 个、High 990 个)。这些漏洞横跨系统内核、浏览器引擎、开源基础设施、Web 应用和网络协议,最老的一个已在代码里潜伏约 40 年(官方台账标注最早可追溯到 1981 年)。

智谱为此建了个公开的 Z.ai 安全漏洞披露台账,目前 53 个已公开、2383 个仍在协调披露中。

Z.ai 安全漏洞披露台账:269 个项目中发现 2436 个漏洞,含 1097 个中高危,最早可追溯到 1981 年

这也是开源权重两周后才放的原因——一个编码和挖洞能力都在开源第一梯队的模型直接开放下载,安全评估和加固必须先做。

四、API 必看:思考模式强制开启,老代码不改会报错

GLM-5.3 的 API 有一个破坏性变更,上线前务必注意:思考功能不能关闭了

模型始终启用思考,提供三个推理强度档位:

参数 取值 默认 说明
thinking.type enabled enabled 仅支持开启,不再支持 disabled
reasoning_effort low / high / max max low 轻量、high 增强、max 深度

如果你现有代码里写的是 thinking.type: "disabled",直接把 model ID 换成 glm-5.3 请求会失败。迁移办法是先改成 enabled 并把 reasoning_effort 设成 low,再切模型 ID。官方建议 Coding 等复杂任务用 max

请求示例:

{
   
  "model": "glm-5.3",
  "thinking": {
    "type": "enabled" },
  "reasoning_effort": "max"
}

可能有人会问:为什么要强制开思考,不给关闭选项?

从 5.2 到 5.3 的训练路线看,智谱把 SAO(带上下文压缩的长程 RL 策略)和思考深度绑定了。关掉思考等于丢掉这套后训练带来的大部分增益,模型表现会明显退化。与其让用户踩坑,不如直接不支持。简单任务用 low 档位省 Token 就行。

协议支持上,5.3 同时兼容 OpenAI Chat Completion、OpenAI Response 和 Anthropic Message 三种协议,Base URL 分别是 /api/paas/v4/api/v1/api/anthropic。不过订阅过 GLM Coding Plan(含已过期)的账号暂时只能用 OpenAI Chat Completion 协议,官方说近期迭代。

能力层面支持流式输出、Function Calling、上下文缓存、结构化输出,该有的都有。

GLM-5.3 官方文档思考参数表:thinking.type 仅支持 enabled,reasoning_effort 分 low/high/max 三档

五、什么时候能用上、怎么用最划算

目前 GLM Coding Plan 已经全量上线 GLM-5.3,可以在 ZCode、Claude Code、Cline、Cursor、Trae 等主流编程智能体里直接用。

新版 Coding Plan 改成了基于积分的配额系统,输入、缓存输入、输出 Token 分开计分。有个省钱细节:非高峰时段调用只消耗标准积分的 50%。高峰时段是工作日 14:00–18:00(UTC+8),其他时间包括周末全天都是半价。

ZCode 侧还有两个 buff:98%+ 的缓存命中率(重复上下文按缓存价计费),以及 8 月 31 日前 1.5 倍限时额度加成,叠加缓存优惠最多能到标准额度的 180%。

模型 API 官方说"近期上线",完整权重两周后开放。换句话说,8 月底之前 5.3 就会出现在 Hugging Face 上。


说句带限定的判断:GLM-5.3 是目前编程和 Agent 能力最强的开源模型之一,但"开源第一"要分场景看——CyberGym 确实第一,ExploitBench 和 ExploitGym 离闭源前沿还有明显差距;编码能力在 High 档位 Token 效率惊人,但 Max 档位和 Fable 5 仍有 5 个百分点的差距。 选型时别只看一个数字,先想清楚自己的任务在能力链的哪一层。


我是程序员天天困,持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊:GLM-5.3 两周后开源,你会第一时间拿来跑编程还是测网安?

相关文章
人工智能 缓存 前端开发
4287 2
|
10天前
|
存储 弹性计算 缓存
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
本文更新了2026年阿里云全系列云服务器租赁活动报价,所有特惠资源均可前往阿里云活动中心选购,整体覆盖从个人入门到企业级高性能场景的全梯度需求。其中轻量应用服务器主打极致性价比,2核2G峰值200M带宽配置每日10点、15点限时抢购价仅38元/年,2核4G配置379元/年起;高性价比的经济型e实例、通用算力型u2i实例覆盖2核4G至4核32G全档位,适配开发测试与中小型企业业务;搭载英特尔至强6处理器的第九代c9i企业级实例算力较上代提升20%,支撑高并发生产环境,不同实例规格价差清晰,用户可根据自身业务负载与预算灵活选型。
1958 119
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
人工智能 JavaScript 开发工具
1663 1
|
11天前
|
人工智能 程序员 API
Codex 接入 DeepSeek-V4-Flash:还能补上识图,提供两套方案
Codex 接入 DeepSeek-V4-Flash 怎么配?本文覆盖 CLI 与桌面端,再用 qwen3-vl-flash 补识图,两套方案可直接照做
1513 13
缓存 人工智能 算法
444 0
|
8天前
|
编解码 弹性计算 云计算
MiniMax-H3 视频生成模型 — 一键部署与使用指南
MiniMax-H3是MiniMax开源的33B全模态视频生成模型,支持文生视频、图生视频、参考生视频三种模式,原生输出2K/15秒带立体声音频视频,已原生适配ComfyUI,并可通过阿里云计算巢一键部署。(239字)
|
17天前
|
云安全 人工智能 运维
阿里云联动百位企业安全专家,共识Agent防御最佳实践
当Agent成为新员工,你的安全边界在哪里?
1974 10
阿里云联动百位企业安全专家,共识Agent防御最佳实践
|
9天前
|
人工智能 API 开发工具
2026 零基础本地 AI 漫剧完整实操教程(8G 笔记本显卡可用|附可直接复制命令与代码)
本方案提供完全离线、本地运行的漫剧全自动制作流程:RTX3060/4050 8G显卡即可驱动,涵盖Qwen写分镜→ComfyUI统一角色绘图→LTX2.3图生微动画→Qwen3-TTS本地配音→FFmpeg自动合成,全程无水印、免API、不限次。专为低显存优化,解决变脸、闪烁、爆内存三大痛点。(239字)