JeecgBoot AI专题研究 | 国产开源大模型双雄对决深度解析:GLM 5.3 后训练 Scaling 路线 vs Kimi K3 超大新基座路线
8 月的国产大模型圈,热闹得像春运火车站。8 月 13 日凌晨 DeepSeek V4 Pro 刚刚刷屏,8 月 14 日智谱就接过了接力棒:正式发布 GLM-5.3,并直接喊出"当前排名最高的开源模型""编程体感超过其他国产模型"的口号。

有意思的是,就在不到一个月前的 7 月中旬,月之暗面不声不响地上线了 Kimi K3——一个 2.8 万亿参数的庞然大物,同样主打编程和智能体,同样开源,官方口径直接是"编程超越 Claude Opus 4.8 / GPT 5.5"。
一个是不换基座、靠后训练"榨"出智能上界的 GLM-5.3,一个是推倒重来、3T 级新基座的 Kimi K3。这两条截然不同的技术路线撞在一起,恰好构成了当下国产大模型竞赛最耐人寻味的一个切面。本文就把这两个模型掰开揉碎,看看这场对决到底成色几何。
先看主角:GLM-5.3 这次更新了什么
先说结论:GLM-5.3 不是一次"换代",而是一次"深挖"。
根据智谱官方介绍,与 GLM-5.2 相比,新版本的基座模型完全没有变化,真正的功夫全部花在了后训练(Post-training)阶段——通过极致的后训练 Scaling 来抬升模型的智能上界。具体来说有三个抓手:
- 数十倍的长程任务环境:让模型在真实工程任务链里泡得更久
- 更丰富多样的环境类型:覆盖终端、代码仓库、跨工具协作等多种场景
- 超长的后训练时间:简单粗暴地把训练算力堆上去

这个思路值得多说两句。行业里有一条隐形的鄙视链:改基座叫"真升级",改后训练叫"调参"。但 GLM-5.3 用成绩单证明了,在基座潜力未尽的情况下,强化学习阶段的 Scaling 完全可以成为一级火箭——预训练决定了模型的下限,后训练决定的是它能摸到多高的天花板。
官方总结的新能力有四项:更强的编程能力、网络安全能力、后训练 Scaling 方法论,以及开源。前三项是能力,最后一项是态度——在这个各家捂着权重舍不得放的年代,坚持开源本身就是一种产品策略。
还有两个官方口径值得记录:一是内部体感评测中编程能力提升了 50%,二是 Terminal-Bench 3.0 和 Agents' Last Exam (CLI) 两项公开基准拿下开源第一。注意这两项基准有个共同点——都是终端/CLI 环境下的 Agent 测试,也就是 Claude Code 这类"命令行里干活"的场景。GLM-5.3 的火力集中点,不言自明。上下文窗口方面,GLM-5.3 同样支持 1M token,与 Kimi K3 站在了同一条起跑线上。
五项基准拆解:数字背后说明了什么
抛开宣传话术,直接看硬指标。GLM-5.3 这次公布的基准成绩,含金量集中在编程与智能体两个方向。
| 基准测试 | GLM-5.2 | GLM-5.3 | 考察方向 |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 | 真实终端环境完成复杂任务 |
| DeepSWE v1.1 | 46.2 | 66.9 | 长程软件工程与持续代码修改 |
| Agents' Last Exam | 23.8 | 28.5 | 跨工具协作与长程任务 |
| GDPval-AA v2 | — | 1769 分 | 44 种职业的真实知识工作 |
| CyberGym | 77.2% | 84.5% | 白盒代码审查与漏洞发现 |
几个数字值得单独拎出来品:
Terminal-Bench 3.0 从 4.6 到 28.3,六倍的提升幅度乍一看吓人,但反过来理解更准确——GLM-5.2 在真实终端任务上几乎是个"半成品",4.6 分说明之前模型基本不具备可靠的命令行任务执行能力。28.3 分意味着它从"不能用"进化到了"能顶事",这是质变而非量变。
DeepSWE v1.1 的 66.9 分是全文最关键的一个数字,后面和 Kimi K3 对比时还会用到。这个基准聚焦长程软件工程——不是写一个函数,而是持续地在一个真实仓库里改代码、跑测试、修 bug,是当前最接近"AI 程序员"真实工作状态的评价方式。
CyberGym 的 84.5% 则是个容易被忽视的亮点。这个测试要求模型从白盒源代码出发,通过实际触发程序故障来识别和验证漏洞。GLM-5.3 不仅比前代的 77.2% 高出一截,还略高于 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%,与 Mythos 5 持平。智谱自己也坦言,网络安全能力链条包括代码审查、漏洞验证、漏洞利用和真实攻防闭环四个环节,GLM-5.3 的优势目前集中在前半段——这个自我认知相当清醒,没有吹成"安全能力全球第一"。
另外,GDPval-AA v2 的 1769 分覆盖了 44 种职业的真实高价值知识工作,智谱将其解读为"基于编程能力涌现的专业任务执行能力"——通俗说就是:代码写得好,顺带把金融分析、法律文书这类专业活也带起来了。
正面对决 Kimi K3:两条路线的正面碰撞

现在把 7 月中旬发布的 Kimi K3 拉进来,好戏才真正开始。
先摆一下 Kimi K3 的底牌:2.8 万亿参数(全球最大开源模型)、KDA 混合架构、原生多模态、1M token 上下文窗口、专为长程编程设计。基准方面,Kimi K3 在 SWE Marathon 和 ProgramBench 上领先所有竞争对手,DeepSWE 拿到 67.5 分,前端编程 Arena 盲测以 1679 Elo 位列第一、超越了此前领跑的 Claude Fable 5。训练过程中还顺手找出了 16 个未知漏洞、构建了超过 51 万个沙盒。
把两家的牌面放在一张桌上:
| 维度 | GLM-5.3(智谱) | Kimi K3(月之暗面) |
|---|---|---|
| 发布时间 | 2026-08-14 | 2026-07 中旬 |
| 参数规模 | 沿用 GLM-5.2 基座 | 2.8 万亿,全球最大开源模型 |
| 技术路线 | 基座不变,极致后训练 Scaling | KDA 混合架构,全新 3T 级基座 |
| 上下文与模态 | 1M token | 1M token,原生多模态 |
| DeepSWE | 66.9(v1.1) | 67.5 |
| 编程特色 | 终端/CLI Agent、安全审计 | 长程编程、前端生成(Arena 1679 Elo 第一) |
| 网络安全 | CyberGym 84.5%,对标 Mythos 5 | 训练中发现 16 个未知漏洞 |
| 特色能力 | 智能体、专业任务执行 | Swarm 智能体集群、Goal 模式 |
| 生成速度 | 延续 5.2 底子(5.2 为 116.3 tokens/s) | 40.4 tokens/s |
| 开源 | 开源 | 权重开源,大规模商用需授权 |
| API 定价 | 延续 5.2 成本优势(价差约 2.8 倍) | 约 12 美元/百万输出 token |
| 官方对标 | 编程体感最强开源模型,接近 Fable 5 | 编程超越 Claude Opus 4.8 / GPT 5.5 |

一张图概括这场对决的核心盘面:GLM-5.3 的"快与省"对上 Kimi K3 的"大与全",DeepSWE 上 66.9 对 67.5 的毫厘差距,中间隔着的是 1M 上下文、开源、对标 Fable 5 这三个共同点。
路线之争:换基座还是压榨基座
这场对决最本质的看点,是两种工程哲学的对撞。
Kimi K3 走的是"大力出奇迹"的 classic 路线:更大的参数规模、更新的基座架构、更长的上下文窗口。2.8 万亿参数的模型从零训起,投入的是真金白银的预训练算力。这条路的上限高,但成本高、周期长,每一次迭代都是一场豪赌。
GLM-5.3 则展示了另一条更"经济"的路径:既然 GLM-5.2 的基座还有余量,那就把强化学习的环境做深、时间拉长,用数十倍的长程任务环境把模型的潜力逼出来。DeepSWE 从 46.2 到 66.9、Terminal-Bench 六倍提升,全都在基座零改动的前提下完成——这意味着智谱探索出的这套后训练方法论是可复用的,理论上下一代基座出来后还能再"榨"一轮。
DeepSWE 上的毫厘之差
编程能力最直接的对标是 DeepSWE:GLM-5.3 是 66.9,Kimi K3 是 67.5,差距不到 1 分。
但细看之下有几个微妙之处。第一,GLM-5.3 报的是 v1.1 版本,Kimi K3 的成绩未明确版本口径,不同版本的题目难度并不完全可比。第二,智谱宣称 GLM-5.3 是"多项主流基准测试中排名最高的开源模型",而 Kimi K3 手里也握着 SWE Marathon、ProgramBench 的领先——两家各自挑了自己最占优的赛道发声,这在行业里是常规操作,读者心里要有杆秤。
第三,也是更有意思的一点:Kimi K3 的整体表现据港媒评价仍落后于 Claude Fable 5 和 GPT-5.6 Sol,而 GLM-5.3 的官方口径是"编程与智能体能力接近 Fable 5"。也就是说,两个国产开源模型在编程这个单项上已经咬到了世界前沿的尾流,但在综合能力上,Anthropic 和 OpenAI 的头把交椅暂时还没人能撼动。
间接对比:5.3 发布前的旧格局
必须坦白一点:GLM-5.3 今天刚刚发布,严格的 head-to-head 评测还要等 Artificial Analysis、OpenRouter 这些平台这几天更新 GLM-5.3 的条目。但在 5.3 发布之前,"K3 上限更高、GLM 效率更好"是第三方实测的基本盘,这些数据正好可以用来理解 GLM-5.3 这一枪瞄准了哪里:
- 综合智能指数(Artificial Analysis):K3 (max) 60 分 vs GLM-5.2 (max) 53 分——K3 的原始推理上限领先 7 分
- 前端编码(Arena 盲测):K3 以 1679 Elo 排名第一
- 生成速度:GLM-5.2 跑出 116.3 tokens/s,K3 只有 40.4 tokens/s——差了接近 3 倍
- 成本:GLM 单次运行全面更便宜,与 K3 的价差约 2.8 倍
- Agent 可靠性:GLM 在编码效率、长程任务稳定性上的口碑更好
- 前沿编程任务(Composio 测试):两者均 7/12,打平
知乎实测给出的结论很精辟:"GLM-5.2 是对成本敏感时的默认选择,Kimi K3 是你有意去买的能力升级"。而 GLM-5.3 这一版的使命昭然若揭——中关村在线在发布前的分析就预判它有望追平 K3;如果提升幅度更大,甚至可能摸到 GPT-5.6 / Opus 5 的档位。从 DeepSWE 66.9 对 67.5 的毫厘之差看,"追平"这个预判基本兑现了,"摸到上一档"则要等第三方验证。
差异化的护城河
抛开分数,两个模型的"性格"差异其实很明显:
- GLM-5.3 偏"工程务实派":终端任务执行(Terminal-Bench)、持续代码修改(DeepSWE)、白盒安全审计(CyberGym)——全是开发者日常里最脏最累的活。加上 44 种职业的专业任务执行能力,它更像一个能直接编入团队的"数字员工"。
- Kimi K3 偏"能力全景派":原生多模态加百万上下文,决定了它能处理更异构的输入;Swarm 智能体集群和 Goal 模式则瞄准了多智能体协同这个下一代交互范式,甚至官方还演示了构建多人与 3D 游戏、生成咨询级 PPT 这类"炫技"场景。
对开发者来说,这不是"谁更强"的二选一,而是"哪个更贴合你的工作流"的多选题。
一周三连发:GLM-5.3 背后的行业暗流
把镜头拉远,GLM-5.3 的发布不是一个孤立事件,而是一场密集接力赛中的一棒。
8 月 13 日凌晨,DeepSeek V4 Pro 正式推出,版本号 DeepSeek-V4-Pro-0813,重点增强 Agent 能力。看数据更震撼:DeepSWE 得分从 Preview 版的 7.3 暴涨到 62.7,直接超越 Claude Opus 4.8;在 Cybergym 和 AutomationBench 两个基准上,甚至超越了公认最强的 Claude Fable 5。
8 月 13 日晚间,DeepSeek 紧接着放出第二款重磅产品:DeepSeek Harness 开发者预览版(v0.1)面向全球开放测试,同步以 MIT 协议开源。这款智能体框架采用"一切皆插件"的设计——模型、工具、技能、会话、沙箱、存储、循环、调度、UI,所有 Agent 能力都由插件组合而成,可自由替换、灵活重组。这个思路和 Claude Code 的技能生态异曲同工,摆明了是要在智能体基础设施层卡位。
同期,SpaceXAI 发布 Grok 4.6,在 Grok 4.5 基础上重点提升长流程任务表现,以及更复杂的交互式、视觉和知识工作任务处理能力。
一周之内,四家巨头轮番出牌,而且全部押注同一个方向:编程 + 智能体。这个共识本身比任何单个模型的分数都更能说明问题——通用聊天已经是上一时代的战场,能在真实工程环境里持续干活的智能体,才是这一轮竞赛的决赛圈。
资本市场倒是冷静得近乎冷酷:截至澎湃新闻发稿,智谱股价跌超 4%。技术发布的火热和股价的绿意形成了一组颇具黑色幽默的对照——模型再强,市场买不买账是另一回事。这也可以理解:当发布密度高到"周更",单次发布的惊喜阈值自然被拉高了。
开发者怎么选:一份不站队的参考
聊了这么多宏观的,落到实际选型上,给几条接地气的建议:
如果你主攻后端工程和 DevOps 场景——尤其是 Claude Code 这类终端/CLI Agent 工作流,GLM-5.3 的能力画像明显更对口。Terminal-Bench 的六倍提升和 CyberGym 的 84.5% 都指向这类"脏活累活",而且智谱在安全审计前半段(代码审查、漏洞验证)的能力已经摸到世界第一梯队。
如果你要处理多模态输入——Kimi K3 的原生多模态是 GLM-5.3 目前没有公开对标的能力,图像理解、跨模态检索这类场景选它更稳。至于超长文档,两边都是 1M 上下文,站在同一起跑线。
如果你在搭建多智能体系统——Kimi K3 的 Swarm 集群和 Goal 模式提供了开箱即用的编排能力;但如果追求可控性和可定制性,DeepSeek Harness 的"一切皆插件"架构加上 MIT 协议,可能是更灵活的底座选择。
如果你关心成本和速度——这是 GLM 最硬的底牌:5.2 时代的实测数据是 116.3 tokens/s 对 K3 的 40.4 tokens/s,生成速度快近 3 倍;单次运行成本低约 2.8 倍。GLM-5.3 基座未变,成本结构大概率延续这个优势。Kimi K3 约 12 美元/百万输出 token 的定价接近 Anthropic 中端产品,为上限付费的意味明显。按知乎实测的说法:成本敏感选 GLM,有意买能力上限选 K3——而 GLM-5.3 正在让这个二选一变得模糊。
最后的兜底建议:两个模型都是开源的(Kimi K3 大规模商用需另行授权),成本敏感的团队完全可以本地部署实测。拿自己项目里的真实 bug 单、真实终端任务各跑一轮,比看十篇评测文章都管用。
总结
GLM-5.3 和 Kimi K3 的这场对决,表面看是 66.9 对 67.5 的毫厘之争,实质是两种工程路线的正面验证:Kimi K3 用 2.8 万亿参数的新基座买来了原始智能上限,GLM-5.3 则证明了后训练 Scaling 的性价比和可复制性——在不换基座的前提下,把与 K3 的能力差距基本抹平,同时保住了快 3 倍的速度和低 2.8 倍的成本。两条路线殊途同归地把国产开源模型推到了世界编程能力的第一梯队边缘——都逼近 Claude Fable 5,都还差临门一脚。当然,今天发布的 GLM-5.3 交出的还是官方答卷,严格的第三方对线还要等 Artificial Analysis、OpenRouter 这几天更新条目,届时见分晓。
更值得关注的是节奏。DeepSeek V4 Pro、DeepSeek Harness、GLM-5.3、Grok 4.6 在一周内密集落地,且全部聚焦编程与智能体,行业共识已经清晰得不需要任何解读。接下来的看点有三个:一是后训练 Scaling 的方法论会不会被智谱快速复用到下一代基座上、形成"双轮驱动";二是 DeepSeek Harness 的插件化生态能否长出像 Claude Code 技能市场那样的繁荣社区;三是这些开源模型与 Fable 5、GPT-5.6 Sol 的最后一分差距,究竟什么时候、由谁来填平。
对普通开发者而言,最好的时代可能真的来了:顶级的编程智能体能力,正在以开源和低门槛 API 的方式快速平民化。与其纠结"选哪个",不如现在就动手,把它们编进自己的工作流。
本文为 JeecgBoot AI 专题研究系列文章。