
这两天,DeepSeek V4 Pro正式版和GLM-5.3前后脚上线。
一个把Agent成绩拉得像换了一代模型,一个连基座都没换,只靠后训练继续往前拱。
按正常剧本,DeepSeek V4 Pro应该更容易成为主角。模型更大,发布阵仗更足,正式版相对预览版的提升也确实夸张。
但老金先把观点拍在这儿:这一轮,我更偏向GLM-5.3,我肯定不是因为DeepSeek涨价才这么选的。。。
不是因为GLM-5.3每张榜单都赢了,更不是DeepSeek V4 Pro不够强。真按官方数据看,DeepSeek这次的Agent能力提升,没什么可阴阳怪气的,确实猛。
我偏向GLM,是因为这两个模型看似在比谁更强,实际上回答的是两个完全不同的问题。
DeepSeek V4 Pro在证明:把一个更大的模型放进标准环境,给足思考预算,它的能力上限还能推到多高。
GLM-5.3在证明:同一个模型不换底座、不加参数,只要继续扩大真实任务、工具环境和失败经验,它还能被训练得多会干活。
一个在继续抬高天花板,一个在想办法托住地板。
对于现在的Agent,我反而觉得后者更重要。
01 DeepSWE暴涨近50分,DeepSeek先把所有人吓了一跳
先看DeepSeek V4 Pro。
正式版相对预览版,Terminal-Bench 2.1从72.1涨到87.9,CyberGym从52.7涨到83.3,AutomationBench从12.8涨到31.8,DeepSWE更是从12.8直接干到62.7,接近暴涨50分。
先解释下这些词儿:Terminal-Bench看Agent能不能在终端里完成真实任务,CyberGym看它能不能在真实代码里复现漏洞,AutomationBench看它能不能跨多个业务软件完成一整套流程,DeepSWE看它能不能在真实代码仓库里完成长程开发任务。

这个幅度已经不能叫常规升级了,说人话,预览版和正式版虽然顶着同一个名字,里面住着的已经不太像同一个模型。
数据太多没关系,把最离谱的几个拎出来看就行。
DeepSWE,增加49.9分。CyberGym,增加30.6分。

AutomationBench,从12.8涨到31.8,差不多翻了1.5倍。


可我看完这张表,第一反应却不是DeepSeek稳了。
仔细看完数据会发现,它眼下更难解释的对手,可能是自家的V4 Flash。
02 Pro大了5.6倍,怎么Flash还在屁股后面追?
DeepSeek V4 Pro有1.6T总参数,每个Token激活49B参数。V4 Flash只有284B总参数,每次激活13B。
也就是说,Pro的总参数大约是Flash的5.6倍,激活参数也接近3.8倍。
按这个体量差距,正常想象应该是Pro把Flash按在地上摩擦。
结果并没有。
DeepSWE上,Pro是62.7,Flash是54.4,领先8.3分,Toolathlon是74.1对70.3,领先3.8分,Agents’ Last Exam更有意思,25.7对25.2,只差0.5分。

你品一下,细品。
一个模型大了5.6倍,在某些Agent任务上,最后只多了零点几分。
更现实的问题是价格。
按照官方公布的8月17日起新定价,V4 Pro无论缓存输入、普通输入还是输出,价格全部都是V4 Flash的3倍。


所以DeepSeek V4 Pro现在最难回答的问题是:当Flash已经咬得这么紧,我为什么还要付三倍的钱用Pro?
这不是说大模型没用。更大的模型有更大的知识容量,在极难任务、复杂推理和长程执行里,也更有机会跑出真正惊艳的结果。
可参数只是容量,不是能力兑换券。
仓库盖大了,货没有跟着多起来,很多地方自然还是空的。
03 模型大了5.6倍,能力为什么没有一起长?
再看DeepSeek正式版提升最猛的地方,会发现一个很明显的规律。
DeepSWE、Terminal-Bench、CyberGym、AutomationBench,基本都属于代码执行、工具调用、安全攻防和Agent任务。
它们有一个共同特点:结果比较容易验证。
代码能不能运行,测试有没有通过,命令执行之后有没有拿到正确结果,漏洞到底有没有复现成功,机器都可以给出相对明确的反馈。
模型改一次代码,测试失败了,再回来继续改;命令报错了,就顺着报错往下查;攻击路径没走通,再换另一条。
每走一步,都有路标。
所以这类任务特别适合强化学习。模型不是只听老师讲哪道题做错了,而是能够自己进考场、交卷、看到分数,再回来重做。

DeepSeek并不是没有环境。它的技术报告里写了大规模沙箱、工具执行、轨迹记录和确定性回放。
所以说DeepSeek“没有环境”,不准确。
更准确的说法是:哪里反馈最密、验证最清楚,哪里就最容易把后训练兑换成分数。

可这时候另一个问题又来了。真实工作有这么标准吗?
当然没有。
真实项目里的需求经常是含糊的,代码库里有历史包袱,测试本身可能写错,用户嘴上说的和真正想要的甚至不是一回事。
很多时候,系统自己都不知道什么叫“完全正确”。
这时候,光有一个特别聪明的模型还不够。
它得见过更乱的现场。
而这,正好把GLM-5.3推到了台前。
04 一个参数没加,GLM-5.3凭什么又涨了这么多?
这才是GLM-5.3最让我感兴趣的地方。
智谱这次说得很明确:GLM-5.3沿用GLM-5.2的基座,没有增加参数,这一轮提升全部来自后训练。
先看结果,Terminal-Bench 3.0从4.6涨到28.3,DeepSWE从46.2涨到66.9,Agents’ Last Exam从23.8涨到28.5。
在智谱自己的Z.ai Code Bench里,GLM-5.3相比GLM-5.2整体提升约50%。

注意啊。
不是744B变成1T。不是40B激活变成80B。
底座压根儿没换。

这就有意思了。同一个脑子,为什么两个月以后又突然会干这么多东西了?
答案藏在它这次后训练的环境里。
05 GLM真正扩大的,不是参数,是它见过的世界
以前训练Coding模型,很多时候更像给学生发一道编程题。
题目在这里,代码写出来,测试通过,加分。
GLM-5.3这次明显开始往另一边走了。
模型面对的不只是一个问题,而是一整条工作链路:发现问题、分析方案、动手实现、运行验证,再一直把任务推到可以交付。
它要进入真实计算集群,要读代码库、存储系统和内部文档。有些任务的工作量,官方形容为高级工程师连续工作几天。

这就不是刷题了,这是直接把人扔进公司。
给它一个几十万行代码的项目,一堆三年前留下来的文档,几个偶尔抽风的测试,再告诉它:今天别给我写分析报告,先把这事儿解决了。
这时候练出来的东西,就完全不一样了。

而且GLM-5.3并不是只增加思考时间。官方专门展示了不同思考预算下,模型能力如何变化。

但我真正感兴趣的,还不是它愿意多想几步。而是它“想”的时候,已经不只是坐在桌子前想了。
它开始动手,读文件,调用工具,改代码,跑测试,失败了再回来。

这就像一个刚毕业的学生,以前你天天给他刷LeetCode,他当然会越来越会考试。
现在你把一个几十万行代码的项目扔给他,文档还是三年前留下的,测试偶尔抽风,需求只写了一句话,然后告诉他:今天下班之前,这个问题你给我解决掉。
这时候练出来的东西,就完全不一样了。
GLM-5.3扩大的,不只是训练数据,而是模型经历过的复杂世界。
所以我现在越来越觉得,GLM-5.3真正Scale的不是模型。
它在Scale模型能够经历的世界。
这件事,在我看来比再多堆几千亿参数值钱得多。
06 最大的冲突来了:模型公司卖“能做到”,用户买“别翻车”
到这里,两条路线真正撞上了。
模型公司最喜欢证明的是:模型有没有能力完成一件事。
用户真正掏钱买的却是:我这一次把任务交给它,它到底会不会翻车。
看起来只差几个字,实际上差得老远了。
Benchmark通常会给模型标准Harness、足够上下文、较高思考预算,再按照统一方式运行。
Harness说白了,就是套在模型外面的整套工作系统:给任务、接工具、管上下文、跑验证。
这完全合理,不这么做反而没法公平比较,但它更容易测出来的,是一个模型的能力上限。
老金真正关心的,却是模型的交付下限。

我现在每天拿AI做产品、跑代码、查问题、搭工作流。我到现在代码也不会多少,所以我根本没兴趣看它十次里面能不能有一次突然封神。
我在意的是,项目第一次扔进去,它能不能先看懂;碰到报错以后,它能不能别立刻瞎改;测试本身有问题时,它能不能意识到不一定是代码的问题;任务做完以后,它又知不知道回头检查一下,自己有没有顺手弄坏别的地方。
而我的Meta_Kim,就是一套完完整整的Harness:从理解目标、选择能力、执行任务,到复核证据、沉淀经验,整个闭环都在里面。

榜单上的模型经常给人一种很拧巴的感觉。
第一条轨迹像个大神,直接把根因挖出来了。第二条突然漏看一个配置文件,开始在错误方向上一路狂奔。第三条更刺激,原来的Bug还没修好,又免费赠送了两个新的。
你说它不聪明吧,它偶尔真能把人看傻。
你说它能当员工吧,你又不敢转身去睡觉。
Agent最值钱的,从来不是偶尔走出一条神级轨迹,而是在默认预算、陌生环境和单次执行里,依然能把事情稳稳往交付状态推进。

这也是我为什么越来越在意后训练环境,模型已经够聪明了,现在缺的是经验。
07 GLM-5.3最让我意外的,其实不是Coding
看到这里,我原本已经挺偏GLM-5.3了。
结果继续往下翻官方材料,还有一块让我觉得他们押得挺狠。
网络安全。
GLM-5.3在CyberGym上的官方成绩达到84.5,ExploitBench则从GLM-5.2的24.4提升到54.4。
CyberGym是给Agent真实漏洞和未修复代码,看它能不能写出复现漏洞的PoC。ExploitBench再往前一步,看它能不能把已知漏洞一路推进到真正可利用。

不过官方自己也承认,目前优势主要集中在漏洞发现、白盒代码审计和利用链前半段,更完整、更深入的攻防能力仍然需要继续提升。
这反而让我觉得比较可信,可真正有意思的不是这几个分,是为什么智谱现在突然这么重视安全。
08 Agent手脚越多,真正危险的可能才刚刚开始
以前的大模型,顶多跟你聊两句,答错了,你骂它两句也就完事儿了。
现在完全不是一回事。
Agent开始拥有浏览器、Terminal、代码仓库、数据库、云服务器、企业文档,甚至慢慢开始接触支付系统和生产环境。
Harness越厚,Agent的手脚越多。手脚越多,能做的事情当然越多。
可一旦犯错,破坏力也会一起变大。
测试全绿,不代表没有安全漏洞;功能能用,不代表权限没有越界;订单创建成功,也不代表高并发时不会重复扣款。
更麻烦的是,验证器自己也可能有Bug。
所以未来真正进入生产环境的Agent,不能只知道怎么把任务完成。
它还得知道:这个完成方式有没有埋雷?
第一层验证器告诉它,功能已经通过。
第二层模型再多问一句,虽然通过了,但你到底是怎么通过的?
这也是为什么,我特别喜欢一句很简单的话:Agent当然需要油门,但真正决定它敢不敢进入生产环境的,往往是刹车。
GLM-5.3现在就开始重点补这块,我觉得很有先见之明。
而且智谱这次没有只拿安全当一个Benchmark宣传点,它连模型开放节奏都开始考虑安全问题。

到这里,我为什么更偏GLM-5.3,其实已经比较清楚了。
它不是简单地又多会了一门网络安全,它是在为Agent真正进入生产环境以后,提前补一层保险。
09 真让我选,我会选谁?
如果今天让我在DeepSeek V4 Pro和GLM-5.3里选一个,作为ZCode、Claude Code这类Coding Agent里的复杂任务主力,我会先选GLM-5.3。
DeepSeek V4 Pro当然很强,而且产品交付明显更加完整。App、网页、API、Responses API、Codex适配、开放权重都已经到位。
明确、可验证、又特别看重成本的日常任务,我甚至很可能直接选择V4 Flash。
原因也很简单,Flash已经把Pro咬得太紧了。
可到了复杂项目、长程执行、深度排错、反复验证这些真正让我头疼的活儿,我现在反而更想把机会给GLM-5.3。
因为我需要的不是一个偶尔能写出神级答案的模型。
我需要的是,把整个项目扔进去以后,它先自己看,自己找,自己改,自己跑。第一次没搞定没关系,别停,接着查。最后任务做完了,还知道回头看看自己有没有顺手埋下新的雷。
DeepSeek V4 Pro让我看到,一个更大的模型还能把上限推到哪里。
GLM-5.3让我看到的是,一个已经足够大的模型,在真实环境里继续经历任务、失败、修复和交付之后,还能发生什么。
如果让我在这两件事里押一个未来,我更愿意押第二个。
写在最后:模型没换,人为什么不能继续长?
写到这里,我突然意识到,我为什么会对GLM-5.3这次更新这么有感觉。
可能根本不只是因为它强,而是它这次做的事情,本身就挺有意思。
它只是被不断扔进更复杂的环境,让它遇到以前没遇到过的问题,让它犯错,让它重来,让它从一次次真实反馈里继续往前长。
然后两个月以后,同一个底座,已经能做以前做不到的事情了。
我看到这里的时候,突然觉得这事儿跟人还挺像的。
我们以前特别容易相信一件事:一个人今天是什么样,大概就决定了以后能走多远。
学历不够,专业不对,不会代码,英语不好,没有资源,也不是所谓的天赋型选手。
这些东西好像一个个参数,出生的时候、毕业的时候、进入社会的时候,就已经写在模型卡上了。
然后我们开始拿着这张自己的“模型卡”,给人生划范围。
这个我不会,那个我做不了,这件事应该找专业的人,那个领域跟我没关系。
久而久之,连自己都信了。
可AI出现以后,我越来越不相信这件事了。
我到现在代码也不会多少,英语也没有突然变好。
如果按几年前的标准看,我压根儿不应该去碰什么产品开发、Agent、工作流,更别说自己折腾一堆代码项目。
可现在这些事情,我真的在做。
不是因为哪天早上起来,我突然给自己的脑子扩了五倍参数,也不是因为我突然变成了程序员。
而是因为我手里多了一个东西,它能带我进入那些以前根本进不去的地方。
我们正在进入一个以前从来没有出现过的时代。
一个人的起点,开始没有过去那么重要了。
你原来会什么,也开始没有过去那么重要了。
真正重要的是,当一个越来越强大的智能出现在你身边以后,你敢不敢带着它,走进那些过去觉得“不属于自己”的地方。
我不知道这条路最后能走多远。
但至少这几年,我已经亲眼看着很多曾经横在自己面前的墙,一堵一堵变矮了。
那就继续往前走吧。
不会的,路上学。
做不到的,带着AI再试一次。
前面还有墙,就再翻一堵。
我们这一代人可能第一次拥有了这样一个机会:不必先成为那个更强的人,才有资格去做更大的事。
我们可以先走进去。
然后让那些真正做过的事,反过来把自己变成那个人。
谢谢你读我的文章。
如果觉得不错,随手点个赞、在看、转发三连吧🙂
如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章。
开源知识库地址(实时更新交流群):
https://tffyvtlai4.feishu.cn/wiki/OhQ8wqntFihcI1kWVDlcNdpznFf