DeepSeek V4 Pro暴涨近50分,我却更想押GLM-5.3

简介: DeepSeek V4 Pro正式版和GLM-5.3前后脚上线。一个把Agent成绩拉得像换了一代模型,一个连基座都没换,只靠后训练继续往前拱。老金来给你详细说说。

Image

这两天,DeepSeek V4 Pro正式版和GLM-5.3前后脚上线。

一个把Agent成绩拉得像换了一代模型,一个连基座都没换,只靠后训练继续往前拱。

按正常剧本,DeepSeek V4 Pro应该更容易成为主角。模型更大,发布阵仗更足,正式版相对预览版的提升也确实夸张。

但老金先把观点拍在这儿:这一轮,我更偏向GLM-5.3,我肯定不是因为DeepSeek涨价才这么选的。。。

不是因为GLM-5.3每张榜单都赢了,更不是DeepSeek V4 Pro不够强。真按官方数据看,DeepSeek这次的Agent能力提升,没什么可阴阳怪气的,确实猛。

我偏向GLM,是因为这两个模型看似在比谁更强,实际上回答的是两个完全不同的问题。

DeepSeek V4 Pro在证明:把一个更大的模型放进标准环境,给足思考预算,它的能力上限还能推到多高。

GLM-5.3在证明:同一个模型不换底座、不加参数,只要继续扩大真实任务、工具环境和失败经验,它还能被训练得多会干活。

一个在继续抬高天花板,一个在想办法托住地板。

对于现在的Agent,我反而觉得后者更重要。

01 DeepSWE暴涨近50分,DeepSeek先把所有人吓了一跳

先看DeepSeek V4 Pro。

正式版相对预览版,Terminal-Bench 2.1从72.1涨到87.9,CyberGym从52.7涨到83.3,AutomationBench从12.8涨到31.8,DeepSWE更是从12.8直接干到62.7,接近暴涨50分。

先解释下这些词儿:Terminal-Bench看Agent能不能在终端里完成真实任务,CyberGym看它能不能在真实代码里复现漏洞,AutomationBench看它能不能跨多个业务软件完成一整套流程,DeepSWE看它能不能在真实代码仓库里完成长程开发任务。


Image

这个幅度已经不能叫常规升级了,说人话,预览版和正式版虽然顶着同一个名字,里面住着的已经不太像同一个模型。

数据太多没关系,把最离谱的几个拎出来看就行。

DeepSWE,增加49.9分。CyberGym,增加30.6分。


Image

AutomationBench,从12.8涨到31.8,差不多翻了1.5倍。

ImageImage

可我看完这张表,第一反应却不是DeepSeek稳了。

仔细看完数据会发现,它眼下更难解释的对手,可能是自家的V4 Flash。

02 Pro大了5.6倍,怎么Flash还在屁股后面追?

DeepSeek V4 Pro有1.6T总参数,每个Token激活49B参数。V4 Flash只有284B总参数,每次激活13B。

也就是说,Pro的总参数大约是Flash的5.6倍,激活参数也接近3.8倍。
按这个体量差距,正常想象应该是Pro把Flash按在地上摩擦。

结果并没有。

DeepSWE上,Pro是62.7,Flash是54.4,领先8.3分,Toolathlon是74.1对70.3,领先3.8分,Agents’ Last Exam更有意思,25.7对25.2,只差0.5分。


Image

你品一下,细品。

一个模型大了5.6倍,在某些Agent任务上,最后只多了零点几分。

更现实的问题是价格。
按照官方公布的8月17日起新定价,V4 Pro无论缓存输入、普通输入还是输出,价格全部都是V4 Flash的3倍。

ImageImage

所以DeepSeek V4 Pro现在最难回答的问题是:当Flash已经咬得这么紧,我为什么还要付三倍的钱用Pro?

这不是说大模型没用。更大的模型有更大的知识容量,在极难任务、复杂推理和长程执行里,也更有机会跑出真正惊艳的结果。

可参数只是容量,不是能力兑换券。

仓库盖大了,货没有跟着多起来,很多地方自然还是空的。

03 模型大了5.6倍,能力为什么没有一起长?

再看DeepSeek正式版提升最猛的地方,会发现一个很明显的规律。

DeepSWE、Terminal-Bench、CyberGym、AutomationBench,基本都属于代码执行、工具调用、安全攻防和Agent任务。

它们有一个共同特点:结果比较容易验证。

代码能不能运行,测试有没有通过,命令执行之后有没有拿到正确结果,漏洞到底有没有复现成功,机器都可以给出相对明确的反馈。

模型改一次代码,测试失败了,再回来继续改;命令报错了,就顺着报错往下查;攻击路径没走通,再换另一条。

每走一步,都有路标。

所以这类任务特别适合强化学习。模型不是只听老师讲哪道题做错了,而是能够自己进考场、交卷、看到分数,再回来重做。


Image

DeepSeek并不是没有环境。它的技术报告里写了大规模沙箱、工具执行、轨迹记录和确定性回放。

所以说DeepSeek“没有环境”,不准确。

更准确的说法是:哪里反馈最密、验证最清楚,哪里就最容易把后训练兑换成分数。


Image

可这时候另一个问题又来了。真实工作有这么标准吗?
当然没有。

真实项目里的需求经常是含糊的,代码库里有历史包袱,测试本身可能写错,用户嘴上说的和真正想要的甚至不是一回事。
很多时候,系统自己都不知道什么叫“完全正确”。
这时候,光有一个特别聪明的模型还不够。

它得见过更乱的现场。

而这,正好把GLM-5.3推到了台前。

04 一个参数没加,GLM-5.3凭什么又涨了这么多?

这才是GLM-5.3最让我感兴趣的地方。

智谱这次说得很明确:GLM-5.3沿用GLM-5.2的基座,没有增加参数,这一轮提升全部来自后训练。

先看结果,Terminal-Bench 3.0从4.6涨到28.3,DeepSWE从46.2涨到66.9,Agents’ Last Exam从23.8涨到28.5。

在智谱自己的Z.ai Code Bench里,GLM-5.3相比GLM-5.2整体提升约50%。


Image

注意啊。

不是744B变成1T。不是40B激活变成80B。

底座压根儿没换。


Image

这就有意思了。同一个脑子,为什么两个月以后又突然会干这么多东西了?

答案藏在它这次后训练的环境里。

05 GLM真正扩大的,不是参数,是它见过的世界

以前训练Coding模型,很多时候更像给学生发一道编程题。

题目在这里,代码写出来,测试通过,加分。

GLM-5.3这次明显开始往另一边走了。

模型面对的不只是一个问题,而是一整条工作链路:发现问题、分析方案、动手实现、运行验证,再一直把任务推到可以交付。

它要进入真实计算集群,要读代码库、存储系统和内部文档。有些任务的工作量,官方形容为高级工程师连续工作几天。


Image

这就不是刷题了,这是直接把人扔进公司。

给它一个几十万行代码的项目,一堆三年前留下来的文档,几个偶尔抽风的测试,再告诉它:今天别给我写分析报告,先把这事儿解决了。

这时候练出来的东西,就完全不一样了。


Image

而且GLM-5.3并不是只增加思考时间。官方专门展示了不同思考预算下,模型能力如何变化。


Image

但我真正感兴趣的,还不是它愿意多想几步。而是它“想”的时候,已经不只是坐在桌子前想了。

它开始动手,读文件,调用工具,改代码,跑测试,失败了再回来。


Image

这就像一个刚毕业的学生,以前你天天给他刷LeetCode,他当然会越来越会考试。

现在你把一个几十万行代码的项目扔给他,文档还是三年前留下的,测试偶尔抽风,需求只写了一句话,然后告诉他:今天下班之前,这个问题你给我解决掉。

这时候练出来的东西,就完全不一样了。

GLM-5.3扩大的,不只是训练数据,而是模型经历过的复杂世界。

所以我现在越来越觉得,GLM-5.3真正Scale的不是模型。

它在Scale模型能够经历的世界。

这件事,在我看来比再多堆几千亿参数值钱得多。

06 最大的冲突来了:模型公司卖“能做到”,用户买“别翻车”

到这里,两条路线真正撞上了。

模型公司最喜欢证明的是:模型有没有能力完成一件事。

用户真正掏钱买的却是:我这一次把任务交给它,它到底会不会翻车。

看起来只差几个字,实际上差得老远了。

Benchmark通常会给模型标准Harness、足够上下文、较高思考预算,再按照统一方式运行。

Harness说白了,就是套在模型外面的整套工作系统:给任务、接工具、管上下文、跑验证。

这完全合理,不这么做反而没法公平比较,但它更容易测出来的,是一个模型的能力上限。

老金真正关心的,却是模型的交付下限。


Image

我现在每天拿AI做产品、跑代码、查问题、搭工作流。我到现在代码也不会多少,所以我根本没兴趣看它十次里面能不能有一次突然封神。

我在意的是,项目第一次扔进去,它能不能先看懂;碰到报错以后,它能不能别立刻瞎改;测试本身有问题时,它能不能意识到不一定是代码的问题;任务做完以后,它又知不知道回头检查一下,自己有没有顺手弄坏别的地方。

而我的Meta_Kim,就是一套完完整整的Harness:从理解目标、选择能力、执行任务,到复核证据、沉淀经验,整个闭环都在里面。


Image

榜单上的模型经常给人一种很拧巴的感觉。

第一条轨迹像个大神,直接把根因挖出来了。第二条突然漏看一个配置文件,开始在错误方向上一路狂奔。第三条更刺激,原来的Bug还没修好,又免费赠送了两个新的。

你说它不聪明吧,它偶尔真能把人看傻。

你说它能当员工吧,你又不敢转身去睡觉。

Agent最值钱的,从来不是偶尔走出一条神级轨迹,而是在默认预算、陌生环境和单次执行里,依然能把事情稳稳往交付状态推进。


Image

这也是我为什么越来越在意后训练环境,模型已经够聪明了,现在缺的是经验。

07 GLM-5.3最让我意外的,其实不是Coding

看到这里,我原本已经挺偏GLM-5.3了。

结果继续往下翻官方材料,还有一块让我觉得他们押得挺狠。

网络安全。

GLM-5.3在CyberGym上的官方成绩达到84.5,ExploitBench则从GLM-5.2的24.4提升到54.4。

CyberGym是给Agent真实漏洞和未修复代码,看它能不能写出复现漏洞的PoC。ExploitBench再往前一步,看它能不能把已知漏洞一路推进到真正可利用。


Image

不过官方自己也承认,目前优势主要集中在漏洞发现、白盒代码审计和利用链前半段,更完整、更深入的攻防能力仍然需要继续提升。

这反而让我觉得比较可信,可真正有意思的不是这几个分,是为什么智谱现在突然这么重视安全。

08 Agent手脚越多,真正危险的可能才刚刚开始

以前的大模型,顶多跟你聊两句,答错了,你骂它两句也就完事儿了。

现在完全不是一回事。

Agent开始拥有浏览器、Terminal、代码仓库、数据库、云服务器、企业文档,甚至慢慢开始接触支付系统和生产环境。

Harness越厚,Agent的手脚越多。手脚越多,能做的事情当然越多。

可一旦犯错,破坏力也会一起变大。

测试全绿,不代表没有安全漏洞;功能能用,不代表权限没有越界;订单创建成功,也不代表高并发时不会重复扣款。

更麻烦的是,验证器自己也可能有Bug。

所以未来真正进入生产环境的Agent,不能只知道怎么把任务完成。

它还得知道:这个完成方式有没有埋雷?

第一层验证器告诉它,功能已经通过。

第二层模型再多问一句,虽然通过了,但你到底是怎么通过的?

这也是为什么,我特别喜欢一句很简单的话:Agent当然需要油门,但真正决定它敢不敢进入生产环境的,往往是刹车。

GLM-5.3现在就开始重点补这块,我觉得很有先见之明。

而且智谱这次没有只拿安全当一个Benchmark宣传点,它连模型开放节奏都开始考虑安全问题。


Image
到这里,我为什么更偏GLM-5.3,其实已经比较清楚了。

它不是简单地又多会了一门网络安全,它是在为Agent真正进入生产环境以后,提前补一层保险。

09 真让我选,我会选谁?

如果今天让我在DeepSeek V4 Pro和GLM-5.3里选一个,作为ZCode、Claude Code这类Coding Agent里的复杂任务主力,我会先选GLM-5.3。

DeepSeek V4 Pro当然很强,而且产品交付明显更加完整。App、网页、API、Responses API、Codex适配、开放权重都已经到位。

明确、可验证、又特别看重成本的日常任务,我甚至很可能直接选择V4 Flash。

原因也很简单,Flash已经把Pro咬得太紧了。

可到了复杂项目、长程执行、深度排错、反复验证这些真正让我头疼的活儿,我现在反而更想把机会给GLM-5.3。

因为我需要的不是一个偶尔能写出神级答案的模型。

我需要的是,把整个项目扔进去以后,它先自己看,自己找,自己改,自己跑。第一次没搞定没关系,别停,接着查。最后任务做完了,还知道回头看看自己有没有顺手埋下新的雷。

DeepSeek V4 Pro让我看到,一个更大的模型还能把上限推到哪里。

GLM-5.3让我看到的是,一个已经足够大的模型,在真实环境里继续经历任务、失败、修复和交付之后,还能发生什么。

如果让我在这两件事里押一个未来,我更愿意押第二个。

写在最后:模型没换,人为什么不能继续长?

写到这里,我突然意识到,我为什么会对GLM-5.3这次更新这么有感觉。

可能根本不只是因为它强,而是它这次做的事情,本身就挺有意思。

它只是被不断扔进更复杂的环境,让它遇到以前没遇到过的问题,让它犯错,让它重来,让它从一次次真实反馈里继续往前长。

然后两个月以后,同一个底座,已经能做以前做不到的事情了。

我看到这里的时候,突然觉得这事儿跟人还挺像的。

我们以前特别容易相信一件事:一个人今天是什么样,大概就决定了以后能走多远。

学历不够,专业不对,不会代码,英语不好,没有资源,也不是所谓的天赋型选手。

这些东西好像一个个参数,出生的时候、毕业的时候、进入社会的时候,就已经写在模型卡上了。

然后我们开始拿着这张自己的“模型卡”,给人生划范围。

这个我不会,那个我做不了,这件事应该找专业的人,那个领域跟我没关系。

久而久之,连自己都信了。

可AI出现以后,我越来越不相信这件事了。

我到现在代码也不会多少,英语也没有突然变好。

如果按几年前的标准看,我压根儿不应该去碰什么产品开发、Agent、工作流,更别说自己折腾一堆代码项目。

可现在这些事情,我真的在做。

不是因为哪天早上起来,我突然给自己的脑子扩了五倍参数,也不是因为我突然变成了程序员。

而是因为我手里多了一个东西,它能带我进入那些以前根本进不去的地方。

我们正在进入一个以前从来没有出现过的时代。

一个人的起点,开始没有过去那么重要了。

你原来会什么,也开始没有过去那么重要了。

真正重要的是,当一个越来越强大的智能出现在你身边以后,你敢不敢带着它,走进那些过去觉得“不属于自己”的地方。

我不知道这条路最后能走多远。

但至少这几年,我已经亲眼看着很多曾经横在自己面前的墙,一堵一堵变矮了。

那就继续往前走吧。

不会的,路上学。

做不到的,带着AI再试一次。

前面还有墙,就再翻一堵。

我们这一代人可能第一次拥有了这样一个机会:不必先成为那个更强的人,才有资格去做更大的事。

我们可以先走进去。

然后让那些真正做过的事,反过来把自己变成那个人。


谢谢你读我的文章。
如果觉得不错,随手点个赞、在看、转发三连吧🙂
如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章。

开源知识库地址(实时更新交流群):
https://tffyvtlai4.feishu.cn/wiki/OhQ8wqntFihcI1kWVDlcNdpznFf

相关文章
|
存储 缓存 文件存储
如何保证分布式文件系统的数据一致性
分布式文件系统需要向上层应用提供透明的客户端缓存,从而缓解网络延时现象,更好地支持客户端性能水平扩展,同时也降低对文件服务器的访问压力。当考虑客户端缓存的时候,由于在客户端上引入了多个本地数据副本(Replica),就相应地需要提供客户端对数据访问的全局数据一致性。
33250 201
如何保证分布式文件系统的数据一致性
|
设计模式 存储 监控
设计模式(C++版)
看懂UML类图和时序图30分钟学会UML类图设计原则单一职责原则定义:单一职责原则,所谓职责是指类变化的原因。如果一个类有多于一个的动机被改变,那么这个类就具有多于一个的职责。而单一职责原则就是指一个类或者模块应该有且只有一个改变的原因。bad case:IPhone类承担了协议管理(Dial、HangUp)、数据传送(Chat)。good case:里式替换原则定义:里氏代换原则(Liskov 
36820 22
设计模式(C++版)
|
存储 编译器 C语言
抽丝剥茧C语言(初阶 下)(下)
抽丝剥茧C语言(初阶 下)
|
机器学习/深度学习 人工智能 自然语言处理
带你简单了解Chatgpt背后的秘密:大语言模型所需要条件(数据算法算力)以及其当前阶段的缺点局限性
带你简单了解Chatgpt背后的秘密:大语言模型所需要条件(数据算法算力)以及其当前阶段的缺点局限性
24905 16
|
机器学习/深度学习 弹性计算 监控
重生之---我测阿里云U1实例(通用算力型)
阿里云产品全线降价的一力作,2023年4月阿里云推出新款通用算力型ECS云服务器Universal实例,该款服务器的真实表现如何?让我先测为敬!
36824 15
重生之---我测阿里云U1实例(通用算力型)
|
SQL 存储 弹性计算
Redis性能高30%,阿里云倚天ECS性能摸底和迁移实践
Redis在倚天ECS环境下与同规格的基于 x86 的 ECS 实例相比,Redis 部署在基于 Yitian 710 的 ECS 上可获得高达 30% 的吞吐量优势。成本方面基于倚天710的G8y实例售价比G7实例低23%,总性价比提高50%;按照相同算法,相对G8a,性价比为1.4倍左右。
|
存储 算法 Java
【分布式技术专题】「分布式技术架构」手把手教你如何开发一个属于自己的限流器RateLimiter功能服务
随着互联网的快速发展,越来越多的应用程序需要处理大量的请求。如果没有限制,这些请求可能会导致应用程序崩溃或变得不可用。因此,限流器是一种非常重要的技术,可以帮助应用程序控制请求的数量和速率,以保持稳定和可靠的运行。
29948 52

热门文章

最新文章