今天,GLM5.3上线了,最值得关注的就一条,在内部自建体感评测中较GLM-5.2提升50%,在包括Terminal Bench 3.0、Agents' Last Exam (CLI)在内的公开基准测试中取得开源第一。
不过老金今天更想说的是Zcode,8月11号,ZCode发了条消息:用户数到一百万,Goal、Subagents、Remote Control、闲时任务四个能力一起上线,同一天下午1点,GLM Coding Plan全体用户的额度重置了。
本来我以为,又是一次常规大更新,直到我这两天试过之后,感觉还是要来说说,Zcode的在我的使用频率中,在逐步提升。
最新的感受是,瓶颈慢慢不在模型够不够聪明了。在成本够不够低,和你敢不敢把整个复杂活交给它自己跑完。
这次更新,动的就是这两件事。
关于重置这件事儿
用户破百万直接重置额度,这事我第一眼就想到了Codex的Tibo。
这哥们已经快把Reset玩成固定节目了。用户涨了发,Bug修了发,新模型上了也发,圈里甚至有人叫他“Reset之神”,包括我在内一帮开发者开玩笑叫他“义父”。
看着是在发福利,其实也是个增长飞轮:额度一发,老用户回来跑重活,结果往社媒一晒,新用户看见真能干活,也跟着进来。
官方还没明确说以后还是不是这样,不过有前车之鉴,如果真这样,想想都很爽了。
缓存命中率
只重置一次额度,花着花着还是会没,真正决定你那份额度能撑多久的,是缓存。
比如你可以看看自己的统计,在我的个人主页上你可以获取个插件来自动统计,比如我今天的就这样,大家也其实都是这样。
做长任务的时候,AI会反反复复读同一堆东西,系统说明、项目文件、前面几轮的上下文,缓存要是命中了,这些重复内容就按更低的积分结算,不用每一轮都付全价。
智谱公布的数据,GLM搭ZCode,Token缓存命中率98.10%。
同一组里,Pi是95.95%,Claude Code是95.30%,OpenCode是95.17%,Cursor是95.02%。
两三个点的差距,放一轮对话里你看不出来,可任务连着跑几十轮,重复上下文越攒越多,这点差距才会一点点反映到积分消耗上。
按智谱的算法,ZCode这套缓存复用,能让GLM Coding Plan的有效Token量提升差不多30%,不是账户里凭空多出Token,是同一份额度处理重复上下文时花得更省,最后能多跑几个活。
哦对了,8月31号之前,在ZCode里用GLM Coding Plan还有1.5倍的限时额度加成,官方有张图把这笔账拆得明明白白,基础额度100%,限时福利+50%,缓存优化再+30%,叠到一起整体使用量到180%。
闲时任务
这是这次的新功能,你把任务交上去,不用定几点开始,ZCode会等到低峰时段自己跑,在闲时任务权益范围内,这部分不扣GLM Coding Plan的积分。
入口在这:
适合那种晚几个小时拿到也不耽误事儿的活,代码库分析、补文档、查测试覆盖、理技术债,或者先跑一轮只读的风险扫描。
我会这么写这种任务:
检查当前项目最近一周的代码变更,只读,不修改文件。 给我以下结果。 1. 可能遗漏的测试 2. 文档和实现对不上的地方 3. 高、中、低三档风险清单 4. 每条结论对应的文件和证据
我自己倒是更喜欢自动化,权限全开,但要注意它可能会删除你的东西,如果你想更稳妥一些,选择变更前确认。
普通定时任务你得指定晚上10点跑,闲时任务不用选时间,等资源空下来执行一次就行。
免积分也有需要注意的,只在闲时任务权益范围内成立,具体几点开工由低峰队列说了算,今晚必须上线的活,别往里塞着干等。
我特别喜欢它带来的这个变化。
以前我会问:这个活值得我花额度让AI做吗?
现在开始变成:反正闲着也是闲着,还有什么一直没空干的活,扔给它呗。
很多事情不是不会做,只是它们永远排不到今天。
Goal和Subagents
钱的问题解决了,接下来才是我以前不敢把大任务整个交给AI的真正原因。
越用AI我越觉得:让它开始干,一点都不难。难的是几个小时以后,它还记得为什么出发,并且知道什么时候才有资格回来告诉你“我干完了”。
晚上下班前,你跟AI说:“剩下的问题都修掉,测试跑完。”第二天打开电脑,它特别自信地告诉你:完成了。果测试是红的,需求漏了一条,还顺手动了一个你根本不想让它碰的模块。
这种事我真遇到太多了。
AI有时候最大的问题不是不会干,而是太容易把“我干了很多”,当成“我干完了”。
Goal就是这样,把做成什么样算结束讲清楚的功能。你先写清楚要什么结果、怎么算验收,ZCode再围着这个目标自己拆任务、改代码、跑命令、执行测试,条件没全满足,它就接着干。
这才是长任务真正难的地方。
我自己开源过一个GoalPro Skill,就是专门干这个的。
本文中我开源过的所有内容,你都可以通过 老金开源 这个合集找到以往的说明。https://mp.weixin.qq.com/mp/appmsgalbum?__biz=MzI0NzU2MDgyNA==&action=getalbum&album_id=4618960466545950723#wechat_redirect
你也可以直接输入,比如这样:
/goal 完成当前版本上线前收尾。 先核对需求文档和当前实现,列出遗漏和风险。 再改掉已经确认的问题,跑相关测试。 只有差异报告完整、测试全过、支付模块没被动过,才算完成。
当你看到这个图标的时候,目标就设定成功了。
我们再来说说老金我更喜欢的Subagent。我的Meta_Kim项目做的真实世界镜像映射就是这样,因为我管理层做了很多年,擅长制定目标,分派任务,以达成并行高效的制作。
目前我还没映射Zcode,不过原理一样,你可以让Zcode自行安装,等我有空时候适配一遍。
ZCode自带两个内置子智能体,拿来就能用,Explore只读,负责搜代码、理调用链、攒证据,General-purpose能动手,改文件、修bug、跑命令,这俩是官方默认配置。
如果你有了多个agent,搞多agent并行协作,我自己有个开源的agent team playbook,就是干这个的,它能直接调用你所有的subAgent来编排好,自动跑他们该跑的事情。
这里还有个容易忽略的好处,搜索调研的活,要塞进独立上下文,主对话就不用被一堆搜索过程撑爆,注意力能留给目标、关键判断和最后验收。
总结一下:多Agent特别重要的价值,是把脏活拿出去,让真正稀缺的主上下文留给目标、判断和验收。
这其实跟真实公司越来越像。
老板不需要知道员工为了一个结论翻了多少文件,他真正需要的是:查明白了吗?证据在哪?接下来怎么办?
Remote Control管的是你离开电脑之后,有两种用法,临时用就扫个码连上,长期用可以连到微信或飞书,电脑开着,手机随时能盯进度、补指令、建任务。代码还在原来的本地、SSH、WSL或Docker里跑,不挪窝。
这部分我7月底完整写过一篇说明的文章,不明白去看那篇,直接搜Zcode就行。
关于Harness的2.39%
ZCode管自己叫"GLM最佳Harness"。
Harness说白了,就是模型外面那套执行系统,管怎么读项目、怎么存上下文、怎么调工具、怎么拆任务、怎么复用缓存、怎么跑测试,最后拿什么证据判定活干完了,模型一样,外面这套系统不一样,结果就可能不一样。
GLM-5.2搭ZCode(5.3是在这个报告之后,今天刚出的),任务整体通过率比搭Claude Code高2.39%,但单个检查项通过率反而低1.22%。
这两个数字放一起,我反而觉得比“全面领先”更有意思。
它想证明的不是每一步都比别人聪明,而是几十步连续跑下来,更容易把整个活收回来。
任务整体通过率,要求一项任务里所有条件全满足,检查项通过率,是每条要求分开算,ZCode完成了更多从头到尾全部通过的整任务,但在单个细分检查上没全面领先。
我的判断是,ZCode这次想证明的优势,集中在收尾。
一个任务要动一堆文件,中间跑命令、补测试、查结果,单步做对不难,难的是这些步骤连着跑下来,最后所有验收条件同时满足。
这特别像真实工作。
一个员工每天特别忙,做了几十件事,不代表最后能交东西。
真正值钱的是:事情闭环了吗?
一个真实任务可能要动十几个文件,中间查资料、改代码、跑命令、补测试。单独把某一步做对,已经不是今天AI最难的事了。
难的是几十步以后,它还记得自己为什么出发,最后所有验收条件还能同时满足。
和Claude Code、Codex比
先说清楚一件事,这组2.39%,是同一个GLM-5.2分别放进ZCode和Claude Code跑出来的。
模型没换,只换了外面那层Harness。
这其实是最好看的一组对比,因为它把模型这个变量摁住了,只比谁把GLM用得更透。
三家底子不一样,Claude Code绑死Claude,Codex绑死GPT,模型和工具焊在一起卖,ZCode是专门给GLM做的Harness,它要证明的是同一个GLM放进它这里,能多干多少活。
真正的选择,不是谁更强,是你跑哪个模型、团队已经沉淀在哪套工具上。
你跑GLM,ZCode现在能给你最高的缓存命中率和最划算的额度。
你团队已经在Claude Code里配好了一堆子智能体和Skills,那套东西是你的资产,别为几个额度搬家。
你靠Codex的云端沙箱跑大批量并行任务,那套队列是它的看家本领,ZCode现在还替代不了。
Codex没参加这组Bench,所以三家没法塞进同一张排名表硬比。
一句话,这次ZCode没想着通杀,它就想当你用GLM时的首选入口。
写在最后
这次我第一次开始认真考虑:有些活,我是不是可以真的不亲自做了?
过去我们用AI,本质上还是人在干活。
你提问,它回答,你看结果,你让它继续,它卡住,你再推一把。
AI干了很多,但那个从头到尾不能离开的人,还是你。
现在,这个关系开始变了。
以前是AI在我的工作流里,以后,可能是我只需要出现在AI工作流最关键的几个地方。
那接下来真正的问题就来了。
如果查资料可以交出去,代码可以交出去,测试可以交出去,连“继续干,直到满足条件”都可以交出去。
那人到底还应该抓住什么?
我想了半天,可能就两件事。
决定做什么,以及决定什么叫做好。前一个是方向。后一个是标准。
中间那些越来越长、越来越累、越来越消耗时间的执行过程,反而可能是最先被AI接过去的部分。
这让我突然觉得,未来真正拉开人与人差距的,可能不是谁干活更快,甚至不是谁更会用AI。
而是当执行越来越便宜以后,你有没有值得执行的目标。你有没有能力定义一个足够好的结果。
AI越能自己干活,人越不能外包的,是判断。
以前我们怕AI把人的工作拿走。现在我开始觉得,它可能先拿走的,是那些让人没空思考的工作。然后把一个更难的问题,重新扔回给你:
活我可以替你干。
但你到底想干成什么?
飞书开源知识库(实时更新 交流群):
https://tffyvtlai4.feishu.cn/wiki/OhQ8wqntFihcI1kWVDlcNdpznFf