ZCode大更新!GLM最佳Harness隆重登场!

简介: 今日GLM-5.3正式发布:编程能力跃升,内部体感评测较5.2提升50%,TerminalBench3.0、Agents' Last Exam(CLI)等开源基准登顶第一。同期ZCode上线Goal/Subagents/闲时任务等重磅功能,以98.1%缓存命中率与智能Harness大幅提效,推动AI从“辅助执行”迈向“自主闭环”。

今天,GLM5.3上线了,最值得关注的就一条,在内部自建体感评测中较GLM-5.2提升50%,在包括Terminal Bench 3.0、Agents' Last Exam (CLI)在内的公开基准测试中取得开源第一。


不过老金今天更想说的是Zcode,8月11号,ZCode发了条消息:用户数到一百万,Goal、Subagents、Remote Control、闲时任务四个能力一起上线,同一天下午1点,GLM Coding Plan全体用户的额度重置了。


本来我以为,又是一次常规大更新,直到我这两天试过之后,感觉还是要来说说,Zcode的在我的使用频率中,在逐步提升。



最新的感受是,瓶颈慢慢不在模型够不够聪明了。在成本够不够低,和你敢不敢把整个复杂活交给它自己跑完。


这次更新,动的就是这两件事。


关于重置这件事儿

用户破百万直接重置额度,这事我第一眼就想到了Codex的Tibo。


这哥们已经快把Reset玩成固定节目了。用户涨了发,Bug修了发,新模型上了也发,圈里甚至有人叫他“Reset之神”,包括我在内一帮开发者开玩笑叫他“义父”。



看着是在发福利,其实也是个增长飞轮:额度一发,老用户回来跑重活,结果往社媒一晒,新用户看见真能干活,也跟着进来。


官方还没明确说以后还是不是这样,不过有前车之鉴,如果真这样,想想都很爽了。


缓存命中率

只重置一次额度,花着花着还是会没,真正决定你那份额度能撑多久的,是缓存。


比如你可以看看自己的统计,在我的个人主页上你可以获取个插件来自动统计,比如我今天的就这样,大家也其实都是这样。



做长任务的时候,AI会反反复复读同一堆东西,系统说明、项目文件、前面几轮的上下文,缓存要是命中了,这些重复内容就按更低的积分结算,不用每一轮都付全价。


智谱公布的数据,GLM搭ZCode,Token缓存命中率98.10%。


同一组里,Pi是95.95%,Claude Code是95.30%,OpenCode是95.17%,Cursor是95.02%。



两三个点的差距,放一轮对话里你看不出来,可任务连着跑几十轮,重复上下文越攒越多,这点差距才会一点点反映到积分消耗上。


按智谱的算法,ZCode这套缓存复用,能让GLM Coding Plan的有效Token量提升差不多30%,不是账户里凭空多出Token,是同一份额度处理重复上下文时花得更省,最后能多跑几个活。


哦对了,8月31号之前,在ZCode里用GLM Coding Plan还有1.5倍的限时额度加成,官方有张图把这笔账拆得明明白白,基础额度100%,限时福利+50%,缓存优化再+30%,叠到一起整体使用量到180%。



闲时任务

这是这次的新功能,你把任务交上去,不用定几点开始,ZCode会等到低峰时段自己跑,在闲时任务权益范围内,这部分不扣GLM Coding Plan的积分。


入口在这:


适合那种晚几个小时拿到也不耽误事儿的活,代码库分析、补文档、查测试覆盖、理技术债,或者先跑一轮只读的风险扫描。


我会这么写这种任务:

检查当前项目最近一周的代码变更,只读,不修改文件。
给我以下结果。
1. 可能遗漏的测试
2. 文档和实现对不上的地方
3. 高、中、低三档风险清单
4. 每条结论对应的文件和证据


我自己倒是更喜欢自动化,权限全开,但要注意它可能会删除你的东西,如果你想更稳妥一些,选择变更前确认。


普通定时任务你得指定晚上10点跑,闲时任务不用选时间,等资源空下来执行一次就行。


免积分也有需要注意的,只在闲时任务权益范围内成立,具体几点开工由低峰队列说了算,今晚必须上线的活,别往里塞着干等。


我特别喜欢它带来的这个变化。


以前我会问:这个活值得我花额度让AI做吗?


现在开始变成:反正闲着也是闲着,还有什么一直没空干的活,扔给它呗。


很多事情不是不会做,只是它们永远排不到今天。


Goal和Subagents

钱的问题解决了,接下来才是我以前不敢把大任务整个交给AI的真正原因。


越用AI我越觉得:让它开始干,一点都不难。难的是几个小时以后,它还记得为什么出发,并且知道什么时候才有资格回来告诉你“我干完了”。


晚上下班前,你跟AI说:“剩下的问题都修掉,测试跑完。”第二天打开电脑,它特别自信地告诉你:完成了。果测试是红的,需求漏了一条,还顺手动了一个你根本不想让它碰的模块。


这种事我真遇到太多了。


AI有时候最大的问题不是不会干,而是太容易把“我干了很多”,当成“我干完了”。


Goal就是这样,把做成什么样算结束讲清楚的功能。你先写清楚要什么结果、怎么算验收,ZCode再围着这个目标自己拆任务、改代码、跑命令、执行测试,条件没全满足,它就接着干。


这才是长任务真正难的地方。


我自己开源过一个GoalPro Skill,就是专门干这个的。


本文中我开源过的所有内容,你都可以通过 老金开源 这个合集找到以往的说明。https://mp.weixin.qq.com/mp/appmsgalbum?__biz=MzI0NzU2MDgyNA==&action=getalbum&album_id=4618960466545950723#wechat_redirect



你也可以直接输入,比如这样:

/goal 完成当前版本上线前收尾。
先核对需求文档和当前实现,列出遗漏和风险。
再改掉已经确认的问题,跑相关测试。
只有差异报告完整、测试全过、支付模块没被动过,才算完成。


当你看到这个图标的时候,目标就设定成功了。


我们再来说说老金我更喜欢的Subagent。我的Meta_Kim项目做的真实世界镜像映射就是这样,因为我管理层做了很多年,擅长制定目标,分派任务,以达成并行高效的制作


目前我还没映射Zcode,不过原理一样,你可以让Zcode自行安装,等我有空时候适配一遍。



ZCode自带两个内置子智能体,拿来就能用,Explore只读,负责搜代码、理调用链、攒证据,General-purpose能动手,改文件、修bug、跑命令,这俩是官方默认配置。



如果你有了多个agent,搞多agent并行协作,我自己有个开源的agent team playbook,就是干这个的,它能直接调用你所有的subAgent来编排好,自动跑他们该跑的事情。



这里还有个容易忽略的好处,搜索调研的活,要塞进独立上下文,主对话就不用被一堆搜索过程撑爆,注意力能留给目标、关键判断和最后验收。


总结一下:多Agent特别重要的价值,是把脏活拿出去,让真正稀缺的主上下文留给目标、判断和验收。


这其实跟真实公司越来越像。


老板不需要知道员工为了一个结论翻了多少文件,他真正需要的是:查明白了吗?证据在哪?接下来怎么办?


Remote Control管的是你离开电脑之后,有两种用法,临时用就扫个码连上,长期用可以连到微信或飞书,电脑开着,手机随时能盯进度、补指令、建任务。代码还在原来的本地、SSH、WSL或Docker里跑,不挪窝。


这部分我7月底完整写过一篇说明的文章,不明白去看那篇,直接搜Zcode就行。



关于Harness的2.39%

ZCode管自己叫"GLM最佳Harness"。


Harness说白了,就是模型外面那套执行系统,管怎么读项目、怎么存上下文、怎么调工具、怎么拆任务、怎么复用缓存、怎么跑测试,最后拿什么证据判定活干完了,模型一样,外面这套系统不一样,结果就可能不一样。


GLM-5.2搭ZCode(5.3是在这个报告之后,今天刚出的),任务整体通过率比搭Claude Code高2.39%,但单个检查项通过率反而低1.22%。


这两个数字放一起,我反而觉得比“全面领先”更有意思。


它想证明的不是每一步都比别人聪明,而是几十步连续跑下来,更容易把整个活收回来。



任务整体通过率,要求一项任务里所有条件全满足,检查项通过率,是每条要求分开算,ZCode完成了更多从头到尾全部通过的整任务,但在单个细分检查上没全面领先。


我的判断是,ZCode这次想证明的优势,集中在收尾。


一个任务要动一堆文件,中间跑命令、补测试、查结果,单步做对不难,难的是这些步骤连着跑下来,最后所有验收条件同时满足。


这特别像真实工作。


一个员工每天特别忙,做了几十件事,不代表最后能交东西。


真正值钱的是:事情闭环了吗?


一个真实任务可能要动十几个文件,中间查资料、改代码、跑命令、补测试。单独把某一步做对,已经不是今天AI最难的事了。


难的是几十步以后,它还记得自己为什么出发,最后所有验收条件还能同时满足。


和Claude Code、Codex比

先说清楚一件事,这组2.39%,是同一个GLM-5.2分别放进ZCode和Claude Code跑出来的。


模型没换,只换了外面那层Harness。


这其实是最好看的一组对比,因为它把模型这个变量摁住了,只比谁把GLM用得更透。


三家底子不一样,Claude Code绑死Claude,Codex绑死GPT,模型和工具焊在一起卖,ZCode是专门给GLM做的Harness,它要证明的是同一个GLM放进它这里,能多干多少活。


真正的选择,不是谁更强,是你跑哪个模型、团队已经沉淀在哪套工具上。


你跑GLM,ZCode现在能给你最高的缓存命中率和最划算的额度。


你团队已经在Claude Code里配好了一堆子智能体和Skills,那套东西是你的资产,别为几个额度搬家。


你靠Codex的云端沙箱跑大批量并行任务,那套队列是它的看家本领,ZCode现在还替代不了。


Codex没参加这组Bench,所以三家没法塞进同一张排名表硬比。


一句话,这次ZCode没想着通杀,它就想当你用GLM时的首选入口。


写在最后

这次我第一次开始认真考虑:有些活,我是不是可以真的不亲自做了?


过去我们用AI,本质上还是人在干活。


你提问,它回答,你看结果,你让它继续,它卡住,你再推一把。


AI干了很多,但那个从头到尾不能离开的人,还是你。


现在,这个关系开始变了。


以前是AI在我的工作流里,以后,可能是我只需要出现在AI工作流最关键的几个地方。


那接下来真正的问题就来了。


如果查资料可以交出去,代码可以交出去,测试可以交出去,连“继续干,直到满足条件”都可以交出去。


那人到底还应该抓住什么?


我想了半天,可能就两件事。


决定做什么,以及决定什么叫做好。前一个是方向。后一个是标准。


中间那些越来越长、越来越累、越来越消耗时间的执行过程,反而可能是最先被AI接过去的部分。


这让我突然觉得,未来真正拉开人与人差距的,可能不是谁干活更快,甚至不是谁更会用AI。


而是当执行越来越便宜以后,你有没有值得执行的目标。你有没有能力定义一个足够好的结果。


AI越能自己干活,人越不能外包的,是判断。


以前我们怕AI把人的工作拿走。现在我开始觉得,它可能先拿走的,是那些让人没空思考的工作。然后把一个更难的问题,重新扔回给你:


活我可以替你干。


但你到底想干成什么?


飞书开源知识库(实时更新 交流群):

https://tffyvtlai4.feishu.cn/wiki/OhQ8wqntFihcI1kWVDlcNdpznFf

相关文章
|
3天前
|
人工智能 监控 安全
GPT-6发布15小时:Altman道歉赔额度,有人已经把活交给它
从GPT6这个模型怎么样,到案例怎么样,本文一点点的给你嚼碎了告你。
|
25天前
|
机器学习/深度学习 人工智能 缓存
Grok 4.6:追平 GPT-5.6 Sol 的半价旗舰,但别只看跑分
Grok 4.6是xAI于2026年8月发布的1.5万亿参数大模型,专注长程智能体任务,AI指数61分追平GPT-5.6 Sol;回合效率领先(仅需53步),定价$2/$6(百万Token),但超20万Token即翻倍。
|
21天前
|
人工智能 安全 API
DeepSeek V4 Pro暴涨近50分,我却更想押GLM-5.3
DeepSeek V4 Pro正式版和GLM-5.3前后脚上线。一个把Agent成绩拉得像换了一代模型,一个连基座都没换,只靠后训练继续往前拱。老金来给你详细说说。
|
18天前
|
人工智能 缓存 前端开发
智谱GLM-5.3+ZCode Agent,真实项目第一手实测!
智谱推出ZCode智能体开发环境,与旗舰模型GLM-5.3深度协同,实现“原生模型+原生Agent”高效配合。实测显示,ZCode提升任务通过率2.39%,缓存命中率超98%,显著降本增效。零配置、多平台、支持SSH/Docker,真实项目重构验证其开箱即用与工程落地能力。
723 0
智谱GLM-5.3+ZCode Agent,真实项目第一手实测!
|
25天前
|
人工智能 自然语言处理 搜索推荐
AI的下一个十年:从能力竞赛到价值重构
本文深度剖析生成式AI爆发后的三大变革:技术从“大参数”迈向多模态融合与智能体落地;产品从“回答问题”升级为“解决问题”的工作流重构;生态上GEO(生成式引擎优化)正成为AI时代新基础设施。兼顾趋势洞察与务实行动建议,助你锚定未来5-10年发展坐标。(239字)
106 4
|
22天前
|
人工智能 缓存 安全
通义千问Qwen3.8‑Max深度功能解读:原生多模态、Agent实战与API调用教程
大模型产业已经从简单问答时代迈入复杂任务自主执行的新阶段,行业不再只追求单次对话的流畅度,更加看重模型处理长链路任务、自主规划纠错、工程级代码交付、多模态深度解析以及专业领域复杂推理的综合实力。Qwen3.8‑Max作为千问系列的旗舰基座模型,采用稀疏混合专家MoE架构,总参数量达到2.4万亿,单Token激活参数约95B,兼顾超高能力上限与实际推理效率,把长周期智能体执行、百万级超长上下文、原生多模态理解、工程级自主编码、专业领域深度推理等能力整合在同一基座当中,面向软件研发团队、科研机构、企业业务系统开发者、AI应用服务商提供底层能力支撑。在众多权威第三方评测榜单当中,该模型取得十分亮眼的
657 1
|
2月前
|
人工智能 缓存 安全
Claude Code 封号真实原因曝光,这次彻底不装了,直接针对国内开发者的账号下手?
Claude Code 封号潮背后:逆向扒出客户端隐写区域标记,Anthropic 政策收紧叠加 DeepSeek 7 月涨价,国产替代更紧迫。
1706 2
|
8月前
|
人工智能 运维 前端开发
Claude Code 30k+ star官方插件,小白也能写专业级代码
Superpowers是Claude Code官方插件,由核心开发者Jesse打造,上线3个月获3万star。它集成brainstorming、TDD、系统化调试等专业开发流程,让AI写代码更规范高效。开源免费,安装简单,实测显著提升开发质量与效率,值得开发者尝试。
13452 5
|
存储 人工智能 安全
阿里云无影云电脑入口及全面测评:技术特性、场景适配与综合体验解析
在终端云计算快速发展的当下,阿里云无影云电脑凭借自主技术架构与多场景适配能力,成为企业数字化办公与个人高效计算的重要选择。本文基于 今年最新产品动态与权威认证信息,从官方入口与版本差异、核心技术特性、性能表现、场景适配、安全能力等维度展开测评,为用户提供客观参考。

热门文章

最新文章