翻了4万多次请求,我为什么更愿意开xhigh

简介: 翻完自己的Astra记录,我还是更愿意先开xhigh。

Image
老金我最近用Codex里的GPT-6 Astra做事,会直接开xhigh。

原因是这样,我拿我跑的4万多次做了回测。

数据显示6的Xhigh实测Token消耗对比起来要少,它会走几次弯路,事情更容易做完,在5.6上并不明显,但是在6上尤为明显。

这和很多人的直觉相反。推理档位越高,模型想得越多,怎么还会省?

我也想把这事儿弄明白,于是翻了自己9月的记录,找出40,125次有明确档位和Token明细的请求。

里面有个反差:xhigh平均用来思考的Token,是medium的约2.6倍,平均总Token却低了约8.6%。

第一次看到结果的时候,我开始更在意,每次多想的那一点,究竟能不能换来后面少折腾几轮。

先看看统计的数字,medium平均每次用了69.8个推理Token、141,247个总Token。xhigh对应的是182.5和129,146。

这是原始数据拉出来的表格。
Image
看红字,思考的部分变多了,总量却没跟着变多,这里的总量包含输入和输出。

但这共计40125次调用来自不同任务,也包含子代理。它们是我的实际使用记录,并不是四万多道题分别交给六个档位重做一遍。
Image
所以,这批数据能提醒我思考更多,不等于总Token更多。

不过High和Xhigh的话,体感上差不多,所以我选了推理更厉害点的Xhigh,原因就是下面这个,我想少一轮返工,这样更能节省时间。

最近推进我的俩小项目,量化应用和多媒体发布助手时,我最不愿意看到的,是翻来覆去的检查同一件事。

9月12日,我在对话里直接说过:
我发现多媒体在测相同的东西 测了好几遍了

每次我都要重新交代,它重新读文件、改代码、跑检查,已经走过的路再走一遍。

我发现模型多次处理任务说明、历史对话、代码和工具结果。

xhigh是它更容易先把问题和已有进展理清,再往下做。背后的机制是多花一点思考,换掉后面几轮返工,总投入就有机会下降。

老金给你画个图,让你理解起来容易点儿。
Image
一个看着很小的改动,也可能牵着前面的状态、约束和几轮历史修改。

对我来说,值得比较的是同一件事做到验收时,究竟花了多少。

ARC Prize公布的Astra结果,提供了一组更直接的对照。在ARC-AGI-3的Standard harness下,high得分54.8%,整套评测费用40,705美元。xhigh得分59.3%,费用37,317美元。

得分提高4.5个百分点,费用反而降低约8.3%。

ARC Prize解释,更高的推理投入让模型用更少动作完成任务,减少了模型调用和总Token。它测的是陌生交互环境,不能直接当成我的软件项目结果。
Image
同一组结果里,max得分62.7%,费用26,098美元,表现还更好,这里和我的Max体感差不多,我不选它原因是不知道它怎么推理的。。。做的是快是好,但是缓存命中低,导致费用咣咣消耗。

所以我更愿意试xhigh,也更明确自己该盯什么:多出来的思考,有没有让后面的动作变少、结果更完整。

OpenAI的文档还说明过,推理Token计入输出,屏幕上只看到几句回复,不代表只消耗了那几句话。

算总账的时候,输入加输出才是总Token。
Image
如果一个任务跨了几轮、换过档位、调用了子代理,就把这些调用一起算进去。

只看最后成功的一轮,会漏掉真正贵的部分。

所以现在我乐意开xhigh。它的价值要落在少返工、能完成上。

第一次多想一会儿,我可以接受,一直在回复,事情却还停在昨天,我就得重新检查它的路线。

不过这也不意味着低档位做不好事,在我的记录里,low档位处理过一些有用的小问题。

对,你要注意这个小字,它代表的是简单,比如单文件修改,或者一个文章的修改等等,一旦涉及跨文件,跨项目,多工具使用等等,它就不够看了。

如果你也遇到同一件事反复来回,可以先选一个正在返工的任务,在下一轮把完成标准和现有记录一起交给它。下面这段是我会用的接续要求:

先核对这次任务的完成标准。列出已经完成且有证据的部分、仍未解决的问题,以及最近一轮新增的证据。已通过且未受本次改动影响的部分,复用现有结果。同一种失败反复出现时,先检查原来的判断,再说明下一步验证能排除什么原因。接着完成剩余工作,最后更新原有任务记录,让下一轮能直接接着做。

这段要求要配上真实文件、日志或已有验证结果。

它应该产出能追溯的进展记录,并继续处理剩下的缺口。
Image

写在最后

翻这四万多次请求,最初是想算清楚Token,看看为什么6消耗这么高,找个低消耗。

翻到后来,我反而更在意,自己在这些请求之间,被叫回来了多少次。

它重新读上下文,我也得跟着重新想一遍,这个项目做到哪儿了,上次为什么这么改,哪些地方已经确认过。好不容易把这些事装回脑子,刚才手头的另一件事又断了。

它重跑的是任务,我重新搭进去的是注意力。

这部分消耗,用量页面里看不到。可实际做事的人都知道,同一个问题回来找你第三遍的时候,光是重新打开那个窗口,就已经有点累了。

所以,我愿意让它在前面多想一会儿。比起立刻开始干活,我更在意这轮结束以后,能不能真的把一段工作放下。

再往下想,AI能同时干的活儿越来越多,我也很容易顺手再开几个任务。做产品的窗口、写文章的窗口、改课程的窗口,一排铺开,确实挺有生产力的样子。

可省下来的时间,要是全用来盯着更多窗口,我大概只是给自己换了一个更忙的工位。

能多做几件事很好,做完之后,能少惦记几件事,也很重要。

该我做的判断,我来做,已经交代清楚的那部分,我希望它能接着继续推进。

下一次任务跑起来,我想放心离开屏幕一会儿。

至于那一会儿拿来干什么,到时候再说。


谢谢你读我的文章。
如果觉得不错,随手点个赞、在看、转发三连吧🙂
如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章。

开源知识库地址(实时更新交流群):
https://tffyvtlai4.feishu.cn/wiki/OhQ8wqntFihcI1kWVDlcNdpznFf

相关文章
|
5天前
|
人工智能 JSON API
全网刷屏的 Jev 模型正式开放!一手实战测评 + 保姆级教程
全网爆火的 Jev 模型是什么?有什么用?怎么使用?怎么接入 AI 编程工具?效果真的好么?傻子可懂的 Jev 保姆级实战教程 + 项目实战测评来啦
5902 8
|
3天前
|
人工智能 测试技术 API
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
Jev是TypeSafe AI推出的“系统一模型”,不生成文本,专做毫秒级结构化决策:Choice(多选)、Score(打分)、Noul(是非概率)。响应快193倍、成本低444倍,适合工单路由、内容审核、测试定级等高频判断场景。
1066 2
最近全网爆火的 Jev 到底是什么?适合干什么、怎么用,一篇讲透!
|
17天前
|
人工智能 自然语言处理 安全
阿里云千问办公 QwenWork详细介绍:产品核心能力、典型场景、价格及常见问题解答
千问办公是阿里云推出的一站式AI办公平台,主打"不止于对话,更注重交付",依托通义千问旗舰大模型,用户一句话即可完成数据分析、PPT生成、视频剪辑等复杂任务,直接输出可用成果。产品深度打通钉钉生态与企业OA,覆盖桌面端、网页端,提供企业标准版198元/人/月等多档订阅方案,新用户注册即赠2000积分,适配工程师、HR、财务等多职业办公场景,成为能动手干活的"全能AI同事"。
3258 10
|
3天前
|
人工智能 并行计算 PyTorch
秋叶 ComfyUI 2026 整合包 v3.2 完整部署教程:Python 3.13 + Torch 2.13 全栈升级
秋叶aaaki ComfyUI 2026年8月整合包v3.2正式发布!全面升级Python 3.13.11、PyTorch 2.13.0+cu130及ComfyUI v0.30.2,原生支持MiniMax H3、Wan 2.2、Qwen-Image-2.1等2026主流音视频/图像模型,解压即用,无需环境配置。
507 2
|
16天前
|
IDE 开发工具
Qoder 上线 Sonus 模型,Computer Use 能力全面增强
Qoder国际版上线全新内置大模型Sonus(/ˈsoʊnəs/),全球领先,专精超长任务执行与电脑操作(Computer Use)。配合Qoder桌面端0.2.3版本,可自主完成编程、金融建模、科研及表格制作等复杂工作。现全面支持Qoder全系产品,效率提升3.2倍。
1826 8
Qoder 上线 Sonus 模型,Computer Use 能力全面增强
|
11天前
|
缓存 IDE Java
【保姆级】Android Studio下载、安装和汉化教程(2026最新)
Android Studio 是 Google 官方推出的免费 Android 应用开发集成环境,基于 IntelliJ IDEA,内置模拟器、调试器、性能分析及 Compose 界面工具,功能全面,文档丰富,是安卓开发首选工具。(239字)
1240 1

热门文章

最新文章