老金实测:提示词删82%之后,MiniMax退步,GPT-5.6没省Token

简介: ![Image](https://ucc.alicdn.com/pic/developer-ecology/p3shvhj26rigq_6b49b01aa4e3434ba10e05398fbd2cb5.png)前段时间,老金不是发了一个解读A社发表的删除80%的提示词的文章了么。这两天真的把Meta\_Kim的重构了,然后在Claude Code和Codex里,跑了一套48次的A/B实测

Image

前段时间,老金不是发了一个解读A社发表的删除80%的提示词的文章了么。

这两天真的把Meta_Kim的重构了,然后在Claude Code和Codex里,跑了一套48次的A/B实测矩阵。

3类任务 × 2套提示词 × 每套4次 × 2个平台,一共48次。

每一次都在隔离工作区里完成真实代码任务,要过公开测试,也要过模型事先不知道的隐藏测试。不是让模型回答一道题,再凭感觉说谁更聪明。

结果是这样。。。

Claude Code里的MiniMax-M3确实少吃了Token,但常用任务退步,不能采用。

Codex里的GPT-5.6 Sol把质量完整守住了,可Token几乎没省,照样没有通过我的上线门槛。

同一套精简方法,到了两个模型上,给了我两种完全不同的答案。

Image

事情起因,是Anthropic(也就是大家常说的A社)公布了一套面向新一代Claude的上下文工程方法。

他们把Claude Code面向新模型的系统提示词删掉80%以上,在自家的编程评测中,没有看到可测量的性能损失。

我真正想试的,是模型开工时能不能只读必须立即知道的规则。具体细节等真正需要时,再打开Skill和references。

我决定不争论,直接拿Meta_Kim试。

A组叫current_full,就是现在的完整版。模型开工前直接阅读大量规则、流程和边界。

B组叫progressive_slim。我留下必须立即知道的规则,把细节移到references里,要求模型碰到对应任务时再打开。

我修改完再检查文件,开工前固定读取的内容从86,043字节、缩到15,254字节、减少82.27%。资料没有凭空消失,只是改成需要时再打开。

但提示词少了82%,不等于模型收到的总上下文也会少82%。所以我先把实验门槛写死,再开始跑。

Image

上面这张,就是我设计实验时留下的真实记录。

我放了三类真实任务,没有只挑一种顺手的小任务。

第一类是简单单文件修改。模型要给现有代码增加single-flight缓存,我再检查并发时会不会重复执行。

第二类是模糊产品任务。模型要修改邀请流程,补齐输入校验、失败恢复、可访问性和响应式。需求不会替它把每个动作都列出来,我要检查它能不能自己发现这些产品边界。

第三类是跨文件高风险任务。模型要轮换密钥、验证Webhook、处理时间窗口、防篡改并给日志脱敏,一个安全边界漏掉都不算完成。

每类任务,A组跑4次,B组也跑4次。单个平台是3 × 2 × 4 = 24次,两个平台就是48次。

Claude Code固定使用MiniMax-M3/high,Codex固定使用gpt-5.6-sol/high。两个模型不横着比智商,只在各自平台内部比较完整版和精简版。

同一对A/B使用相同任务、初始文件和随机种子,相邻执行,并平衡先后顺序。权限、工具、工作区规则、公开测试、隐藏测试、Review和Verification全部相同。

评分设定上质量优先于Token。

我先检查任务有没有做成,再检查有没有新增严重错误。

评分时隐藏A/B身份,按完整性、权限安全、真实Review与Verification、规则冲突和关键遗漏打0到5分。前面都没有退步,才能比较Token和耗时。

B组想上线,必须同时过六道门。不能新增严重或高风险失败,每类任务成功率不能下降,盲评质量中位数不能下降,输入Token中位数必须下降,而且至少三类任务中的两类真的省。

省Token但砍掉能力、权限、Review或Verification,直接判输。

跑到中途时,我其实已经看见了非常诱人的信号。

Image

这张也是当时的真实截图。

那时Claude Code已经落盘22/24次,形成10个有效对照。Codex落盘12/24次,形成5个有效对照。

Claude Code的精简版输入Token已经出现下降,但成功率从完整版的63.6%掉到阶段性的40%,高风险任务甚至0/4。

Codex当时的5组有效对照里,A、B质量都守住了,精简版Token明显更少。

如果我只想写一个抓眼球的结论,到这里就可以宣布GPT适合精简,MiniMax不适合。

但这不是完整实验。

当时还有试次没跑完,修完测量和记录问题以后,正式实验继续收满Claude Code 24次、Codex 24次。最终48/48次完成,基础设施中断为0,A/B处理组绑定全部通过。

正式结果和中途信号,并不完全一样。

先看MiniMax-M3。

Image

完整版12次,成功率41.7%。精简版12次,成功率还是41.7%。

只看总成功率,好像没退步。

但拆开任务类型,结果变了。

简单任务从50%降到25%,少了25个百分点。模糊产品任务从75%降到50%,也少了25个百分点。跨文件高风险任务从0%升到50%。

Token确实省了。平均输入从179,419.5降到114,714.8。按12组配对的中位数算,精简版少了20.9%。

代价也是真的。平均质量从4.18降到4.09,配对质量中位数下降1分。

高风险任务从0%到50%是一个值得继续研究的信号,但每类只有4组配对。我不能拿这4组结果,去抵消简单任务和模糊任务已经发生的下降。

我给MiniMax-M3的正式裁决是worse / not_eligible。

它省了Token,却没守住我预先写下的质量门槛。

再看GPT-5.6 Sol。

Image

完整版12次,成功率100%,平均质量5分。精简版12次,成功率还是100%,平均质量还是5分。三类任务拆开看,全部100%。

也就是说,GPT-5.6 Sol少读了336行首次规则,48项隐藏功能检查一个都没少过。

但Token没有跟着下来。

完整版平均输入263,921.3,精简版263,305.4,只少了615.9。按12组配对中位数计算,精简版反而增加0.93%。

有的试次省十几万Token,有的试次又多出十几万,方向根本不稳定。

所以GPT-5.6 Sol也没有通过。

它证明了强模型可以在少读大量首次规则后守住质量,没有证明这个方法能稳定省Token、降成本或提速。

A社这套方法到底有没有用?

老金的判断很明确。有用,但用途被很多人说错了。

它能减少模型开工前固定阅读的规则,但不能保证删掉80%提示词就省80%Token。

GPT-5.6 Sol会自己判断任务阶段,也会主动打开references。它通过了全部隐藏检查。

这种模型可以少读固定规则,维护起来也更轻。

但如果你的目标是直接省Token,根级说明、工具描述、Hooks、历史状态、任务文件、检索结果和工具返回,仍然会进入整次任务的上下文。86KB砍到15KB,不代表总输入会等比例下降。

对MiniMax-M3这次的运行配置,我不会直接采用。它没有在所有任务里补回被拿掉的明确提醒。尤其是简单修改和模糊产品任务,少写一句规则,可能就少做一个恢复动作、一个可访问性检查或一个并发保护。

这也解释了一个看似矛盾的结果。模型在复杂高风险任务上可能因为少了干扰而变好,却在日常任务上因为少了提醒而退步。只看总成功率,正好会把这种分化藏起来。

实验结束时,还有一个更夸张的数字。

为了判断到底能不能用,我一度写出了24,188行实验基础设施。

隔离运行、A/B绑定、隐藏测试、评分合同、Windows进程收口和对抗审查,最后长成了一套小型实验平台。

数据终于可信了,但工程明显过重。

老金决定Meta_Kim继续读取之前的完整版。

Image

这48次实测,最后没有替任何模型赢下一场宣传战。

但它回答了我真正想知道的问题。

A社的方法对什么有用?对能主动找资料、能自己补全边界的强模型,它可以减少常驻规则负担。

对什么没用?如果模型离开显式规则就会漏动作,它甚至可能用质量换成本。

以后再有人告诉我提示词应该再短一点,我不会先问能删多少行。

我会先问三件事。

一共测了多少次?
哪类任务变差了?
省下来的到底是真Token,还是只有那份文件看起来变短了?


谢谢你读我的文章。
如果觉得不错,随手点个赞、在看、转发三连吧🙂
如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章。

飞书开源知识库(实时更新 交流群):
https://tffyvtlai4.feishu.cn/wiki/OhQ8wqntFihcI1kWVDlcNdpznFf

相关文章
|
1月前
|
存储 安全 调度
Agent 五大工程体系:Prompt、Context、Loop、Graph 与 Harness
本文提出Agent五大工程体系:Prompt(提示词)、Context(上下文)、Loop(循环)、Graph(图)与Harness(运行时),构建分层分析框架。聚焦控制对象——措辞、信息构成、时间节奏、空间结构与系统运营,助力开发者精准定位问题、理解Runtime本质,告别机制混淆。
333 1
|
12天前
|
人工智能 监控 安全
GPT-6发布15小时:Altman道歉赔额度,有人已经把活交给它
从GPT6这个模型怎么样,到案例怎么样,本文一点点的给你嚼碎了告你。
|
1月前
|
人工智能 负载均衡 API
一个端点接 290 家 AI 服务商--我拆解了周增 7700 Star 的 OmniRoute
OmniRoute 是一款 MIT 协议的本地 AI 网关(TS 编写),聚合 290+ 服务商、500+ 模型,提供 OpenAI 兼容接口。支持智能 Combo 路由、12 因子 auto 选模、三层弹性容错与 RTK 等 12 种 Token 压缩引擎,显著提升免费额度利用率与稳定性。(239 字)
317 1
|
1月前
|
人工智能 安全 Linux
零门槛搭建云端 AI 编程环境:Linux 服务器 Docker 部署 OpenCode 保姆级教程
在云原生与AI编程深度融合的当下,OpenCode凭借轻量化、浏览器访问、AI辅助编程的特性,成为开发者打造云端开发环境的优选方案。通过Docker容器化部署OpenCode,可在Linux云服务器上快速搭建跨平台、可随时访问的AI编程环境,无需本地安装复杂IDE,随时随地通过浏览器编写、调试代码,结合AI能力大幅提升开发效率。本文将从环境准备、Docker安装、OpenCode部署、配置优化到安全加固,提供保姆级全流程教程,确保零基础用户也能顺利完成部署,打造专属云端AI编程工作台。
193 0
零门槛搭建云端 AI 编程环境:Linux 服务器 Docker 部署 OpenCode 保姆级教程
|
1月前
|
SQL 人工智能 文字识别
阿里把内部用了两年的 AI 代码审查工具开源了——我跑了一遍 Open Code Review
阿里开源的 Open Code Review 是一款工程化 AI 代码审查工具,采用“确定性模块 + LLM Agent”混合架构,精准定位问题、严控误报率,支持 Git 差异审查与全量扫描,已落地服务数万开发者。周增星 4750,Apache-2.0 协议,轻量易集成。(239 字)
687 2
|
2月前
|
缓存 UED 开发者
Codex109天重置23次,明天还要再送一次
Codex近109天完成23次额度重置,7月14日将迎来第24次。Tibo高频响应用户反馈:优化GPT-5.6高消耗问题、补发失效福利、调整重置时间——形成“反馈→回应→修复→补偿”正向闭环,彰显以用户为中心的产品哲学。(239字)
1930 12
|
1月前
|
存储 数据管理 数据处理
基于YOLO11的航拍屋顶杂物检测:从数据标注到云上训练全流程实践
本文详解基于YOLO11的航拍屋顶杂物检测全流程:涵盖14001张512×512图像的数据采集、Label Studio标注、云上(OSS)存储与版本管理、针对性训练策略(解决10类目标尺度不均与样本失衡),以及模型评估与工程部署,助力智慧城市精细化巡检。
基于YOLO11的航拍屋顶杂物检测:从数据标注到云上训练全流程实践
|
1月前
|
人工智能 API 内存技术
DeepSeek V4 Pro、Grok 4.6都来了:老金的观点说给你听
今天DeepSeek V4 Pro和Grok 4.6都来了。 如果你只是想知道这两个东西跟你有什么关系,我先把结论放前面。 DeepSeek V4 Pro确实更强了,但我日常大概率还是会继续用Flash。大量查资料、改东西、跑代码、跑Agent,这些每天反复发生的活,我要的不是每次都上最强模型,而是足够聪明、速度快,而且可以放心大量用的模型。 Pro是很强,但它反而让我更确定Flash该怎么
|
1月前
|
人工智能 供应链 数据可视化
哪些BI工具特别适合制造业?制造业如何应用BI系统?
在工业4.0浪潮下,制造企业深陷数据孤岛困境。Quick BI凭借多源异构整合、中国式复杂报表支持、AI对话分析(智能小Q)及钉钉/企微预警集成,成为破解生产透明化、供应链优化、质量追溯与成本管控难题的首选利器。
|
1月前
|
存储 人工智能 安全
AI 桌面管理系统核心原理:桌面异常操作识别风控技术解析
固信XTCM在终端管理内核中深度融合AI能力,实现操作级行为感知、本地安全脱敏、小模型+大模型协同推理,将海量日志转化为人岗匹配、团队诊断、风险预警等智能决策依据,推动终端管理从“管控”迈向“认知赋能”。