每次开工都要重新付一遍的那笔钱

简介: 常驻位里的东西,每开一个新会话都要重新付一遍。我原以为常驻位就是一个规矩文件,把清单打出来才发现有五处入口,占大头的那一处还挺意外。

一份两千字的规矩文件挂在常驻位上,跟你每次提问前先把它朗诵一遍,效果是一样的。

区别只在于朗诵不要钱。

这是《省 token 故事》系列里最不需要测量的一篇。前几篇讲的省法都得先测一测才知道值不值,这一篇不用。该按需加载的东西被放进了常驻位,那就是确定在浪费,浪费多少也能直接列出来,不用估。

麻烦的地方在于,常驻位比大多数人以为的要宽。

清单有五处入口

以 Claude Code 为例。别家的同族文件(Cursor 的 rules、各种 AGENTS.md)机制一样,具体限额各家没公布,我不替它们编。

规矩文件是一条链。 从工作目录往上,每一层的 CLAUDE.md 和 CLAUDE.local.md 都会全文加载,再加上用户级那一份。在子目录里干活的时候,上面几层的规矩跟着一起进来。仓库越大、目录越深,这条链越长,而它长在哪儿你平时看不见。

@路径 导入的文件在启动时展开。 官方文档里写得很直白,拆成 import 只帮你组织文件。文件拆开之后你自己看着清楚了,上下文那边一个字都没少。这一条最容易骗到人,我见过把一份长文件拆成六个 import、然后觉得瘦身完成的。

.claude/rules/ 里没写 paths 的规则文件,启动时全进。 写了 paths 的那些才是按需,等模型碰到匹配的文件才加载。一个规则目录里混着两种文件,光看目录看不出哪些在收月租。

自动记忆每轮都进,但只读前 200 行(或前 25KB,取先到的那个)。超出的部分静静地不加载。这条有两面。一面是你为前 200 行每轮付钱,另一面是你以为写进去的东西可能根本没进来。

工具定义全量常驻。 这一项通常比想象的大。MCP 工具是个例外,默认只把工具名放进去,用到某个才加载它的完整定义。

skill 省不省,取决于命中率

顺着说一句按需加载这类能力,因为「用 skill 省 token」这个说法现在传得很广。

它的成本结构是两段:描述常驻,正文按需。平时进上下文的只有一行几十个字的描述,等模型判断这活跟它有关,才把整篇正文读进来。

所以省多少这件事,算法很朴素。一次会话为它付的钱,是那行描述的固定成本,加上正文长度乘以命中率。全写进常驻位的话,付的就是正文的全价。这两个数谁大谁小,落在命中率上。

天天触发的 skill,p 接近 1,期望成本比直接写进常驻配置还高一点点,多付的是那行描述。一个月触发一次的,p 约等于 0,成本就是那行描述,几乎可以忽略。

机制上成立,收益因人而异。谁给你一个固定的省钱百分比,你可以问他一句:你的命中率是多少。

真正确定的那一半在反方向——按需加载省下来的钱,是你没把它放进常驻位省下来的。

判据只有一句话

这条规矩,是每次开工都要用,还是碰到特定活儿才用?

前者留在常驻位,后者挪进按需加载。

判断标准是使用频率,跟重要不重要没关系,这两件事经常被混着谈。一条很重要但一个月用一次的规矩,放在常驻位上就是在替它交月租,而重要抵不掉月租。

先看单子,再减肥

这一篇的数不用估,能直接列。

Claude Code 里敲 /context,Memory files 那一栏就是实际加载的文件清单。用别家工具的,看一次请求的完整 system 段有多长。再不济,拿 token 计数接口把你那份常驻配置数一遍。

我自己那次列出来,占最大头的既不是规矩文件也不是记忆,是工具定义。这是我一次实测的结果,不是普遍规律,你那边的大头可能在别处,这恰好是要先看单子的理由。凭印象删,删掉的多半是你最近改过所以印象最深的那份,跟它有多贵没关系。

床叠得再整齐,你也只睡一张。

相关文章
|
1月前
|
NoSQL 关系型数据库 MySQL
买了云服务器,不等于上了云
朋友小美说「我们那不就是几台机器吗,跟云计算有什么关系」。这句话比她自己以为的准。买了云上的机器和用上了云,中间隔着三层,多数团队停在第一层。她那几台常年低利用率的 8 核 32G,答案就在第三层。
|
29天前
|
人工智能 运维 安全
AI加持后2天时间将公司的运维自动化提高了一个层次
近期工作安排包括自动化测试、自动化运维、自动化运营和安全等一些工作。自己做产品、自己做设计、自己做开发、自己验收上线还是挺爽滴。 这其中工作简单的就是自动化运维。但我今天真正要讲的不是做了什么,或者用了什么技术,这些都不是核心问题。核心是面对一句话需求,要怎样去思考。
|
1月前
|
消息中间件 存储 SQL
IaaS、PaaS、SaaS 到底差在哪:买了托管数据库,也不等于不会丢数据
三个绕口令用一个租房类比就能说清:毛坯房、精装公寓、酒店。真正要紧的是后半段——买了云,服务商到底管到哪儿?有一条线到哪层都不动,你的数据和谁能访问它,永远是你的责任。所以「买了托管数据库就不会丢数据」是个误会,这两件事之间差着一次故障。
|
2月前
|
XML 供应链 API
SOA 没死,只是改了名
闺蜜小美发来她公司的架构图,问我这算什么架构。我说 SOA,她愣了:这词不是十年前的吗?这篇讲清单体、SOA、微服务的分界,以及为什么一半以上的企业现在跑的就是 SOA——只是没人这么叫它了。
|
1月前
|
人工智能
AI 不会淘汰你,但会淘汰「只会点发送」的那类人
同事小李用 AI 半小时拼完周报,会议室里老板只问了一句: 「第三段数据从哪来的?错了你负责吗?」 小李愣住——他只点了发送,从没点开过链接。 这不是 AI 不行,是人把「会用 AI」和「能扛事」混成了一件事。
|
20天前
|
存储 缓存 算法
AKF扩展立方体和AKF可用性立方体
很多人知道AKF扩展立方体是从《架构即未来》这本书开始。实际上akfpartners官方写过4篇关于AKF扩展立方体的文章,还有一篇介绍AKF可用性立方体。akfpartners官方在高可用、扩展性方面有很多专业技术文章,建议有空就翻翻看。
|
20天前
|
芯片
CEO的1元年薪起源
手机更新换代,背后的安迪-比尔定理。还有其他一些大家天天接触但很多人没有深究的一些现象都是怎么产生的呢? 很多朋友都发现这种事情,刚买来新款的手机速度很快,体验流畅。但是手机总是提示更新系统,越更新越慢。最后不得不再买更新款的手机。
|
1月前
|
人工智能 安全 API
阿里云Token Plan 个人版Quick Start:最低39 元/月,主流AI工具直接接入,Credits 统一计量
阿里云百炼 Token Plan 个人版是面向个人开发者的 AI 大模型订阅服务,采用 Credits 统一计量,支持在 Claude Code、Cursor、Qwen Code 等主流 AI 编程和智能体工具中使用。目前提供 Lite、Standard、Pro 三档套餐及用量包,限时价格分别为 39 元/月、139 元/月、499 元/月。
阿里云Token Plan 个人版Quick Start:最低39 元/月,主流AI工具直接接入,Credits 统一计量
|
1月前
|
弹性计算 人工智能 API
DeepSeek Harness:阿里云百炼支持按量计费、Coding Plan、Token Plan方式配置接入
阿里云百炼支持DeepSeek Harness接入,提供按量计费、Coding Plan及Token Plan(个人/团队版)四种灵活配置方式,兼容OpenAI协议,开箱即用。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
|
22天前
|
人工智能 容灾 架构师
简历上每个名词,都是一张发给面试官的提问许可证
简历上每个名词,都是一张发给面试官的提问许可证:名词越炫,他下钻的落点越深。落差一旦暴露,连你真做过的部分也会被连带怀疑。包装的正确方向不是把小事说大,是把真事说清——数字、边界、决策理由。 头条标题:你写「熟练 RRF 召回」,面试官就敢问 k 值取多少