百炼上下文缓存实测:隐式与显式对跑 11 次调用,bl text chat 透传 cache_control 的命中判定与回本边界

简介: 《从零开始搭建知识库·EP07》实测对比隐式与显式缓存:隐式自动命中公共前缀,免配置、成本低(1.5元/M),适合千变万化的客服问答;显式需标记`cache_control`,创建贵(15元/M)、命中极省(1元/M),仅同一请求重复执行才回本。二者完全隔离、互斥,选型取决于负载形态。(239字)

从零开始搭建知识库 · EP07 · 范式篇(二)隐式缓存 vs 显式缓存

两种缓存在能力栈里的位置

「从零开始搭建知识库」系列第七期,范式篇第二期。EP06 落地的结论是:编译范式命中前缀缓存后每问省一半以上,约 6 问回本,但这笔账完全押在缓存命中上。本期把百炼的两条缓存通路在同一份资产上对跑:隐式缓存(服务端自动按公共前缀命中,无需配置)与显式缓存(调用方在 messages 里挂 cache_control 标记,主动创建)。

资产沿用 EP06:编译产物(7,929 token 的 prompt 前缀)、qwen3.8-max、同一句 system、同样四道问法。11 次付费调用,合计约 0.93 元,全部 usage 留痕在系列实验记录里。

两种缓存机制对比:隐式缓存自动匹配消息的公共前缀,无需配置,命中按每百万 1.5 元计费;显式缓存需要在知识库块上手动挂 cache_control 标记,创建按每百万 15 元计费,命中按 1 元计费

通道分工表:本期新增两行

需求 正确通道 说明
知识库建库 百炼控制台(网页) 含排序模型与 rewrite 开关
知识库检索(服务化) bl knowledge search --query <text> --agent-id <id> 走检索服务
智能体应用调用 bl app call --app-id <id> --prompt <text> Agent 自主检索
整库编译 / 全上下文提问 bl text chat --messages-file <file> EP06 已落:语料直接进上下文
显式缓存标记 --messages-file + content 数组挂 cache_control 本期实测:CLI 无专门缓存命令,结构化 messages 透传,usage 出现 ephemeral_5m_input_tokens 即创建成功
缓存命中与单价查询 bl model list --model qwen3.8-max 本期实测:No Auth,四档单价与计费类型名(含 TTL 5m)直接可读

CLI 没有专门的缓存命令(reference 文档 grep「cache」「缓存」零命中),但显式缓存靠的是 messages 里的结构标记,--messages-file 传什么结构发什么结构。显式组的写法:

[
 {
   "role": "system", "content": "你是暖屋家居的客服助手。"},
 {
   "role": "user", "content": [
   {
   "type": "text", "text": "(整份编译产物)\n\n---\n以上是公司知识库。",
    "cache_control": {
   "type": "ephemeral"}},
   {
   "type": "text", "text": "用户问题:报销发票怎么提交"}
 ]}
]

透传成功的判定标准:显式组 usage 必须出现 A 组从没见过的新字段。B0 实测返回 ephemeral_5m_input_tokens: 7923cache_creation_input_tokens: 7923cache_type: "ephemeral" 三个新字段,与价目表的计费类型名 input_token_cache_creation_5m 对上,7,923 个 token 走了显式创建。

四档单价:TTL 写在计费类型名里

bl model list --model qwen3.8-max 不需要鉴权,2026-09-04 现场拉价:

档位 单价 相对输入价
输入 12 元 / M 100%
输出 36 元 / M
隐式命中 1.5 元 / M 12.5%
显式创建 15 元 / M 125%
显式命中 1 元 / M 8.33%

显式创建的计费类型名是 input_token_cache_creation_5m,TTL 5 分钟写在字段名里,与官方文档口径一致,本期 B3 实测也验证了这个时长。

六个实测发现

一、隐式缓存的存活边界。A 组四连测:隔两天缓存全没(7,929 token 全价结算,0.1075 元);20 秒内连问命中 7,168(0.0345 元);9 分 32 秒后再命中(0.0285 元);13 分 59 秒后再命中(0.0419 元),距首次命中累计 23 分半。隐式存活至少 14 分钟起步,两天必然失效,中间不透明。

二、挂标记即出隐式局。B0 距 A4 仅 31 秒,A4 刚隐式命中过,B0 的 cached_tokens 是 0。显式与隐式在同一次调用上互斥。

三、显式命中判定是完整请求一致,不是前缀。B0 创建后 12 秒换问题(B1)、15 秒换问题(B2),都是全额重新创建。9 秒对照实验:与 B0 逐字节相同但等 8 分 13 秒(超 TTL)重新创建(B3);与 B3 逐字节相同隔 9 秒重发命中(B4,0.0202 元,全期最便宜);与 B4 只差问题文本隔 9 秒发不命中(B5)。

命中判定对比:隐式缓存只要知识库前缀匹配就命中,无论问题怎么换;显式缓存只在完整请求逐字节一致时才命中,换了问题不命中,原样重发才命中

四、两条通道完全隔离。D1 在两次显式创建后 9 秒用隐式拼法提问,命中量 7,168(隐式口径),不是显式刚创建的 7,923。官方公告「隐式缓存与显式缓存对于同一次模型调用不共享」的数值版。显式实验跑完,隐式缓存毫发无伤。

两条平行账本被一堵标有互不共享的砖墙隔开:左边蓝色隐式账本 7168 token,右边橙色显式账本 7923 token,不带标记的请求走左边,带标记的请求走右边

五、隐式按 1,024 token 对齐。四次隐式命中量恒为 7,168 = 7 × 1,024,而 prompt 总长在 7,929 到 7,942 之间浮动。公共前缀里不满一块的尾部不入缓存,每次约 767 个 token 按全价结算。隐式等效输入单价 2.515 元每百万(标准价的 21%),名义 12.5% 只对入缓存的 token 成立。显式无此截断,创建量与命中量都是 7,923,覆盖 99.9%。

六、显式的回本边界。四种稳态:全价冷启动 12.00 元 / M(100%)、隐式稳态 2.515 元 / M(21.0%)、显式创建 15.00 元 / M(125%)、显式命中 1.008 元 / M(8.4%)。

四档输入侧成本柱状图:显式创建 15 元是最高的红色柱,全价 12 元是灰色柱,隐式稳态 2.5 元是较矮的蓝色柱,显式命中 1 元是最矮的绿色柱

知识库问答形态(一份前缀连问 5 个不同问题):隐式合计 0.1750 元,显式合计 0.5946 元,3.4 倍;单问稳态 5.96 倍。显式的甜区是同一份 messages 原样重复:3 次打平,5 次省 13.6%,10 次省 30.4%,极限省 60%。TTL 5 分钟内没有下一次命中,创建溢价全蒸发。

选型判据

负载形态 怎么放
客服问答:前缀固定,问题千变万化 隐式,什么都不用配
同题复现:评测集重跑、批量重试、多 Agent 并行同 prompt 显式标记,第 3 次回本
低频零散:一天问不了几次 哪种都救不了,考虑回检索范式
用隐式时想多命中 控制节奏,14 分钟内跟问有效

结论落在生态里就是一句话:百炼的显式缓存当前定位是「相同请求的重复执行加速」,不是「固定前缀的变化请求加速」。知识库问答这个最普遍的场景,隐式仍然是默认答案。

下期预告

范式篇还剩权限边界没碰:同一份库切两个权限视图,编译产物、检索 metadata 过滤、Agent 提示词三种放法各能守住什么。实验资产继续沿用系列同库。


本文实测基于百炼 CLI(bl),11 次调用的完整 usage、思考链与产物留痕于项目仓库。命令格式可能随版本更新调整,以官方文档为准。API Key 在控制台密钥管理页创建(新用户有免费额度)。

相关文章
|
17天前
|
缓存 Shell API
DeepSeek Harness 插件生态一周观察:百炼被社区选中的三个位置,与空着的第四个
8月13日DeepSeek开源DSH,一周GitHub获16万星、插件超4000个。本文聚焦插件生态结构,发现百炼已自然占据读图、记忆、备用主模型三大位置;而多模态生成(图/视/音)作为第四关键位仍空缺——恰可由百炼CLI以单命令低成本填补,实现“说人话→Agent调用→自动产出”。
|
2月前
|
人工智能 API 双11
# 百炼 CLI 电商视觉全链路方案:从白底主图到展示视频的 AI 生产力升级
阿里云百炼CLI提供电商视觉全链路AI生产方案:6步生成白底图、场景图、模特穿搭、海报及展示视频,单SKU成本仅约10元,较传统摄影降本99.8%。支持可编程批量处理,适配中小电商、大促及跨境多平台需求。(239字)
|
2月前
|
人工智能 自然语言处理 前端开发
百炼 Skills 实战:novel-game——让零基础用户把故事变成可玩的互动小说游戏
novel-game 是百炼官方推出的互动小说创作 Skill,无需编程即可一键生成完整视觉小说。融合 Qwen、Wan、HappyHorse、CosyVoice 多模态 AI,自动产出剧情、立绘、动画、配音及程序化音效,输出可离线运行的 React 游戏,支持分支叙事与多端适配。(239字)
|
2月前
|
人工智能 JSON API
百炼 Skills 实战:spark-video——让零基础用户一句话做出完整AI视频
spark-video 是百炼平台推出的AI视频端到端Skill,封装Qwen编剧、HappyHorse渲染、Qwen-VL质检、CosyVoice配音等多模态能力,用户仅需一句话描述+4次确认,即可零门槛生成完整MP4视频,费用透明、流程可控,专为小白打造“输入即成片”体验。(239字)
|
3月前
|
人工智能 自然语言处理 API
百炼 MCP 市场实战,一句话查 A 股全市场数据
阿里云百炼MCP金融数据服务(market-cmapi00073529),集成financial-expert Skill,支持自然语言选股、基金经理分析、宏观查询、研报检索等,免费调用,3分钟快速上手,零代码获取结构化A股/基金/宏观数据。
|
9月前
|
存储 弹性计算 人工智能
阿里云有免费云服务器吗?阿里云免费云服务器及免费云产品清单及全方位测评
阿里云有免费云服务器吗?有的。目前云计算市场占据大份额的阿里云,长期以 “免费试用” 为招牌吸引用户。从个人开发者的入门测试到企业的业务预演,其免费云产品矩阵覆盖了服务器、AI 工具、云电脑等多个核心场景。然而,“免费” 背后究竟是真香福利还是营销套路?本文结合官方规则与真实用户体验,对阿里云 160 + 免费云产品进行全方位测评,拆解适用场景、隐藏限制与避坑指南,帮你精准判断是否值得尝试。
|
8月前
|
机器学习/深度学习 计算机视觉 网络架构
YOLO26改进 - 注意力机制 |融合HCF-Net维度感知选择性整合模块DASI 增强小目标显著性
本文介绍将HCF-Net中的维度感知选择性融合(DASI)模块集成至YOLO26检测头,通过通道分区与Sigmoid自适应加权,融合高/低维及当前层特征,显著提升红外小目标检测精度,在SIRST数据集上超越主流方法。(239字)
|
9月前
|
UED
验证码短信突发失败?阿里云「验证码兜底解决方案」保障业务高可用
当用户自定义的短信签名或模板因运营商审核等原因导致发送失败时,系统会自动切换至兜底签名和兜底模板,作为一种备用发送策略,确保验证码仍能成功发送。
717 0
|
9月前
|
人工智能 Cloud Native 安全
云上实践:从AI营销服务商的技术栈看企业MarTech选型与集成
在云原生与AI融合的营销时代,选型需兼顾技术集成能力。本文剖析链创AI、蓝色光标等五类服务商的技术架构与数据集成模式,提出API优先、数据合规、系统兼容等六大选型要点,助力企业实现安全、高效的技术对接,避免数据孤岛与技术债。
|
编解码 固态存储 openCL
Mastercam 2025 官方电脑配置推荐
Mastercam 推荐配置:建议使用最新版 Windows Professional;推荐 Intel i7 处理器,至少 8GB 内存(建议 32GB),NVIDIA RTX 或 AMD FirePro™/Radeon Pro 专业显卡(4GB 以上内存);双显示器设置,主显示器分辨率 1920x1080;使用 SSD 作为主驱动器;可选 3D 鼠标提升操作体验;注意杀毒软件可能影响软件运行。
3740 7

热门文章

最新文章