你的大模型 API 账单能打折:前缀缓存,我用一次踩坑换来的
Agent 每轮都要把全部历史重发给大模型,费用照付;但服务商对逐字节一致的前缀有缓存折扣,输入价最低一折。本文讲清前缀缓存的命中规则、四种"毒死缓存"的常见写法,并附我开源项目 codeAgent 的三段真实源码:临时消息走便签通道不进正式历史、_timestamp 等记账字段发送前统一剥离、system prompt 只构建一次。零依赖零成本,长会话能省数倍 token 费用,附完整代码。
引用回复为什么不能只存一段文字?消息标识、上下文与失效引用
本文探讨聊天系统中“引用回复”的本质设计问题:如何确保回复**准确指向原消息**(而非靠内容或位置)、**当前可展示什么**(区分加载/权限/删除状态)、**点击后能否可靠定位**(需独立于分页与缓存)。强调用`(会话ID, 消息ID)`稳定标识,分离关系、展示、定位三重契约,避免摘要误导与位置漂移。(239字)
长期运行要盯住的日志、状态清理与署名义务
本文详解 billion-context 在 ECS 长期部署的运维要点:日志轮转(10MB 自动切换)、状态目录建议置于数据盘、会话清理需显式启用(默认关闭)、自动更新后需手动重启以避免 stale 状态,并强调 MIT 许可下的署名义务。附常见问题与长期运行清单。(239 字)
阿里云AI模型的Token如何计费?输入、输出及免费100 Tokens费用说明
2026年阿里云通义千问(Qwen)系列模型Token收费标准公布:按输入/输出分别计价,覆盖Qwen3-Max、Qwen3.5-Plus、Qwen-Long、Qwen3-Omni-Flash(多模态)、通义点金及全妙轻应用等。支持Batch调用5折、上下文缓存优惠及90天内免费额度(各100万Token起),精准报价以阿里云百炼官网为准。(239字)
ECS 上跑知识库的容量与性能实践
本文详解dsh-knowledge插件(v0.4.1,AGPL-3.0)在阿里云ECS上长期稳定运行的关键:容量规划(模型/分块/原始文件/内存四维估算)、模型权重落盘至数据盘、Token级分块参数调优、精准索引重建策略、后台异步下载语义及MinerU容错机制,兼顾备份与监控。