成本系列最后一篇。前三篇聊了计量、存储、带宽这些「看得见的账」,今天收尾聊五项多数团队立项时根本没列入预算的隐性成本。它们单个不起眼,加起来常占总成本的三成。
1. 失败请求的成本
LLM 调用不是 100% 成功——超时重试、限流退避、格式错误重生成。重试不是免费的:一个 5% 失败率的接口,配上「重试 3 次」的策略,实际 token 消耗放大 10~15%。失败率要进成本仪表盘,和成功率并排放。
2. 评估与回归测试的成本
模型一升级你就得重跑评估集——每次几百上千次调用。很多团队评估集从不更新,跑一次心疼一次,最后干脆不跑,模型升级全靠「感觉没问题」。评估集是资产,评估调用是它的维护成本,预算里要有这一项。
3. 日志与可观测的成本
全文日志(prompt+补全全存)是排查问题的刚需,但长文本场景下日志存储很快超过推理成本本身。解法是分级:热数据全量存 7 天、温数据只存摘要 30 天、冷数据只留计量数据。排查体验和存储账的平衡点,要主动设计而不是放任自流。
4. 人工抽检的成本
翻译/生成类产品上线后,质量抽检是持续成本。全自动质检(另一个模型当裁判)能砍掉大部分人工量,但「裁判模型」本身的调用又是一笔账——通常仍比人工便宜一个量级,该上就上。
5. 汇率波动与价格调整
API 单价会调、模型会更新换代、按月订阅和按量的组合会变。成本模型里的单价参数至少每月校准一次,否则三个月后你的「成本地图」就是怀旧作品。
收官:成本管理的真正目标
四篇下来,重复出现的主题其实只有一个:计量先行,归因到功能。算力、存储、带宽、隐性项——所有成本优化的前提都是「知道钱花在哪个功能的哪一步」。成本地图画准了,优化点自己会浮出来。