成本系列收官时说过「计量先行」。今天补上后半句:计量之后要治理——用量失控的团队不是没有账单,是没有开关。四个开关,装上就能防住大部分失控场景。
开关一:会话级用量上限
LLM 应用的最小失控单元是「一个会话」——循环调用、用户狂点重新生成、Agent 卡死在工具循环里,都发生在会话内。单会话设调用次数+token 总量双上限,触顶熔断并友好提示。这个开关成本最低、收益最直接,如果只装一个,装它。
开关二:单日预算分级
按「功能维度」设日预算,而不是全局一刀切。我们内部的做法:核心功能(付费用户在用的)预算宽裕+告警线 80%;实验性功能预算收紧+告警线 50%;实验功能超支自动降级为排队制——创新要有钱花,但不能花到核心业务头上。
开关三:异常模式告警
平均值看不失控,要看「模式」:某用户单日调用量是中位数的 100 倍(可能是脚本滥用)、某功能错误重试率突然翻倍(可能是上游模型变了导致循环重试)、某时段消耗曲线异常陡峭(可能是死循环)。三个模式告警接进值班群,比月底看账单追责有用得多。
开关四:用户侧的透明账单
如果你的产品按量收费,给用户看的用量页要做成「功能维度+时间维度」的明细,而不是一个总数。透明账单是双向保护:用户能看到钱花在哪(信任+),你能在用户投诉之前发现异常(他们比你的监控更敏感)。
结语
四个开关的共同逻辑:把「发现失控」的时间从月底提前到分钟级。token 是流式的钱,流式的钱要流式地管。装好开关,AI 应用的成本曲线才会从「惊吓」变成「可控」。