很多团队接入大模型翻译前都会问同一个问题:翻一篇文档到底要花多少 token?答案是「取决于策略」——同样一万字的文档,不同做法的消耗可以差出一倍以上。把我们实测的账摊开算一遍。
先搞清楚 token 构成
翻译请求的 token = 输入 + 输出:
- 输出:中文译文,通常占原文 token 的 0.6~0.8 倍(英译中方向)
- 输入:原文 + 系统提示词 + 术语表 + 少样本示例
新手最容易忽略的是输入侧:提示词和术语表是每个请求都要重复支付的固定开销。文档切成 50 段逐段翻,系统提示词就付 50 次。
三种策略的实测账
同一篇一万英文字符的技术文档(约 2500 token),三种翻法:
策略一:整篇直译。 一次请求,输入 2500 + 提示词 200,输出约 1900。总消耗约 4600 token。风险:超长文档会撞上下文上限,且长输出质量衰减。
策略二:按段落切分逐段翻。 切成 30 段,每段带提示词。总输入 2500 + 30×150 ≈ 7000,输出不变。比整篇多花 50%,换来的是稳定性(单段失败可重试)和并发能力。
策略三:分段 + 术语表 + 缓存。 在策略二基础上,提示词压缩到 60 token,术语表按段落相关度动态注入(而不是全量携带),重复句式命中缓存。实测总消耗约 5800 token——比策略二省 17%,质量不打折。
换算成钱
按量计费的市场行情(如 2.5 元/百万 token)下,这篇文档的翻译成本:
- 策略一:约 0.012 元
- 策略二:约 0.018 元
- 策略三:约 0.015 元
一部 10 万字的英文原著按策略三翻,成本在 0.15 元量级。翻译场景的模型调用费其实非常便宜,真正贵的是策略选错带来的放大:无幂等键的重试、全量携带的术语表、重复支付的提示词。
三个优化优先级
- 先做缓存:技术文档句式重复率高,缓存命中率能到 20~30%,这是零质量损失的节省
- 再压提示词:系统提示词从几百 token 压到几十,长文档场景收益随段数线性放大
- 最后调分段:分段粒度影响并发和稳定性,但不是成本大头,别过度优化
结语
token 账算清楚之后,「按量计费贵不贵」这个问题的答案就很直观了:单价贵不贵看账单,策略对不对才是决定性变量。把缓存和提示词这两件事做对,翻译类应用的成本能压到几乎可以忽略。