9 月 10 日,DeepSeek 正式下调 Flash 系列 API 价格。从调价幅度分布看,这不是一次简单的卷价格,而是针对推理架构的精准手术。
降了什么: 涉及 deepseek-v4-flash 和 deepseek-vision-exp。输入缓存命中从 0.05 元/百万 token 降至 0.02 元,降幅 60%;缓存未命中降 33%;输出从 4.5 元降至 4 元,仅降 11%。三档差异悬殊——缓存命中是主战场。
为什么缓存命中降得最狠: MoE 架构下每次推理仅激活部分专家子网络,计算量远低于稠密模型。KV cache 命中时,模型跳过 prefill 阶段的大量计算,直接复用已缓存的键值对,成本进一步骤降。此前 0.05 元的定价并未充分反映这一优势——降到 0.02 元,是把 MoE + Cache 的架构红利让渡给开发者,换取更高缓存复用率。
输出为什么只降 11%: 自回归生成每个 token 必须逐步推理,无法像 prefill 那样批量并行,算力成本刚性较强。11% 是跟随市场的对称动作,而非架构红利的外溢。
V4.1-Flash 的位置: 已升级至 V4.1 架构,是新一代模型族中参数量最小但吞吐最高的成员。原生多模态视觉理解替代了独立的 Vision Exp 模型,支持 Responses API 工具调用,基准性能超过 V4 Pro。用最小模型打最强性价比——这是大模型竞赛之外的第二条路线。
对开发者的影响: system prompt 固定的 Agent、RAG 等高重复前缀场景,缓存命中率可达 70-90%,输入成本直降至原来的 40%。日均 1000 万输入 token 的中型 Agent,月成本从约 1500 元降至 600 元级别。
行业信号: 此前 R1 系列的分时定价推动了批处理负载向低谷迁移。此次缓存友好型定价,本质是用价格信号重塑 prompt 工程习惯——写好 system prompt、设计好缓存边界,就能拿到市场最低推理单价。
价格战的尽头是成本结构透明化。这一步,把"模型有多便宜"的竞争推向了"架构有多高效"的维度。