DeepSeek V4-Pro 转正:号称追平 Claude Fable 5,但跑分只有一家在说

简介: DeepSeek V4-Pro正式版(0813)上线,Agent能力跃升:DeepSWE达62.7(+5×),Terminal Bench 87.9,逼近Claude Fable 5;输入3元/百万Token、输出6元,成本仅其约1/46,但所有跑分尚未经第三方验证。

氛围图

💡 一句话总结:DeepSeek V4-Pro 旗舰模型今天正式 GA,Agent 能力据报暴涨(DeepSWE 从 12.8 飙到 62.7),价格比 Claude Fable 5 便宜约 46 倍——但所有跑分都是 DeepSeek 自己发的,还没有任何第三方验证过。便宜是真的,强不强得再等等。

导语:你的 API 账单还好吗?

如果你是一个天天挂着 Claude Code 或者 GPT 写代码的人,最近几个月大概率有过一个念头:"这 API 账单能不能便宜点?"

Anthropic 的 Fable 5 输出 token 要 $50 每百万——跑一轮复杂的 agent 工作流,几十刀就没了。GPT-5.6 Luna 刚降了价,输入 $0.2/M 输出 $1.2/M,已经很有诚意了。但 DeepSeek V4-Flash 的 $0.14/$0.28 直接把地板价又踩穿了一层。

然后今天(8 月 12-13 日),DeepSeek 的旗舰模型 V4-Pro 也正式转正了——版本号 0813,从预览版变成了 GA(General Availability)。号称 Agent 能力暴涨,号称追平甚至部分超越 Claude Fable 5,号称只要 Fable 5 的 1/46 价格。

听起来是不是太好了?所以这篇就帮你看懂:什么是真的、什么有水分、什么完全还没验证。

想自己动手试?


🚀 今天到底发生了什么

一句话:DeepSeek V4-Pro 从"预览版"转正成"正式版"了。

具体说,DeepSeek 在自己的 API 定价页上把 deepseek-v4-pro 端点的版本号更新成了 DeepSeek-V4-Pro-0813。OpenRouter 也同步上线,描述里白纸黑字写着 "This is the GA release of DeepSeek V4 Pro"。同时,DeepSeek Chat 网页版和客户端也用上了这个版本——普通用户打开就能免费用到,DeepSeek 至今没有消费级付费订阅,chat 是完全免费的。

模型本身没有架构变化:仍然是 MoE(混合专家架构,简单说就是总参数巨大但每次推理只激活一小部分专家上场),1.6 万亿总参数、490 亿激活,100 万 token 上下文窗口,最大输出 38.4 万 token。MIT 开源许可。这些都和 4 月 24 日预览版发布时一致。

变的是后训练和 Agent 能力。 DeepSeek 自己发布了一组对比图表——把 0813 和 4 月的预览版做了基准对比:

基准 预览版 0813 GA 涨幅
Terminal-Bench 2.1 72.1 87.9 +15.8
CyberGym 52.7 83.3 +30.6
DeepSWE 12.8 62.7 +49.9
AutomationBench 12.8 31.8 +19.0
DSBench-Hard 31.1 67.2 +36.1

DeepSWE 从 12.8 涨到 62.7——接近 50 个百分点的跳升,这种增幅在 AI 基准里几乎闻所未闻。但请先记住这个数字,后面会说到它的来源问题。

有意思的是,这次 GA 还有一个"家务事"的背景。7 月 31 日 DeepSeek 把更便宜的 V4-Flash 先转正了(公测版),结果 Flash 在 9 项 Agent 基准上反超了自己的旗舰大哥 Pro 预览版。旗舰模型被自家小弟打脸,两周后 V4-Pro-0813 就带着暴涨的 Agent 跑分来了——核心叙事就是"旗舰夺回了 Agent 王座"。DeepSeek 官方没这么说过,但这个时间线和数据走向,你品。


💰 便宜到什么程度?先把那个"1/57"的口号掰扯清楚

网上流传一个说法:"V4-Pro 是 Fable 5 价格的 1/57"。这个数字有没有道理?有,但它是被高度压缩过的。

kingy.ai 做了个事实核查,结论是这样的:

  • 输出 token 单独算:V4-Pro $0.87/M vs Fable 5 $50/M,确实是大约 1/57
  • 输入 token 单独算:V4-Pro $0.435/M vs Fable 5 $10/M,大约是 1/23
  • 混合负载实际算(输入+输出综合):大约 1/46

所以"异常便宜"这个定性判断完全成立——但"1/57"把三个不同口径的数字压缩成了一个,严格来说是误导。更准确的说法是 "大约 1/46"

给你一个更直观的参照:

模型 输入 $/M 输出 $/M 备注
DeepSeek V4-Pro $0.435 $0.87 永久价(原价 $1.74/$3.48)
DeepSeek V4-Flash $0.14 $0.28 比 Pro 还便宜 3 倍
GPT-5.6 Luna $0.2 $1.2 刚降过价
Claude Fable 5 $10 $50 前沿旗舰
Kimi K3 $3 $15 中国同梯竞品

5 月 22 日,DeepSeek 把 V4-Pro 的 75% 促销折扣变成了永久价——不是限时活动了,是长期 list price。这意味着你可以放心签 12 个月的企业合同了,不用担心下个月价格弹回去。

但是(总是有但是的):DeepSeek 定价页上同时挂了一条声明——"计划在近期上调整体 API 定价,预计会有显著增长"。具体涨多少、什么时候涨,都没说。所以当前这个价格更像是"窗口期价格",而不是永久承诺。


🤖 Agent 跑分暴涨?先看看数据是怎么来的

回到那个 DeepSWE 从 12.8 飙到 62.7 的数字。这个增幅大不大?大得离谱。能不能信?目前只能信一半——"数字确实是 DeepSeek 发的",但"有没有那么强"还没有任何人独立验证过。

几个事实帮你判断这些数据的质量:

  • 来源是 DeepSeek 自己的对比图表,通过官方 WeChat 群和 X 账号发布,被博客转载传播。Reddit 上有人搬运,被版主以"低质量"为由删除了
  • benchable.ai 上该模型的页面是空的——第三方基准平台还没有任何结果
  • DeepSeek 官方 changelog 没有 GA 发布的条目——最后一次更新还停在 7 月 31 日 Flash 公测的公告
  • 0813 的开源权重还没发布——HuggingFace 上仍然托管的是 4 月预览权重,月下载超 140 万次的也是那个旧版本
  • 对比基线是自家预览版,不是竞品——也就是说"涨了 50 个百分点"的参照物是自己的旧版本,不是 Fable 5 或 GPT-5.6

更值得注意的一个细节:那组 Agent 图表用的是 Terminal-Bench 2.1,而 4 月预览版发布时的标准基准表用的是 Terminal-Bench 2.0——不同版本,分数不可直接比较。所以你看到"预览版 Terminal-Bench 67.9"和"0813 Terminal-Bench 87.9"时,别急着算差值,它们用的可能不是同一套卷子。

Simon Willison(知名 AI 博主)在他的博客里提到一个耐人寻味的细节:他测试时发现 V4-Pro 在不同推理强度(low/medium/high)下生成的图片差异极大——"没有其他模型有这种程度的差异"。这意味着推理强度对输出质量的影响可能比其他模型显著得多,选对档位很重要。

总结一下数据可信度:DeepSeek 自己的标准基准(4 月发布的 SWE-Bench、LiveCodeBench 等)已经被多个第三方验证过,大体靠谱。但 0813 的 Agent 大幅提升数据目前完全是孤证——只有 DeepSeek 一家在说,没有任何人复现。


👨‍💻 开发者社区怎么说

Hacker News 是这次讨论的主战场。V4 系列今年 4 月首发的主帖拿到了 2091 分和 1607 条评论——HN 近期最热的 AI 话题之一。社区反馈大致是 6 成正面、3 成谨慎、1 成负面

说好的那拨人 主要激动于成本:

  • "在 max reasoning 设置下,我的 credit 余额几乎不动"——这是真实 API 用户反馈
  • 有人估算,加上 agentic 工作流中典型的缓存命中率,实际花费比 Claude Opus 便宜约 60 倍
  • DeepClaude 项目(把 V4-Pro 塞进 Claude Code 的 agent loop 里跑)在 HN 拿了 678 分,说明"用 DeepSeek 引擎跑 Claude Code"的需求真实存在
  • LiveCodeBench 93.5 分是同表所有模型最高,Codeforces rating 3206 也压过 GPT-5.4 的 3168

说不好的那拨人 给了一个特别有杀伤力的真实对比:

"Deepseek 4 pro:跑了 12 分 02 秒,花了 $0.12——有 bug。Grok 4.6:跑了 3 分 18 秒,花了 $1.41——没 bug。"

十二美分跑出来一个带 bug 的结果,和一块四跑出来一个干净的结果——这个对比精准地命中了"便宜 ≠ 好"的痛点。当然,正如另一位 HN 用户说的:"这是非确定性系统,单次试验不能大幅更新你的先验。" 一个样本说明不了什么,但至少提醒我们:跑分和实际使用体验之间可以有巨大鸿沟。

还有几个反复被提到的关切:

  • 隐私政策:"DeepSeek 的隐私政策异常糟糕——他们可以用你的 prompt 和补全做训练。" 对企业级敏感数据来说,这是一条硬伤
  • 推理速度:高负载时段明显变慢。DeepSeek 的计算资源只有约 2 万张 H100,在高并发下推理会"慢到爬行"
  • 基准方法论质疑:有人指出"harness(测试框架)的权重几乎和模型本身一样大",意思是你换个测试工具链可能分数完全不一样

📌 几个你该知道的信号

在你考虑要不要切到 V4-Pro 之前,有几个信号值得放在心上:

第一,DeepSeek 7 月的 token 消耗量已经仅次于 Anthropic,8 月大概率登顶。 这意味着它正在获取全球最大规模的用户交互数据——这些数据直接喂给后训练,可能形成"用户越多→数据越多→模型越强→用户更多"的飞轮。从行业竞争角度看,这是一个值得关注的结构性优势。

第二,V4-Flash 可能是更务实的选择。 Flash 只要 $0.14/$0.28 每百万 token(比 Pro 还便宜 3 倍),而且 Terminal-Bench 2.1 已经到了 82.7——和 Pro 的 87.9 差距不大。如果你的工作负载是日常编码、分类、摘要、RAG 检索,Flash 的性价比可能比 Pro 更高。Pro 真正的价值在于最难的 agentic 长链任务,那种需要几百步工具调用的场景。

第三,0813 的开源权重还没出来。 如果你是要自托管的研究者或企业,现在能用的还是 4 月的预览权重。DeepSeek 没说什么时候发 0813 权重,也没说 GA 版和预览版在模型本体上是否有区别——可能只是后训练不同,也可能是全新 checkpoint。

第四,今天是"三连发"的一天。 除了 V4-Pro GA,Grok 4.6 也发布了(Intelligence Index 61,只有 GPT-5.6 Sol 价格的五分之一),阿里也上线了第一个开源 Qwen-Max。三家公司同日发旗舰——AI 模型的迭代节奏已经从"季度旗舰"加速到"月度旗舰"了。这对消费者是好事,但也意味着你现在选的模型,下个月可能就不再是性价比最优了。


把话说明白

回到开头那个问题:"这 API 账单能不能便宜点?"

答案是:能,而且便宜得超出预期。 V4-Pro 的定价在当前市场上确实是碾压级的——同等质量的工作负载花不到 Fable 5 的零头,这不是营销话术,是定价页上白纸黑字的数字。Reuters 引用研究机构的结论也说"DeepSeek 是知名模型中运行成本最低的"。

但"便宜"和"好用"之间还有一段路。Agent 能力暴涨的数据目前只有 DeepSeek 自己在说,benchable.ai 空空如也,社区实测也有"十二美分跑出 bug"的案例。V4-Pro 在编程基准上的实力(LiveCodeBench 全场最高、Codeforces 领先 GPT-5.4)是多方验证过的;但 0813 新增的 Agent 提升是否如报所述,还需要时间检验。

一个务实的做法:先用起来,用你自己的真实工作负载测,别只看跑分表。 DeepSeek Chat 是免费的,API 成本低到你可以在 max reasoning 下跑几十轮都不心疼。如果在你自己的任务上 V4-Pro 的表现够用——那这个价格就是真的香。如果在你的场景下频繁出 bug 或者速度慢到影响效率——那再便宜也不值。

毕竟,AI 模型是非确定性系统。你的场景、你的 prompt、你的任务复杂度,才是最终的决定因素。跑分表只是参考——而参考的价值,取决于参考本身站不站得住。


参考来源


作者:lusca
版本:lusca-report-blog v1.0.0
出处:https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-report-blog

相关文章
|
7天前
|
存储 弹性计算 缓存
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
本文更新了2026年阿里云全系列云服务器租赁活动报价,所有特惠资源均可前往阿里云活动中心选购,整体覆盖从个人入门到企业级高性能场景的全梯度需求。其中轻量应用服务器主打极致性价比,2核2G峰值200M带宽配置每日10点、15点限时抢购价仅38元/年,2核4G配置379元/年起;高性价比的经济型e实例、通用算力型u2i实例覆盖2核4G至4核32G全档位,适配开发测试与中小型企业业务;搭载英特尔至强6处理器的第九代c9i企业级实例算力较上代提升20%,支撑高并发生产环境,不同实例规格价差清晰,用户可根据自身业务负载与预算灵活选型。
1771 117
|
8天前
|
人工智能 程序员 API
Codex 接入 DeepSeek-V4-Flash:还能补上识图,提供两套方案
Codex 接入 DeepSeek-V4-Flash 怎么配?本文覆盖 CLI 与桌面端,再用 qwen3-vl-flash 补识图,两套方案可直接照做
1293 11
|
14天前
|
云安全 人工智能 运维
阿里云联动百位企业安全专家,共识Agent防御最佳实践
当Agent成为新员工,你的安全边界在哪里?
1960 9
阿里云联动百位企业安全专家,共识Agent防御最佳实践
|
8天前
|
编解码 人工智能 安全
2核4G/4核8G/8核16G阿里云服务器如何选择实例?经济型e、通用算力型u2i与计算型c9i选哪个?
本文介绍了阿里云2核4G、4核8G、8核16G三档主流配置下经济型e、通用算力型u2i和计算型c9i三种实例的最新活动价格与适用场景。同配置下三者价差显著,以2核4G为例,经济型e低至599.93元/年,计算型c9i则高达1742.08元/年。文章详细解析了各实例的性能定位:经济型e适合轻负载入门场景,u2i兼顾稳定算力与性价比,c9i凭借第9代至强处理器与芯片级安全能力支撑高性能业务。同时提示用户可叠加满减优惠券享受折上折,建议根据业务负载与预算综合决策。
544 112
缓存 安全 IDE
1119 2
|
20天前
|
人工智能 前端开发 Linux
Codex 桌面版安装 + CC Switch 接入第三方 API 完整教程(2026 最新)
2026最新教程:手把手教你安装Codex桌面版,通过CC Switch v3.17.0一键接入Fenno等国产API(兼容OpenAI Responses格式),跳过账号登录,完整启用代码审查、多步任务与上下文感知功能。零基础友好,全程图文实操。(239字)
3018 4
|
8天前
|
人工智能 JSON Shell
2026AI漫剧本地全开源方案(附各个软件模型链接),8G显卡也能流畅运行
这是一套完全本地化部署的AI漫剧生成技术链路:涵盖LLM剧本分镜生成、FLUX文生图(IP-Adapter人脸锁定)、StoryDiffusion时序连贯控制、LTX-2.3唇形同步视频生成,及ComfyUI全流程调度。零云端费用,仅耗硬件算力,单集2–4小时可产出竖屏短视频,适配抖音/B站分发。
|
5天前
|
编解码 弹性计算 云计算
MiniMax-H3 视频生成模型 — 一键部署与使用指南
MiniMax-H3是MiniMax开源的33B全模态视频生成模型,支持文生视频、图生视频、参考生视频三种模式,原生输出2K/15秒带立体声音频视频,已原生适配ComfyUI,并可通过阿里云计算巢一键部署。(239字)
|
13天前
|
存储 人工智能 关系型数据库
阿里云AI产品与云产品最新组合套餐:Token Plan、AI coding及云服务器和建站等组合优惠价
阿里云推出全新“算力+模型+应用”一站式云与AI组合套餐活动,覆盖从个人开发者到中大型企业的全场景需求。核心亮点为分三档定价的Token Plan订阅服务,支持Qwen3.8-Max-Preview大模型调用,错峰时段最低可享0.2折优惠。活动同步推出AI Coding、智能体部署、云电脑托管、0代码建站等十余类场景化组合,搭配99元/年的普惠云服务器、88元/年的入门数据库等经典特惠产品,还为企业提供1V1定制化AI转型方案,大幅降低了不同用户群体拥抱AI的技术门槛与采购成本。
755 111

热门文章

最新文章