大家好,我是晚安code。
8 月 12 日深夜,DeepSeek V4 Pro 悄悄转正了。没有发布会,没有预告,你打开定价页才发现模型版本号已经变成 DeepSeek-V4-Pro-0813。同一晚,马斯克的 Grok 4.6 也在抢头条,两件事撞车,被媒体戏称为「梁文锋对垒马斯克」。
这篇评测我打算从价格、能力、跑分可信度三个角度,把 V4 Pro 正式版拆开讲清楚,最后给你一句实在话:现在到底该不该切。收藏备用,下面开始。
一、官宣得很低调:更新个定价页就算发布了
DeepSeek V4 Pro 这次转正,走的是「静默上线」路线——官方没开发布会,只在 8 月 12 日深夜更新了 API 文档和定价页,调用模型名 deepseek-v4-pro 保持不变。老用户什么都不用改,后端已经悄悄换成了新版。
这也是 V4 系列的最后一块拼图。7 月 31 日 V4 Flash 刚转正,这次轮到 Pro。接口上和 Flash 完全对齐:OpenAI 格式和 Anthropic 格式两套 API 都支持,Responses API、Tool Calls、JSON Output、Codex 接入也都在。(2026 年 8 月 12 日上线,以官方文档为准)
二、先算价格账:输出 6 元,只有 Fable 5 的六十分之一
价格,是这次 V4 Pro 正式版最锋利的武器。官方定价按每百万 token 算:
| 计费项 | V4 Pro 正式版 | V4 Flash 正式版 |
|---|---|---|
| 输入(缓存未命中) | 3 元 | 1 元 |
| 输入(缓存命中) | 0.025 元 | 0.02 元 |
| 输出 | 6 元 | 2 元 |
| 并发限制 | 500 | 2500 |
放海外一比,差距更夸张:Fable 5 输出约 360 元/百万 token,V4 Pro 的 6 元正好是它的六十分之一;对比 Opus 5(约 180 元)是三十分之一。
缓存命中:同一段提示词反复请求时,系统直接复用之前算好的结果,不用重新推理,所以便宜到 0.025 元/百万 token。你可以理解为「熟人生意,打个折」。
我按自己最日常的场景算过一笔账:每天把几百段代码丢给模型做 review,假设一天烧 20 万输出 token,用 Fable 5 要 72 元,换成 V4 Pro 只要 1.2 元——一个月就差两千多块,一年差出一辆二手电驴。


但这里有个坑要说:官方已经在定价页挂出预告,「计划近期整体上调 API 服务定价,预计涨幅较大」,还预告了峰谷计费,高峰期(9:00-12:00、14:00-18:00)价格直接翻倍,V4 Pro 高峰输出会到 12 元。所以现在的低价,大概率是上线初期的「临时价格战」——像楼下面馆开业首周买一送一,等客流量上来,价格就回去了。

三、能力:1M 上下文 + 384K 输出,Agent 是重头
能力上,1M 上下文和 Agent 增强是这次实打实的两个升级点。
上下文窗口:模型一次能「记住」多少内容,单位是 token。V4 Pro 支持 100 万 token 上下文,最大输出 384K token——相当于一次读完一本近百万字的长篇小说,再让它一口气写满三分之一本。实际价值是:大型代码仓库、整本技术文档可以直接整个塞进去,省掉以前切块、上 RAG 的中间步骤。
另一个重点是 Agent。
Agent(智能体):大模型不只会回答,还能自己规划步骤、调用工具、一步步完成任务。你可以理解为「雇了个能自己动手的小助理,而不是只会动嘴的顾问」。

这次正式版被媒体点名的核心升级就是 Agent。第三方机构 SemiAnalysis 的测试显示,V4 Pro 和 Flash 在 Agent 相关测试中甩开了参数量更大的英伟达 Nemotron 3 Ultra。而且因为兼容 Anthropic API 格式,Claude Code 这类工具理论上改一行 base_url 就能接上 DeepSeek 后端,社区已经有人在这么干了。
四、跑分:直逼 Fable 5,但三个槽点要看清
跑分数字,一半是真相,一半是营销。官方公布的对比表(注意:全为 DeepSeek 自报,未经第三方验证):
| 基准测试 | V4 Pro 0813 | Fable 5 | Opus 4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 87.9 | 88.0 | 85.0 |
| CyberGym(AI 安全) | 83.3 | 83.1 | 78.3 |
| DeepSWE(软件工程) | 62.7 | 70.0 | 58.0 |

三个亮点:Terminal Bench 2.1 只差 Fable 5 0.1 分;DeepSWE 从预览版的 12.8 一路涨到 62.7,翻了近 5 倍,还反超了 Opus 4.8;CyberGym 直接反超 Fable 5。官方还公布了 AutomationBench、HLE、DSBench 等更多指标,整体趋势接近,个别项反超。
三个槽点我也得说清楚:
- 跑分全是 DeepSeek 自家 harness 测的,目前没有第三方完整复现;
- DSBench 系列属于「自家考题」,题目和验证器都没公开,公允性存疑;
- 社区有反馈:长时间连续执行时,会出现提前停止、反复思考、任务质量不稳定的情况。
所以「逼近 Fable 5」这句话,我建议你打八折听——价格是白纸黑字骗不了人,能力就得自己上手验。

可能有人会问:跑分都是 DeepSeek 自己测的,那到底该不该信?
别全信,也别全不信。价格看定价页就行,能力就用下面的接口自己跑几个真实任务。我的习惯是先拿它跑一周我自己项目的真实任务,再决定要不要上生产。
想自己复现?官方接口就能测(模型名 deepseek-v4-pro):
curl https://api.deepseek.com/v1/chat/completions \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{"role": "user", "content": "列出 10 个 TODO 型 API 的错误处理最佳实践"}
]
}'

五、结论:谁该切,谁再等等
我的结论一句话:预算敏感、能接受自测的团队,现在就能切——先把低风险调用切过去,别一天内把全部生产流量压上去。V4 Pro 这次赢在价格和性价比,不是赢在「全面碾压 Fable 5」。
我是晚安code,持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊:你打算什么时候把生产流量切到 DeepSeek V4 Pro,还是先观望等第三方跑分?