DeepSeek V4 Pro转正,性能逼近Fable 5,价格仅六十分之一

简介: DeepSeek V4 Pro正式版发布:1M上下文、384K输出,价格只有Fable 5的六十分之一。本文从价格、能力、跑分可信度拆解,说清该不该切。

大家好,我是晚安code。

8 月 12 日深夜,DeepSeek V4 Pro 悄悄转正了。没有发布会,没有预告,你打开定价页才发现模型版本号已经变成 DeepSeek-V4-Pro-0813。同一晚,马斯克的 Grok 4.6 也在抢头条,两件事撞车,被媒体戏称为「梁文锋对垒马斯克」。

这篇评测我打算从价格、能力、跑分可信度三个角度,把 V4 Pro 正式版拆开讲清楚,最后给你一句实在话:现在到底该不该切。收藏备用,下面开始。

一、官宣得很低调:更新个定价页就算发布了

DeepSeek V4 Pro 这次转正,走的是「静默上线」路线——官方没开发布会,只在 8 月 12 日深夜更新了 API 文档和定价页,调用模型名 deepseek-v4-pro 保持不变。老用户什么都不用改,后端已经悄悄换成了新版。

这也是 V4 系列的最后一块拼图。7 月 31 日 V4 Flash 刚转正,这次轮到 Pro。接口上和 Flash 完全对齐:OpenAI 格式和 Anthropic 格式两套 API 都支持,Responses API、Tool Calls、JSON Output、Codex 接入也都在。(2026 年 8 月 12 日上线,以官方文档为准)

二、先算价格账:输出 6 元,只有 Fable 5 的六十分之一

价格,是这次 V4 Pro 正式版最锋利的武器。官方定价按每百万 token 算:

计费项 V4 Pro 正式版 V4 Flash 正式版
输入(缓存未命中) 3 元 1 元
输入(缓存命中) 0.025 元 0.02 元
输出 6 元 2 元
并发限制 500 2500

放海外一比,差距更夸张:Fable 5 输出约 360 元/百万 token,V4 Pro 的 6 元正好是它的六十分之一;对比 Opus 5(约 180 元)是三十分之一。

缓存命中:同一段提示词反复请求时,系统直接复用之前算好的结果,不用重新推理,所以便宜到 0.025 元/百万 token。你可以理解为「熟人生意,打个折」。

我按自己最日常的场景算过一笔账:每天把几百段代码丢给模型做 review,假设一天烧 20 万输出 token,用 Fable 5 要 72 元,换成 V4 Pro 只要 1.2 元——一个月就差两千多块,一年差出一辆二手电驴。

左贵右廉,一只钱袋一只硬币,60 倍的差距一眼可见

官方定价页截图

但这里有个坑要说:官方已经在定价页挂出预告,「计划近期整体上调 API 服务定价,预计涨幅较大」,还预告了峰谷计费,高峰期(9:00-12:00、14:00-18:00)价格直接翻倍,V4 Pro 高峰输出会到 12 元。所以现在的低价,大概率是上线初期的「临时价格战」——像楼下面馆开业首周买一送一,等客流量上来,价格就回去了。

三、能力:1M 上下文 + 384K 输出,Agent 是重头

能力上,1M 上下文和 Agent 增强是这次实打实的两个升级点。

上下文窗口:模型一次能「记住」多少内容,单位是 token。V4 Pro 支持 100 万 token 上下文,最大输出 384K token——相当于一次读完一本近百万字的长篇小说,再让它一口气写满三分之一本。实际价值是:大型代码仓库、整本技术文档可以直接整个塞进去,省掉以前切块、上 RAG 的中间步骤。

另一个重点是 Agent。

Agent(智能体):大模型不只会回答,还能自己规划步骤、调用工具、一步步完成任务。你可以理解为「雇了个能自己动手的小助理,而不是只会动嘴的顾问」。

给任务 → 调工具 → 自动完成,一条链路说清 Agent

这次正式版被媒体点名的核心升级就是 Agent。第三方机构 SemiAnalysis 的测试显示,V4 Pro 和 Flash 在 Agent 相关测试中甩开了参数量更大的英伟达 Nemotron 3 Ultra。而且因为兼容 Anthropic API 格式,Claude Code 这类工具理论上改一行 base_url 就能接上 DeepSeek 后端,社区已经有人在这么干了。

四、跑分:直逼 Fable 5,但三个槽点要看清

跑分数字,一半是真相,一半是营销。官方公布的对比表(注意:全为 DeepSeek 自报,未经第三方验证):

基准测试 V4 Pro 0813 Fable 5 Opus 4.8
Terminal Bench 2.1 87.9 88.0 85.0
CyberGym(AI 安全) 83.3 83.1 78.3
DeepSWE(软件工程) 62.7 70.0 58.0

三个亮点:Terminal Bench 2.1 只差 Fable 5 0.1 分;DeepSWE 从预览版的 12.8 一路涨到 62.7,翻了近 5 倍,还反超了 Opus 4.8;CyberGym 直接反超 Fable 5。官方还公布了 AutomationBench、HLE、DSBench 等更多指标,整体趋势接近,个别项反超。

三个槽点我也得说清楚:

  • 跑分全是 DeepSeek 自家 harness 测的,目前没有第三方完整复现;
  • DSBench 系列属于「自家考题」,题目和验证器都没公开,公允性存疑;
  • 社区有反馈:长时间连续执行时,会出现提前停止、反复思考、任务质量不稳定的情况。

所以「逼近 Fable 5」这句话,我建议你打八折听——价格是白纸黑字骗不了人,能力就得自己上手验。

可能有人会问:跑分都是 DeepSeek 自己测的,那到底该不该信?
别全信,也别全不信。价格看定价页就行,能力就用下面的接口自己跑几个真实任务。我的习惯是先拿它跑一周我自己项目的真实任务,再决定要不要上生产。

想自己复现?官方接口就能测(模型名 deepseek-v4-pro):

curl https://api.deepseek.com/v1/chat/completions \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "列出 10 个 TODO 型 API 的错误处理最佳实践"}
    ]
  }'

五、结论:谁该切,谁再等等

我的结论一句话:预算敏感、能接受自测的团队,现在就能切——先把低风险调用切过去,别一天内把全部生产流量压上去。V4 Pro 这次赢在价格和性价比,不是赢在「全面碾压 Fable 5」。


我是晚安code,持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊:你打算什么时候把生产流量切到 DeepSeek V4 Pro,还是先观望等第三方跑分?

目录
相关文章
缓存 人工智能 算法
262 0
|
4月前
|
人工智能 API Go
Qoder 工程实践:Harness Engineering 指南
Harness 是一套面向 AI Agent 的工程化框架,通过将架构约束、规范文档和自动化验证(如依赖层级检查、质量规则)编码进代码仓库,为 Agent 构建“操作系统”。它以 AGENTS.md 为入口,用预验证替代盲目编码,以子代理分工、模型分级调度和交叉 Review 保障质量,并支持自我进化——从失败中学习、沉淀记忆、编译确定性脚本。让 Agent 不靠“记住”,而靠“看见”与“验证”可靠工作。
Qoder 工程实践:Harness Engineering 指南
|
XML JSON Ubuntu
Python实用记录(十五):PyQt/PySide6打包成exe,精简版(nuitka/pyinstaller/auto-py-to-exe)
本文介绍了使用Nuitka、PyInstaller和auto-py-to-exe三种工具将Python的PyQt/PySide6应用打包成exe文件的方法。提供了详细的安装步骤、打包命令和参数说明,适合新手学习和实践。
8463 0
|
监控 流计算
Flink 指标参数源码解读(读取数量、发送数量、发送字节数、接收字节数等)(上)
Flink 指标参数源码解读(读取数量、发送数量、发送字节数、接收字节数等)(上)
444 1
|
IDE 测试技术 API
使用京东API接口适用于的环境及验证调用合法性的方法
在电商领域,京东API接口支持商品信息查询、订单处理等功能。开发者需确保在稳定服务器端环境使用,选择合适编程语言及框架,并具备足够网络带宽处理能力。开发环境应配备IDE或代码编辑器及所需库。测试环境需充分验证API稳定性与可靠性。合法性验证包括:正确使用App Key和App Secret进行鉴权;掌握签名规则并在请求中添加签名;遵守请求频率限制;理解并遵循数据使用协议。遵循这些指导原则可保证API调用的合法性和稳定性。
|
消息中间件 人工智能 监控
Go与定时任务
Go语言凭借其高效的并发能力和简洁的语法,广泛应用于分布式系统和云计算领域。本文从控制台Admin、触发器Trigger、调度器Scheduler、执行器Executor四方面,详解Go语言实现分布式定时任务的设计与代码示例。
342 0
|
存储 缓存 算法
|
25天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南
Qwen3.8-Max-Preview是通义千问Qwen3系列旗舰MoE大模型,参数达2.4万亿,综合推理能力居行业第一梯队。支持思考/快速双模式,擅长大模型五大高难场景。现于阿里云百炼Token Plan、Qoder及QoderWork上线体验,个人版低至39元/月。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
1149 1
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南

热门文章

最新文章