DeepSeek-V4-Pro 正式版深夜突袭:Agent 评测暴涨 50 分,一套代码通吃 OpenAI 与 Anthropic 双生态

简介: JeecgBoot AI专题研究 DeepSeekV4Pro 正式版全面拆解——Agent 能力跃迁、双 API 兼容与缓存降本实战![DeepSeekV4Pro 正式版发布概念图](https://oscimg.oschina.net/oscnet/up45eab3ac316682157a43

JeecgBoot AI专题研究 | DeepSeek-V4-Pro 正式版全面拆解——Agent 能力跃迁、双 API 兼容与缓存降本实战


DeepSeek-V4-Pro 正式版发布概念图

8 月 13 日凌晨,如果你睡前习惯刷一眼 DeepSeek 的 API 文档,会发现自己差点错过一场没有请柬的发布。

没有发布会、没有倒计时、没有铺天盖地的预热海报。官网的 API 文档悄悄刷新了:模型还是那个 deepseek-v4-pro,价格页的代号却已经从 Preview 换成了 DeepSeek-V4-Pro-0813,fingerprint 更新为 fp_v4pro_20260812。等到社区炸开锅,已经是第二天早上的事。

距离 4 月 24 日预览版上线,刚好 111 天。这 111 天里,Kimi K3 高调发布抢走了开源头条,V4 Flash 正式版抢先一步在 7 月 31 日上线,官方还放出了"近期整体上调 API 定价、预计涨幅较大"的预告。所有人都在等 Pro 的正式版——结果它在一个周三的深夜,用最 DeepSeek 的方式登场:官方一个字没发,API 先能调了。

后训练换了个大脑:从"会考试"到"会干活"

先说硬规格:架构和预览版完全一致——1.6T 总参数、49B 激活参数的 MoE 结构,1M 上下文窗口,384K 最大输出。变化的全部集中在后训练,而幅度大到像换了一个模型。

真正夸张的数字来自 Agent 相关评测。几个关键基准的跃迁幅度如下:

评测集 Preview 分数 正式版分数 提升幅度
DeepSWE(软件工程) 12.8 62.7 +49.9
DSBench-Hard 31.1 67.2 +36.1
Cybergym(安全攻防) 52.7 83.3 +30.6
AutomationBench 12.8 31.8 +19.0
Terminal Bench 72.1 87.9 +15.8

Agent 评测分数大幅跃升

这些评测没有一道是传统选择题或文本生成题,全是真实环境下的多步骤任务:终端操作、仓库级代码生成、工具调用、安全模拟。它们恰好也是预览版最容易翻车的地方——此前 V4-Pro-Preview 的 Agent 能力被普遍认为"鸡肋",跑基准还行,真让它下场干活就露馅。

从 V4 Flash 正式版的更新日志可以推断出这轮升级的思路:面向代码 Agent 场景的大规模后训练。Flash 版已经用同一套方法把 Agent 能力做到了"基准测试远超 V4-Pro-Preview"的程度,Pro 正式版只是补上了同一课。如此幅度的跃迁不太可能来自单一优化,更可能是整套 Agent 后训练管线换了底层范式——大规模合成工具调用轨迹、强化规划与反思能力、以及把 1M 上下文真正用起来,让模型在长链路任务里"看到全局"。

一句话总结这个变化:如果说预览版是会考试的学霸,正式版就是能下场干活的实习生。

图像推理补课:Agent 的"眼睛"到货了

另一个被很多人忽略的变化是多模态。预览版是纯文本模型,正式版首次原生支持图像推理——DeepThink 引擎现在可以在同一个思考流程里分析图片、解读截图、处理混合文档。

这对普通聊天场景影响不大,但对 Agent 场景是从无到有的突破:截图分析 UI 状态、读取图表数据、解析文档扫描件,这些"看图干活"的需求过去只能靠外挂视觉模型凑合,现在一条链路就能完成。补齐视觉能力之后,Agent 栈才第一次凑齐了"眼、脑、手"三件套。

双生态接口:Claude 代码改个 baseURL 就能跑

开发者体验是这次升级里最容易被忽视、但也最锋利的一刀。

正式版同时提供 OpenAI 与 Anthropic 两套兼容接口,外加 Responses API 正式支持:

  • OpenAI 兼容:原有 base_url 不用动,把 model 改成 deepseek-v4-pro 即可;
  • Anthropic 兼容:通过 api.deepseek.com/anthropic 端点接入,原本基于 Claude 构建的 Agent 流水线几乎无需改动;
  • Responses API:可无缝对接 Codex 类工具链;
  • 原生 Tool Calls / JSON Output:结构化输出开箱即用;
  • FIM 补全(Beta)与对话前缀续写(Beta):分别面向 IDE 补全和长对话连续性优化(FIM 仅限非思考模式)。

双 API 生态兼容示意图

翻译成人话:你之前给 Claude 写的整套代码,改一个 baseURL 就能直接喂给 v4-pro。不管你此前的技术栈是 OpenAI 还是 Anthropic,迁移成本约等于零。这种"生态兼容"策略比单纯堆参数更能撬动存量开发者——毕竟让工程师换模型的最大阻力从来不是模型好坏,而是改代码的成本。

用 OpenAI SDK 调用只需改两处:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_KEY",
    base_url="https://api.deepseek.com",
)

resp = client.chat.completions.create(
    model="deepseek-v4-pro",  # 默认 thinking 模式
    messages=[
        {
   "role": "system", "content": "你是资深代码审查专家。"},
        {
   "role": "user", "content": "审查下面这段 5000 行的 Django 视图代码,指出潜在性能瓶颈。"}
    ],
    max_tokens=8192,
)

print(resp.choices[0].message.content)

如需非思考模式,把 model 换成 deepseek-v4-pro-no-think 即可。

Anthropic 生态同理:

from anthropic import Anthropic

client = Anthropic(
    api_key="YOUR_DEEPSEEK_KEY",
    base_url="https://api.deepseek.com/anthropic",
)

msg = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{
   "role": "user", "content": "将这份 80 万 tokens 的日志文件压缩为 10 条关键错误摘要。"}]
)

print(msg.content[0].text)

缓存杠杆:0.025 元背后的 120 倍差距

价格方面,每百万 token 输入 3 元、输出 6 元,与预览期持平。但真正值得盯的不是裸价,而是缓存命中价——0.025 元/百万 token,基本等于白嫖。

缓存机制大幅降低调用成本

把 Pro 和 Flash 摆在一起看:

模型 缓存命中输入 缓存未命中输入 输出 并发上限
DeepSeek-V4-Pro-0813 0.025 3 6 500
DeepSeek-V4-Flash-0731 0.02 1 2 2500

两个关键信息:Pro 的裸价是 Flash 的 3 倍,但缓存命中价几乎持平;并发上限从 2500 砍到 500,说明官方用并发配额做算力调度,把 Pro 定位成高价值、低频次的复杂任务模型。

缓存策略的实际威力在于长文档场景——同一份系统提示 + 大文档反复提问,输入成本从 3 元/百万直接降到 0.025 元/百万,相差 120 倍:

SYSTEM = "你是合同审查助手,按风险等级标注异常条款。"
DOC = open("huge_contract.txt", encoding="utf-8").read()  # 约 900k tokens

questions = [
    "列出所有违约责任条款。",
    "找出金额超过 500 万的支付节点。",
    "汇总所有不可抗力的定义。",
]

for q in questions:
    resp = client.chat.completions.create(
        model="deepseek-v4-pro",
        messages=[
            {
   "role": "system", "content": SYSTEM},
            {
   "role": "user", "content": f"{DOC}\n\n问题:{q}"}
        ],
        max_tokens=4096,
    )
    print(q, "→", resp.choices[0].message.content[:100], "...")

首次请求缓存前缀(系统提示+文档),后续命中缓存,输入成本直降。

thinking 模式的甜蜜陷阱:一次真实的翻车

跑分好看只是门票,真正有意思的是拿真实任务去试。三个不同方向的实测任务,暴露了一个非常反直觉的坑。

任务一:Boids 群体涌现模拟。 要求在 Canvas 上实现 200 个三角形 boid 的群体行为,带分离/对齐/凝聚三个可调参数、彩色轨迹、点击生成捕食者、glassmorphism 风格控制面板。V4 Pro 用了大约 170 秒生成 761 行完整 HTML,打开浏览器,200 个彩色三角形在黑色背景上游动、聚散、避障,代码一次运行通过。

任务二:模糊需求的番茄钟。 只给了一句"我想要一个好看的番茄钟工作面板",方向是"能计时、能记录、有白噪音、中文界面、要有质感"。V4 Pro 交回来 1223 行代码——除了基础的 25/5 分钟计时,它自己加了任务标签、专注统计图表、快捷键支持,甚至用 Web Audio API 从零合成了几种白噪音。对模糊需求的产品化补全能力,比预览版有明显进步。

任务三:寻路算法可视化,翻车了——但翻得很有教育意义。 任务要求实现 BFS、DFS、A* 三种算法的逐步动画、可交互网格画墙、迷宫自动生成。开着默认的 thinking 模式,V4 Pro 用满了 16384 个 token 的输出配额,其中 13394 个花在了"思考"上,留给实际代码的不到 3000 个 token——HTML 写到一半直接截断。

关掉 thinking 模式重跑,54 秒输出完整的 715 行代码,寻路动画、迷宫生成、暗色主题一应俱全。

这不是 bug,而是正式版的一个真实特征:thinking 模式在复杂代码生成场景下,推理 token 可能占到输出的 80% 以上,反而挤压了实际内容的空间。对于需要大段代码输出的任务,要么主动关闭 thinking,要么大幅提高 max_tokens 兜底。这个经验值得所有准备在生产环境接入 v4-pro 的团队记住。

涨价倒计时与 Harness 伏笔

最后说两个值得长期关注的点。

其一,8 月 6 日官方已经预告"计划近期整体上调 API 定价,预计涨幅较大",目前 0813 版本还没动。窗口期能撑多久不好说,有长期使用计划的团队,建议尽早评估缓存策略和用量分配,把长文档复用场景的缓存命中率做上去,这是对冲涨价最现实的手段。

其二,横向看位置:V4 Pro 不是一张"全面碾压"的成绩单——HLE 无工具 42.7 分,落后 Claude Opus 4.8 的 49.8 和 Fable 5 的 53.3;NL2Repo 61.5 落后 Opus 4.8 的 69.7。纯知识推理和最复杂的软件工程任务还没坐上头把交椅。但 DeepSeek 从来不是靠"最强"赢的:输入 3 元/百万 token,大约是 Fable 5 的十分之一、Kimi K3 的三分之一。在 Agent 能力补齐到第一梯队之后,"比我强的没我便宜,比我便宜的没我强"这条定律的杀伤力大了一个量级。

更值得盯的是 V4 Flash 更新日志里的一行小字——评测使用了"DeepSeek Harness 极简模式(即将发布)"作为 Agent 框架。结合近期注册的"DeepSeek Harness 团队"公众号与招聘信息,DeepSeek 显然在准备把模型和 Agent 运行框架打包推出。如果过去两年大家竞争的是"谁的模型更聪明",Harness 的出现意味着竞争进入下一阶段:比谁能把大脑、手脚和工具箱组装成一个真正替人干活的系统。


总结

DeepSeek-V4-Pro 正式版这次升级,核心就一句话:Agent 能力从"几乎不可用"一跃进入第一梯队,同时用双生态兼容把迁移成本压到零。

  • 架构没变,后训练重构:DeepSWE 从 12.8 到 62.7,Agent 相关基准全面暴涨;
  • 首次原生图像推理,Agent 的"眼睛"到货;
  • OpenAI + Anthropic 双格式 + Responses API,存量代码零成本迁移;
  • 缓存命中价 0.025 元,长文档复用场景成本差 120 倍;
  • 实战提醒:复杂代码生成慎用 thinking 模式,或留足 max_tokens;
  • 涨价预警已亮,缓存策略要提前做。

这场没有发布会的发布,或许才是 AI 竞争进入"干活时代"的真正发令枪。


本文为 JeecgBoot AI 专题研究系列文章。

目录
相关文章
|
20天前
|
缓存 人工智能 JSON
DeepSeek V4 Pro转正,性能逼近Fable 5,价格仅六十分之一
DeepSeek V4 Pro正式版发布:1M上下文、384K输出,价格只有Fable 5的六十分之一。本文从价格、能力、跑分可信度拆解,说清该不该切。
267 0
|
19天前
|
人工智能 缓存 前端开发
DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了
DeepSeek Harness + DeepSeek V4 Pro 项目实战保姆级教程!手把手带你从零安装开源 AI 编程工具,开发架构图、知识讲解网站、3D 网页游戏、全栈 AI 应用 4 个项目,覆盖运行模式选择、插件安装与开发,看看能不能对标 Claude。
13115 84
DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了
|
20天前
|
缓存 JSON 程序员
DeepSeek V4 Pro 正式版、Grok 4.6 同夜发布
DeepSeek V4 Pro 正式版(0813)与 Grok 4.6 同夜上线。跑分、价格、选型一次讲清,帮你判断主力 API 要不要换
DeepSeek V4 Pro 正式版、Grok 4.6 同夜发布
|
5月前
|
人工智能 缓存 BI
Claude Code + DeepSeek V4-Pro 真实评测:除了贵,没别的毛病
JeecgBoot AI专题研究 把 Claude Code 接入 DeepSeek V4Pro,跑完 Skills —— OA 审批、大屏、报表、部署 5 大实战场景后的真实体验 ![](https://oscimg.oschina.net/oscnet/up608d34aeb6bafc47f
9792 23
Claude Code + DeepSeek V4-Pro 真实评测:除了贵,没别的毛病
|
人工智能 JavaScript 开发工具
DeepSeek Harness 本地安装与使用指南
DeepSeek Harness(DSH)是DeepSeek AI开源的Agent运行框架,支持本地文件操作、命令执行与工具调用。基于Cordis插件架构,具备高扩展性与强可控性,适合开发者搭建可控Agent环境或开展模型基准测试。当前为开发者预览版,需Node.js环境,推荐先用`npx @deepseek-ai/dsh web`快速体验。
5156 0
|
2月前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
3812 142
|
2月前
|
人工智能 数据挖掘 API
Qwen3.8千问新一代旗舰模型上线:在阿里云百炼TokenPlan调用Qwen3.8-Max-Preview体验版
阿里云Qwen3.8-Max-Preview是2.4T参数旗舰预览模型,聚焦Coding与Cowork,支持多模态、长任务与智能体协作,在Token Plan享白天1折、夜间0.2折优惠,个人版39元起/月。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
|
17天前
|
开发工具 Swift git
DeepSeek Harness 插件推荐:4 款开源神器让写代码直接起飞
DeepSeek Harness 插件推荐:ModLens 视觉、Web UI 全家桶、Mac 原生与 GenUI 渲染,4 款开源插件给纯文本模型补齐短板。
2064 6
DeepSeek Harness 插件推荐:4 款开源神器让写代码直接起飞
|
3月前
|
数据采集 人工智能 文字识别
2026企业AI如何真正落地?深度拆解60+全球案例
2026年企业AI应用已告别“大模型万能论”。本文基于斯坦福《企业AI实战手册》及16家头部企业案例,提炼7条落地共性:AI须嵌入核心业务流程;高风险行业坚持“人先于AI”;数据质量决定成效上限;行业分化加剧,通用方案失效;价值重心从个人提效转向组织决策;AI需持续运营而非一次性项目;推荐以8周闭环验证真实场景,本质是经营能力的竞争。
|
网络协议 Android开发 开发工具
国内常用的Android镜像下载地址(附教育网主要镜像站)
终于建了一个自己个人小站:https://huangtianyu.gitee.io,以后优先更新小站博客,欢迎进站,O(∩_∩)O~~ Android developer 最新国内镜像:http://wear.
26464 0