DeepSeek-V4-Pro 正式版深夜突袭:Agent 评测暴涨 50 分,一套代码通吃 OpenAI 与 Anthropic 双生态

简介: JeecgBoot AI专题研究 DeepSeekV4Pro 正式版全面拆解——Agent 能力跃迁、双 API 兼容与缓存降本实战![DeepSeekV4Pro 正式版发布概念图](https://oscimg.oschina.net/oscnet/up45eab3ac316682157a43

JeecgBoot AI专题研究 | DeepSeek-V4-Pro 正式版全面拆解——Agent 能力跃迁、双 API 兼容与缓存降本实战


DeepSeek-V4-Pro 正式版发布概念图

8 月 13 日凌晨,如果你睡前习惯刷一眼 DeepSeek 的 API 文档,会发现自己差点错过一场没有请柬的发布。

没有发布会、没有倒计时、没有铺天盖地的预热海报。官网的 API 文档悄悄刷新了:模型还是那个 deepseek-v4-pro,价格页的代号却已经从 Preview 换成了 DeepSeek-V4-Pro-0813,fingerprint 更新为 fp_v4pro_20260812。等到社区炸开锅,已经是第二天早上的事。

距离 4 月 24 日预览版上线,刚好 111 天。这 111 天里,Kimi K3 高调发布抢走了开源头条,V4 Flash 正式版抢先一步在 7 月 31 日上线,官方还放出了"近期整体上调 API 定价、预计涨幅较大"的预告。所有人都在等 Pro 的正式版——结果它在一个周三的深夜,用最 DeepSeek 的方式登场:官方一个字没发,API 先能调了。

后训练换了个大脑:从"会考试"到"会干活"

先说硬规格:架构和预览版完全一致——1.6T 总参数、49B 激活参数的 MoE 结构,1M 上下文窗口,384K 最大输出。变化的全部集中在后训练,而幅度大到像换了一个模型。

真正夸张的数字来自 Agent 相关评测。几个关键基准的跃迁幅度如下:

评测集 Preview 分数 正式版分数 提升幅度
DeepSWE(软件工程) 12.8 62.7 +49.9
DSBench-Hard 31.1 67.2 +36.1
Cybergym(安全攻防) 52.7 83.3 +30.6
AutomationBench 12.8 31.8 +19.0
Terminal Bench 72.1 87.9 +15.8

Agent 评测分数大幅跃升

这些评测没有一道是传统选择题或文本生成题,全是真实环境下的多步骤任务:终端操作、仓库级代码生成、工具调用、安全模拟。它们恰好也是预览版最容易翻车的地方——此前 V4-Pro-Preview 的 Agent 能力被普遍认为"鸡肋",跑基准还行,真让它下场干活就露馅。

从 V4 Flash 正式版的更新日志可以推断出这轮升级的思路:面向代码 Agent 场景的大规模后训练。Flash 版已经用同一套方法把 Agent 能力做到了"基准测试远超 V4-Pro-Preview"的程度,Pro 正式版只是补上了同一课。如此幅度的跃迁不太可能来自单一优化,更可能是整套 Agent 后训练管线换了底层范式——大规模合成工具调用轨迹、强化规划与反思能力、以及把 1M 上下文真正用起来,让模型在长链路任务里"看到全局"。

一句话总结这个变化:如果说预览版是会考试的学霸,正式版就是能下场干活的实习生。

图像推理补课:Agent 的"眼睛"到货了

另一个被很多人忽略的变化是多模态。预览版是纯文本模型,正式版首次原生支持图像推理——DeepThink 引擎现在可以在同一个思考流程里分析图片、解读截图、处理混合文档。

这对普通聊天场景影响不大,但对 Agent 场景是从无到有的突破:截图分析 UI 状态、读取图表数据、解析文档扫描件,这些"看图干活"的需求过去只能靠外挂视觉模型凑合,现在一条链路就能完成。补齐视觉能力之后,Agent 栈才第一次凑齐了"眼、脑、手"三件套。

双生态接口:Claude 代码改个 baseURL 就能跑

开发者体验是这次升级里最容易被忽视、但也最锋利的一刀。

正式版同时提供 OpenAI 与 Anthropic 两套兼容接口,外加 Responses API 正式支持:

  • OpenAI 兼容:原有 base_url 不用动,把 model 改成 deepseek-v4-pro 即可;
  • Anthropic 兼容:通过 api.deepseek.com/anthropic 端点接入,原本基于 Claude 构建的 Agent 流水线几乎无需改动;
  • Responses API:可无缝对接 Codex 类工具链;
  • 原生 Tool Calls / JSON Output:结构化输出开箱即用;
  • FIM 补全(Beta)与对话前缀续写(Beta):分别面向 IDE 补全和长对话连续性优化(FIM 仅限非思考模式)。

双 API 生态兼容示意图

翻译成人话:你之前给 Claude 写的整套代码,改一个 baseURL 就能直接喂给 v4-pro。不管你此前的技术栈是 OpenAI 还是 Anthropic,迁移成本约等于零。这种"生态兼容"策略比单纯堆参数更能撬动存量开发者——毕竟让工程师换模型的最大阻力从来不是模型好坏,而是改代码的成本。

用 OpenAI SDK 调用只需改两处:

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_KEY",
    base_url="https://api.deepseek.com",
)

resp = client.chat.completions.create(
    model="deepseek-v4-pro",  # 默认 thinking 模式
    messages=[
        {
   "role": "system", "content": "你是资深代码审查专家。"},
        {
   "role": "user", "content": "审查下面这段 5000 行的 Django 视图代码,指出潜在性能瓶颈。"}
    ],
    max_tokens=8192,
)

print(resp.choices[0].message.content)

如需非思考模式,把 model 换成 deepseek-v4-pro-no-think 即可。

Anthropic 生态同理:

from anthropic import Anthropic

client = Anthropic(
    api_key="YOUR_DEEPSEEK_KEY",
    base_url="https://api.deepseek.com/anthropic",
)

msg = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{
   "role": "user", "content": "将这份 80 万 tokens 的日志文件压缩为 10 条关键错误摘要。"}]
)

print(msg.content[0].text)

缓存杠杆:0.025 元背后的 120 倍差距

价格方面,每百万 token 输入 3 元、输出 6 元,与预览期持平。但真正值得盯的不是裸价,而是缓存命中价——0.025 元/百万 token,基本等于白嫖。

缓存机制大幅降低调用成本

把 Pro 和 Flash 摆在一起看:

模型 缓存命中输入 缓存未命中输入 输出 并发上限
DeepSeek-V4-Pro-0813 0.025 3 6 500
DeepSeek-V4-Flash-0731 0.02 1 2 2500

两个关键信息:Pro 的裸价是 Flash 的 3 倍,但缓存命中价几乎持平;并发上限从 2500 砍到 500,说明官方用并发配额做算力调度,把 Pro 定位成高价值、低频次的复杂任务模型。

缓存策略的实际威力在于长文档场景——同一份系统提示 + 大文档反复提问,输入成本从 3 元/百万直接降到 0.025 元/百万,相差 120 倍:

SYSTEM = "你是合同审查助手,按风险等级标注异常条款。"
DOC = open("huge_contract.txt", encoding="utf-8").read()  # 约 900k tokens

questions = [
    "列出所有违约责任条款。",
    "找出金额超过 500 万的支付节点。",
    "汇总所有不可抗力的定义。",
]

for q in questions:
    resp = client.chat.completions.create(
        model="deepseek-v4-pro",
        messages=[
            {
   "role": "system", "content": SYSTEM},
            {
   "role": "user", "content": f"{DOC}\n\n问题:{q}"}
        ],
        max_tokens=4096,
    )
    print(q, "→", resp.choices[0].message.content[:100], "...")

首次请求缓存前缀(系统提示+文档),后续命中缓存,输入成本直降。

thinking 模式的甜蜜陷阱:一次真实的翻车

跑分好看只是门票,真正有意思的是拿真实任务去试。三个不同方向的实测任务,暴露了一个非常反直觉的坑。

任务一:Boids 群体涌现模拟。 要求在 Canvas 上实现 200 个三角形 boid 的群体行为,带分离/对齐/凝聚三个可调参数、彩色轨迹、点击生成捕食者、glassmorphism 风格控制面板。V4 Pro 用了大约 170 秒生成 761 行完整 HTML,打开浏览器,200 个彩色三角形在黑色背景上游动、聚散、避障,代码一次运行通过。

任务二:模糊需求的番茄钟。 只给了一句"我想要一个好看的番茄钟工作面板",方向是"能计时、能记录、有白噪音、中文界面、要有质感"。V4 Pro 交回来 1223 行代码——除了基础的 25/5 分钟计时,它自己加了任务标签、专注统计图表、快捷键支持,甚至用 Web Audio API 从零合成了几种白噪音。对模糊需求的产品化补全能力,比预览版有明显进步。

任务三:寻路算法可视化,翻车了——但翻得很有教育意义。 任务要求实现 BFS、DFS、A* 三种算法的逐步动画、可交互网格画墙、迷宫自动生成。开着默认的 thinking 模式,V4 Pro 用满了 16384 个 token 的输出配额,其中 13394 个花在了"思考"上,留给实际代码的不到 3000 个 token——HTML 写到一半直接截断。

关掉 thinking 模式重跑,54 秒输出完整的 715 行代码,寻路动画、迷宫生成、暗色主题一应俱全。

这不是 bug,而是正式版的一个真实特征:thinking 模式在复杂代码生成场景下,推理 token 可能占到输出的 80% 以上,反而挤压了实际内容的空间。对于需要大段代码输出的任务,要么主动关闭 thinking,要么大幅提高 max_tokens 兜底。这个经验值得所有准备在生产环境接入 v4-pro 的团队记住。

涨价倒计时与 Harness 伏笔

最后说两个值得长期关注的点。

其一,8 月 6 日官方已经预告"计划近期整体上调 API 定价,预计涨幅较大",目前 0813 版本还没动。窗口期能撑多久不好说,有长期使用计划的团队,建议尽早评估缓存策略和用量分配,把长文档复用场景的缓存命中率做上去,这是对冲涨价最现实的手段。

其二,横向看位置:V4 Pro 不是一张"全面碾压"的成绩单——HLE 无工具 42.7 分,落后 Claude Opus 4.8 的 49.8 和 Fable 5 的 53.3;NL2Repo 61.5 落后 Opus 4.8 的 69.7。纯知识推理和最复杂的软件工程任务还没坐上头把交椅。但 DeepSeek 从来不是靠"最强"赢的:输入 3 元/百万 token,大约是 Fable 5 的十分之一、Kimi K3 的三分之一。在 Agent 能力补齐到第一梯队之后,"比我强的没我便宜,比我便宜的没我强"这条定律的杀伤力大了一个量级。

更值得盯的是 V4 Flash 更新日志里的一行小字——评测使用了"DeepSeek Harness 极简模式(即将发布)"作为 Agent 框架。结合近期注册的"DeepSeek Harness 团队"公众号与招聘信息,DeepSeek 显然在准备把模型和 Agent 运行框架打包推出。如果过去两年大家竞争的是"谁的模型更聪明",Harness 的出现意味着竞争进入下一阶段:比谁能把大脑、手脚和工具箱组装成一个真正替人干活的系统。


总结

DeepSeek-V4-Pro 正式版这次升级,核心就一句话:Agent 能力从"几乎不可用"一跃进入第一梯队,同时用双生态兼容把迁移成本压到零。

  • 架构没变,后训练重构:DeepSWE 从 12.8 到 62.7,Agent 相关基准全面暴涨;
  • 首次原生图像推理,Agent 的"眼睛"到货;
  • OpenAI + Anthropic 双格式 + Responses API,存量代码零成本迁移;
  • 缓存命中价 0.025 元,长文档复用场景成本差 120 倍;
  • 实战提醒:复杂代码生成慎用 thinking 模式,或留足 max_tokens;
  • 涨价预警已亮,缓存策略要提前做。

这场没有发布会的发布,或许才是 AI 竞争进入"干活时代"的真正发令枪。


本文为 JeecgBoot AI 专题研究系列文章。

目录
相关文章
|
8天前
|
存储 弹性计算 缓存
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
本文更新了2026年阿里云全系列云服务器租赁活动报价,所有特惠资源均可前往阿里云活动中心选购,整体覆盖从个人入门到企业级高性能场景的全梯度需求。其中轻量应用服务器主打极致性价比,2核2G峰值200M带宽配置每日10点、15点限时抢购价仅38元/年,2核4G配置379元/年起;高性价比的经济型e实例、通用算力型u2i实例覆盖2核4G至4核32G全档位,适配开发测试与中小型企业业务;搭载英特尔至强6处理器的第九代c9i企业级实例算力较上代提升20%,支撑高并发生产环境,不同实例规格价差清晰,用户可根据自身业务负载与预算灵活选型。
1799 118
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
|
9天前
|
人工智能 程序员 API
Codex 接入 DeepSeek-V4-Flash:还能补上识图,提供两套方案
Codex 接入 DeepSeek-V4-Flash 怎么配?本文覆盖 CLI 与桌面端,再用 qwen3-vl-flash 补识图,两套方案可直接照做
1356 11
|
15天前
|
云安全 人工智能 运维
阿里云联动百位企业安全专家,共识Agent防御最佳实践
当Agent成为新员工,你的安全边界在哪里?
1962 9
阿里云联动百位企业安全专家,共识Agent防御最佳实践
|
9天前
|
编解码 人工智能 安全
2核4G/4核8G/8核16G阿里云服务器如何选择实例?经济型e、通用算力型u2i与计算型c9i选哪个?
本文介绍了阿里云2核4G、4核8G、8核16G三档主流配置下经济型e、通用算力型u2i和计算型c9i三种实例的最新活动价格与适用场景。同配置下三者价差显著,以2核4G为例,经济型e低至599.93元/年,计算型c9i则高达1742.08元/年。文章详细解析了各实例的性能定位:经济型e适合轻负载入门场景,u2i兼顾稳定算力与性价比,c9i凭借第9代至强处理器与芯片级安全能力支撑高性能业务。同时提示用户可叠加满减优惠券享受折上折,建议根据业务负载与预算综合决策。
547 113
|
6天前
|
编解码 弹性计算 云计算
MiniMax-H3 视频生成模型 — 一键部署与使用指南
MiniMax-H3是MiniMax开源的33B全模态视频生成模型,支持文生视频、图生视频、参考生视频三种模式,原生输出2K/15秒带立体声音频视频,已原生适配ComfyUI,并可通过阿里云计算巢一键部署。(239字)
|
21天前
|
人工智能 前端开发 Linux
Codex 桌面版安装 + CC Switch 接入第三方 API 完整教程(2026 最新)
2026最新教程:手把手教你安装Codex桌面版,通过CC Switch v3.17.0一键接入Fenno等国产API(兼容OpenAI Responses格式),跳过账号登录,完整启用代码审查、多步任务与上下文感知功能。零基础友好,全程图文实操。(239字)
3168 4
|
9天前
|
人工智能 JSON Shell
2026AI漫剧本地全开源方案(附各个软件模型链接),8G显卡也能流畅运行
这是一套完全本地化部署的AI漫剧生成技术链路:涵盖LLM剧本分镜生成、FLUX文生图(IP-Adapter人脸锁定)、StoryDiffusion时序连贯控制、LTX-2.3唇形同步视频生成,及ComfyUI全流程调度。零云端费用,仅耗硬件算力,单集2–4小时可产出竖屏短视频,适配抖音/B站分发。
|
7天前
|
人工智能 API 开发工具
2026 零基础本地 AI 漫剧完整实操教程(8G 笔记本显卡可用|附可直接复制命令与代码)
本方案提供完全离线、本地运行的漫剧全自动制作流程:RTX3060/4050 8G显卡即可驱动,涵盖Qwen写分镜→ComfyUI统一角色绘图→LTX2.3图生微动画→Qwen3-TTS本地配音→FFmpeg自动合成,全程无水印、免API、不限次。专为低显存优化,解决变脸、闪烁、爆内存三大痛点。(239字)

热门文章

最新文章