DeepSeek 多模态视觉理解模型上线:Agent 逼近 Opus-4.8

简介: DeepSeek 多模态视觉理解模型上线,视觉 Agent 逼近 Opus-4.8,价格与文本一致——一张图最高 0.001 元。拆解它的能力、定价与调用方式。

大家好,我是晚安code。

之前还在吐槽:DeepSeek 网页端那个"识图模式",连梁文锋都能认成张一鸣。结果 8 月 21 号,DeepSeek 多模态视觉理解模型 V4-Flash-Vision-Exp 直接上线了 API 平台——多模态 Agent 能力逼近 Opus-4.8,价格却按文本价算,一张图最高 0.001 元。这篇我把能力、benchmark、定价、调用方式一次讲清楚,看到最后你会知道它到底适不适合你。先收藏,慢慢看。

一、DeepSeek 多模态视觉理解模型到底发了什么

DeepSeek 这波不是小迭代,是 V4 系列第一次真正长出眼睛。

2026 年 8 月 21 日,DeepSeek 在官方 API 平台上线了 deepseek-v4-flash-vision-exp(来源:DeepSeek 官方 API 文档)。名字里的 Exp 是 experimental,官方明确说了,这是实验性质模型,不建议直接上生产。

多模态视觉理解模型:能同时接收文字和图片输入、并基于两者做推理的大模型。你可以理解为「AI 的眼睛」——以前只会看字,现在能看图。

这款模型的能力构成很有意思:纯文本能力(Agent、推理、世界知识)和 V4-Flash 正式版基本持平,没有因为加了视觉而降级;但一旦任务需要"看懂图片",成绩直接起飞,官方口径是多模态 Agent 能力已接近 Claude Opus-4.8。上下文窗口 1M token,最大输出 384K,支持 JSON Output、Tool Calls,还兼容 Anthropic 的 API 格式。

说回我吐槽那事。6 月网页端先上过一版"识图模式",媒体实测发现它本质是 OCR,人脸、场景全翻车。这次的 V4-Flash-Vision-Exp 是真正的视觉理解,两层是两码事——所以官方把老识图模式和技术报告连夜下线重做,也算给这次留了个干净的起跑线。

OCR(光学字符识别):从图片里"读字"而不是"看图"的技术。你可以理解为「扫描仪的眼睛」,只认文字,不认画面。

二、能不能打?一张对比表看懂「Agent 逼近 Opus-4.8」

"逼近 Opus-4.8"是官方口径,参考意义大于绝对值——这份分数是 DeepSeek 自家 Harness 框架测的,还没经过第三方独立验证。

我把官方公开的部分 benchmark 整理成表(2026-08 官方数据,V4-Flash 为 0731 版本):

基准 V4-Flash-Vision-Exp V4-Flash-0731 Opus-4.8
Terminal Bench 2.1 83.9 82.7 85.0
ApexBench (Pass@1) 36.5 26.2 39.4
Agents' Last Exam 27.3 25.2 25.7
Chartography 64.3 65.0
ZeroBench (Pass@5) 35.0 34.0

看这张表,重点不是绝对值,是三个信号:几乎所有项都比 V4-Flash 纯文本版高,说明视觉能力真补上了;Agents' Last Exam、ZeroBench 两项反超 Opus-4.8,Chartography 只差 0.7;差距最大的是代码类任务,离旗舰还有一段路。我盯着 ApexBench 看了半天——从 26.2 跳到 36.5,这 10 分是实打实的质变,"看截图做 Agent 任务"这条路算是走通了。

三、一张图只要 0.001 元:DeepSeek 图片理解价格怎么算

视觉模型最怕"视觉溢价"——各家一沾图片就按像素加价。DeepSeek 这次直接把价格焊死在文本价上。

计费逻辑一句话:图片不按"张"收钱,而是按尺寸折算成 token,和文本一起计价,单张图片最多算 384 个 token。什么概念?GPT 和 Claude 处理同等分辨率的图,通常要吃掉 800~1100 token,DeepSeek 不到一半。

价格和 V4-Flash 完全一致(元/百万 token,2026-08 官方定价):

计费项 空闲时段 高峰时段
输入(缓存命中) 0.05 0.10
输入(缓存未命中) 1.5 3.0
输出 4.5 9.0

高峰时段是北京时间 9:00–12:00、14:00–18:00,其余减半。我顺手算了笔账:一张图按 384 token 封顶,高峰输入价 3 元/百万 token,就是 384 × 3 ÷ 1000000 ≈ 0.0012 元。跑几百张图也就几毛钱,比你不小心调错接口烧掉的那点钱还少。

这感觉就像奶茶店说"加珍珠不加价"——加料不加钱,还管够。

一张图最多 384 token,高峰期也只要约 0.001 元

四、怎么调用:三种接口、三种传图、Files API 免费

传图这步,DeepSeek 一次给齐了三种姿势,从"临时试一张"到"批量复用"全覆盖。

接口上兼容三条路:Chat Completions(OpenAI 格式,base URL 用 https://api.deepseek.com)、Messages(Anthropic 兼容格式)、Responses。传图也三种:base64 内联、外部 URL、Files API。最值得说的是 Files API。

Files API:DeepSeek 同步上线的免费文件接口,先上传图片拿到 file_id,后续多个请求直接引用,同一张图不用反复传。你可以理解为「图片的一次性门票,买一次反复用」。每用户 25GiB 存储、上限 1 万个文件。

对跑多轮 Agent 工作流的人来说,这个设计太贴心:Agent 第一轮读到一张截图,后面每轮都要参考它,有了 file_id 就不用每次把图再塞一遍。

import base64, requests  # deepseek-v4-flash-vision-exp 调用示例(2026-08)

img = base64.b64encode(open("bug.png", "rb").read()).decode()
resp = requests.post(
    "https://api.deepseek.com/chat/completions",
    headers={
   "Authorization": "Bearer <YOUR_KEY>"},
    json={
   
        "model": "deepseek-v4-flash-vision-exp",
        "messages": [{
   
            "role": "user",
            "content": [
                {
   "type": "text", "text": "这张截图哪里报错了?"},
                {
   "type": "image_url",
                 "image_url": {
   "url": f"data:image/png;base64,{img}"}},
            ],
        }],
    },
)
print(resp.json()["choices"][0]["message"]["content"])

可能有人会问:图片是按像素、还是按张收钱?

都不是。图片按尺寸折算成 token 计费,单张最多 384 个 token,和文本同价,没有单独的"视觉费"。

五、实测能干什么:报错截图、发票、设计稿转页面

看截图写代码,是这模型目前最省事的用法——把报错截图直接甩给它,比贴一坨日志靠谱。

这些不是我瞎编的,是媒体公开实测过的场景:有人把 GitHub 页面的报错截图丢给它,它精准定位到 github-dashboard.html 第 682 行的 TypeError,还完成了从定位到修复的闭环;有人拿发票截图给它,它把类型、号码、日期拆成结构化字段;还有人拿设计稿截图,26 秒出了个配色布局几乎一致的响应式页面,连 hover 动效都自己加上。网易的作者甚至用它做了个《牛来》小游戏。

不过丑话说在前头:它毕竟带 Exp 后缀,官方自己都没承诺什么时候转正式版、会不会开源。以 2026 年 8 月为准,这模型适合拿来跑 Demo、搭视觉 Agent 原型、验证"看图干活"这条路,不适合把生产流量直接压上去——Exp 就是明晃晃的免责声明。

带 Exp 后缀的模型,先拿来跑 Demo,别把生产流量压上去


我是晚安code,持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊:你会拿 DeepSeek 多模态视觉理解模型来识什么图?报错截图、发票还是设计稿?评论区聊聊你的用法。

目录
相关文章
|
1月前
|
人工智能 自然语言处理 API
阿里云百炼Token Plan:AI 模型订阅计划,Qwen3.8-Max 首发尝鲜、上新deepseek-v4-flash,个人版39元起
阿里云推出的百炼Token Plan全新升级活动,是面向全类型AI生产力用户的重磅订阅服务升级,核心权益包含Qwen3.8-Max-Preview首发尝鲜限时加量10倍福利,覆盖文本、视觉、视频等全模态旗舰模型,支持个人版与企业版多档位灵活选择,早鸟优惠低至39元/月,每晚22点到次日8点夜间调用还可享qwen3.7系列低至2折起的超大折扣,同时开放多款组合购套餐将算力、工具、部署环境一站式配齐,帮助用户高效开启全链路AI生产力。
|
6月前
|
人工智能 程序员 开发工具
2026年最值得押注的AI技能,我选Skills
本文直击AI时代焦虑症:面对“颠覆”“革命”等刷屏热词,与其疲于追赶新概念,不如专注沉淀可复用的AI技能(Skills)。它无需编程,用Markdown文档封装你的经验,实现从“临时对话”到“长期协作”的跃迁,让AI真正成为你的数字资产。
|
2月前
|
人工智能 前端开发 Linux
Codex 桌面版安装 + CC Switch 接入第三方 API 完整教程(2026 最新)
2026最新教程:手把手教你安装Codex桌面版,通过CC Switch v3.17.0一键接入Fenno等国产API(兼容OpenAI Responses格式),跳过账号登录,完整启用代码审查、多步任务与上下文感知功能。零基础友好,全程图文实操。(239字)
9908 8
|
25天前
|
缓存 人工智能 5G
DeepSeek 涨价后怎么办:峰谷错峰省一半,小米多模态模型可平替
DeepSeek 涨价 8 月 17 日生效,最高涨 1100%。看懂峰谷计价、错峰调用能省一半;预算还紧,小米 MiMo 多模态模型可以平替。
256 0
DeepSeek 涨价后怎么办:峰谷错峰省一半,小米多模态模型可平替
|
7月前
|
存储 人工智能 开发工具
Claude Code自动记忆来了!配合老金三层记忆系统全开源!加强Plus!
昨天晚上,老金我照例打开 Claude Code 准备写代码。 随便聊了几句项目架构,Claude突然冒出一句: "Based on our previous discussions, this project uses pnpm and TypeScript strict mode." 老金我愣了一下。 上次提到pnpm是三天前的事了,这中间重启了好几次。 打开 ~/.claude/p
|
4月前
|
SQL 人工智能 监控
五年数据开发复盘:从数仓建设到 AI 产品化的阶段性思考
五年数据开发复盘:从数仓建设到AI产品化。作者深耕BI、SaaS数仓、数据血缘与建模,提出“以数仓为根基、实体建模为核心、工程稳定性为底座”,强调业务理解重于工具使用。面对AI浪潮,主张聚焦提示词工程、RAG、实体识别等AI工程化落地,而非算法底层——数据开发正演进为连接业务、数据、工程与AI的复合型角色。
326 3
|
8月前
|
人工智能 前端开发 API
Google发布50页AI Agent白皮书,老金帮你提炼10个核心要点
老金分享Google最新AI Agent指南:让AI从“动嘴”到“动手”。Agent=大脑(模型)+手(工具)+协调系统,可自主完成任务。通过ReAct模式、多Agent协作与RAG等技术,实现真正自动化。入门推荐LangChain,文末附开源知识库链接。
2891 119
|
4月前
|
人工智能 自然语言处理 API
阿里云百炼DeepSeek-V4-Pro/Flash全量上线:计费标准、折扣政策与场景化应用详解
阿里云百炼平台已正式上线DeepSeek-V4系列模型,对外提供DeepSeek-V4-Pro与DeepSeek-V4-Flash两种规格服务。此次上线保持API定价与模型官方一致,并面向用户提供低至4.5折的专属优惠,百万Tokens输入成本可低至1元,输出成本可低至2元,大幅降低企业与开发者使用高性能大模型的门槛。平台支持按量计费、节省计划、包月包季等多种付费模式,覆盖电商营销、广告创作、短剧内容生产、AI编程、智能客服、智慧办公等主流场景,为不同规模用户提供灵活、高性价比的AI服务方案。
4530 0
|
6月前
|
人工智能 监控 测试技术
只会写Prompt已经不够了:2026年,AI Skill正在成为新能力
近两年,AI使用正从“写Prompt”迈向“装Skill”:Cursor、Claude等工具已支持可复用的AI技能包。Skill如手机App,内嵌领域知识(如日志分析),让AI真正成为懂业务的助手。对大学生而言,掌握Skill组合能力,是提升技术岗竞争力的新起点。
|
机器学习/深度学习 人工智能 API
大模型推理服务全景图
国内大模型推理需求激增,性能提升的主战场将从训练转移到推理。
4018 146