Codex 接入 DeepSeek-V4-Flash:还能补上识图,提供两套方案

简介: Codex 接入 DeepSeek-V4-Flash 怎么配?本文覆盖 CLI 与桌面端,再用 qwen3-vl-flash 补识图,两套方案可直接照做

大家好,我是程序员天天困。

很多人想 Codex 接入 DeepSeek-V4-Flash,图的是便宜 Agent 大脑。我之前写过成绩单拆解:DeepSeek V4 Flash 正式版:成绩碾压 Pro 预览版,白菜价——Agent 能打、价格白菜、还原生 Responses API,确实适合塞进 Codex。

硬伤也得说清:DeepSeek-V4-Flash 是纯文本模型,不能像多模态模型那样直接读图。 你扔张 UI 截图,让它「看看图里写了什么」,它识别不出来。

那有没有办法:一边用 Flash 做便宜又强的推理,一边让 Codex 还能处理图像?还真有。下面手把手把 CLI 和桌面端配通,再给两套识图方案。

点个收藏,咱们开始~

一、先准备 DeepSeek API Key

Codex 接第三方模型,第一步永远是 Key,不是改配置文件。

打开 DeepSeek 开放平台 注册登录,进入 API keys,新建一把 Key。创建时完整字符串只显示一次,当场复制存好;丢了只能作废重建。

Flash 输出约 2 元 / 百万 token,个人日常写码一般够用。

二、Codex CLI 配置 DeepSeek

Codex CLI:OpenAI 出的终端侧 AI 编程助手,你在项目目录里跟它对话,它能读写文件、跑命令、改代码。你可以把它理解成「住在终端里的结对程序员」。

先确保本机有 Node.js,没有就去官网装个 LTS。然后全局安装:

npm install -g @openai/codex

装完输入 codex 能进对话界面就算成。首次启动会要你登录 OpenAI 账号——没订阅也没关系,接下来我们直接切到 DeepSeek。

重要前置:CLI 或桌面端至少启动过一次,让 ~/.codex(Windows 是 %USERPROFILE%\.codex\)目录先生成出来。官方脚本要往里面写文件,目录不存在会直接翻车。

1)一键脚本(推荐)

官方文档 写明:目前只有 deepseek-v4-flash 支持接 Codex;deepseek-v4-pro 预计 2026 年 8 月初跟上。

Windows 用 PowerShell:

irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex

Mac / Linux:

bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup.sh)

脚本起来后选模型(Flash 选对应序号)

再粘贴 API Key。它会备份旧配置、写 models.json、改 config.toml,还做语法校验——写坏了会中止,不会把你现有 MCP、项目信任配置整没。

可能有人会问:以前改个 Base URL 为什么老 404?

以前卡在协议。Codex 走 Responses API,不少国内接口只聊 Chat Completions,两边不是同一套方言。Flash 这次原生支持 Responses,wire_api = "responses" 就能直连,不必再起本地协议翻译层。

配置完重开 Codex,启动横幅出现 deepseek-v4-flash(或你选的模型名),就说明 CLI 配通了。

2)不想跑脚本就手动改

两步。第一步在 ~/.codex/ 下建 models.json,内容直接复制官方文档展开块(里面带 Flash / Pro 元数据:百万级上下文、low/high/max 推理档等)。

第二步编辑同目录 config.toml

model = "deepseek-v4-flash"
model_provider = "deepseek"
preferred_auth_method = "apikey"
forced_login_method = "api"
model_reasoning_effort = "high"
model_catalog_json = "~/.codex/models.json"

[model_providers.deepseek]
name = "deepseek"
base_url = "https://api.deepseek.com/"
wire_api = "responses"
experimental_bearer_token = "<你的 DeepSeek API Key>"

关键就一行:wire_api = "responses"。Token 换成自己的 Key。保存后重启 Codex,效果和脚本一致。

想切回官方模型,再跑一遍脚本,菜单里选恢复即可。

三、Codex 桌面端换模型不用重配

ChatGPT / Codex 桌面端、VS Code 的 Codex 插件,跟 CLI 读的是同一套 ~/.codex 你在 CLI 配好 Flash,桌面端一般不用再填一遍。

打开桌面端后,模型选择器在 Mac 上常显示为 Custom;Windows 上可能是 Custom,也可能直接显示 DeepSeek-V4-Flash。看到 Custom 别慌——实际跑的就是你在配置里指定的 DeepSeek 模型。

有个小坑我踩过:切到第三方 API 之后,以前用 ChatGPT 订阅攒的会话列表像「消失」了。其实没删,只是 Codex 按登录方式分组展示。恢复旧配置,旧会话回来;DeepSeek 会话则反过来隐藏。换完记得重启客户端。

到这里,Codex 接入 DeepSeek-V4-Flash 的主链路算走通了:CLI 写代码、桌面端聊需求,账单走 DeepSeek。

四、Flash 为啥自己看不了图

官方 models.json 里写得很直白:Flash 的 input_modalities 只有 textsupports_image_detail_original 为 false。翻译成人话——眼睛没装,不是你不会用。

编程场景里看图其实挺刚需:对照 Figma 截图还原布局、根据报错弹窗找原因、读一下产品给的 UI 稿。主模型继续用 Flash 省钱没问题,但「看」这件事得外包。

思路像工地分工:Flash 当工头负责推理和改代码,旁边再雇一个专职看图的人,把画面翻译成文字交回去。下面两套方案,本质都是这件事。

五、方案一:vision-skill + qwen3-vl-flash(推荐)

Vision Skill:给没有原生识图能力的主模型外挂「眼睛」的技能包——读本地/网络图片,调视觉 API,把描述塞回对话。开源仓库:asuojun/claude-vision-skill

视觉模型我选的是通义千问的 qwen3-vl-flash:专门负责看图的 VL 模型,日常读 UI / 截图够用。官方按 token 计费(输入 0.15 元 / 百万 tokens,输出 1.5 元 / 百万 tokens),不是按张标价;我这边日常丢一张截图识图,账单大概落在 0.02 元/次左右。阿里这边更大的文本旗舰我之前写过:Qwen3.8 突然上线:2.4T、自评仅次于 Fable 5,千问想干什么——那是另一条产品线;识图别拿纯文本旗舰硬顶,用 VL 系列。

百炼控制台拿一把 DashScope API Key,然后在已经接好 Flash 的 Codex 里直接丢这段话(把 Key 换成你自己的):

全局安装 vision-skill,按 https://github.com/asuojun/claude-vision-skill 的 README 帮我配置识图

- 视觉模型用通义千问的 qwen3-vl-flash
- API Key 为 <使用你自己的 API Key>

按 README,AI 一般会把 vision.js 配好、把触发说明写进技能目录;之后你直接发图片路径或附件,它应自动走视觉模型,而不是瞎猜像素。

如果 GitHub 拉不动,先本地 clone 再让 Codex 读本地 README:

git clone https://github.com/asuojun/claude-vision-skill.git

为什么我推荐方案一:现成、可复用、Skill 机制跟 Codex 工作流合拍,维护成本低。你平时不怎么看图也可以先跳过,用到再装,不耽误写代码。

六、方案二:让 Codex 自写识图插件

有人不想依赖第三方 Skill,或者想把链路完全捏在自己手里——可以让 Codex 直接写一个「读图插件」。

原理不神秘:图片先编成 base64 → 调用 VL 视觉模型(同样建议 qwen3-vl-flash)→ 拿回文字描述 → 塞给主模型 DeepSeek-V4-Flash 继续推理、改代码。主模型始终只吃文本,视觉模型只负责「看」。

你可以在 Codex 里用类似需求开干(按你项目结构改路径):

帮我写一个 Codex 可用的识图插件:
1. 读取本地图片或用户附件,转成 base64
2. 调用阿里云百炼 OpenAI 兼容接口,模型用 qwen3-vl-flash
3. 把视觉模型返回的文字描述交给当前主对话(DeepSeek-V4-Flash)继续处理
4. 用环境变量放 API Key,不要把密钥写死进仓库

这套的好处是可控:超时、压缩、提示词模板、日志,你都能改。坏处也明显——你要自己扛兼容性、升级和权限问题。Flash 版本一变、Codex Skill/插件接口一改,可能得跟着重写。

说真的,除非你明确要定制,否则别一上来就走方案二。先把方案一跑通,再决定要不要自建。

七、两套方案怎么选,以及跑通长什么样

先把选择标准钉死:

方案 适合谁 优点 代价
方案一 vision-skill 大多数人(我推荐) 安装快、跟 Skill 生态一致 依赖开源仓库与百炼 Key
方案二 自写插件 想完全自控链路的人 可定制、可内嵌团队规范 自己维护,升级要跟

日常写码 + 偶尔看截图:直接方案一。 方案二留给「我就要自己管管道」的场景。

配好之后,丢一张界面图给 Codex,让它描述布局或指出明显问题——如果视觉模型回了靠谱描述,主模型又能据此改代码,就说明「Flash 推理 + 外挂识图」这条组合拳打通了。

OK,收束一句:Codex 接入 DeepSeek-V4-Flash 解决的是「便宜又强的 Agent 大脑」;识图外包解决的是「眼睛」——两件事别绑死在同一个模型上。 把主链路和识图外挂都配齐,日常写码才算完整。

官方接入文档会随版本更新,配置以 DeepSeek Codex 集成页 为准;vision-skill 以仓库 README 为准。


我是程序员天天困,持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊:你这边 Codex 接入 DeepSeek-V4-Flash 之后,识图会选 vision-skill 还是自己写插件?

相关文章
|
1月前
|
Linux API iOS开发
Codex 怎么接入 DeepSeek V4-Flash:官方一键脚本 + 手动配置完整教程
DeepSeek V4-Flash 正式版于2026年7月31日开放公测,原生支持Codex所需的Responses API,告别本地代理与协议降级。官方提供一键配置脚本,跨平台兼容;同时详解手动配置(config.toml/models.json),全面释放子Agent、多工具调用等原生Agent能力。(239字)
1238 0
|
2月前
|
人工智能 前端开发 Linux
Codex 桌面版安装 + CC Switch 接入第三方 API 完整教程(2026 最新)
2026最新教程:手把手教你安装Codex桌面版,通过CC Switch v3.17.0一键接入Fenno等国产API(兼容OpenAI Responses格式),跳过账号登录,完整启用代码审查、多步任务与上下文感知功能。零基础友好,全程图文实操。(239字)
9685 8
|
1月前
|
存储 弹性计算 缓存
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
本文更新了2026年阿里云全系列云服务器租赁活动报价,所有特惠资源均可前往阿里云活动中心选购,整体覆盖从个人入门到企业级高性能场景的全梯度需求。其中轻量应用服务器主打极致性价比,2核2G峰值200M带宽配置每日10点、15点限时抢购价仅38元/年,2核4G配置379元/年起;高性价比的经济型e实例、通用算力型u2i实例覆盖2核4G至4核32G全档位,适配开发测试与中小型企业业务;搭载英特尔至强6处理器的第九代c9i企业级实例算力较上代提升20%,支撑高并发生产环境,不同实例规格价差清晰,用户可根据自身业务负载与预算灵活选型。
3210 121
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
|
25天前
|
人工智能 Linux API
Codex接入DeepSeek‑V4‑Flash完整实操:两套方案补齐识图能力保姆级教程
在AI编程Agent工具生态当中,Codex凭借强大的本地工程读写、代码修改、命令执行能力,成为开发者日常项目调试、代码重构、问题排查的常用客户端。DeepSeek‑V4‑Flash作为一款高性价比的文本大模型,拥有超大上下文窗口,Agent任务规划、代码生成、逻辑推演表现十分突出,API调用成本低廉,非常适合作为Codex底层推理基座。但是该模型属于纯文本推理模型,原生并不支持图像输入,当开发者把报错截图、UI界面截图、架构图、数据图表粘贴进会话,模型会直接提示无法解析图片内容,很多开发场景就此被卡住。
360 1
|
2月前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
4173 145
|
27天前
|
缓存 JavaScript Shell
DeepSeek Harness 终于来了:开源,一切皆插件
DeepSeek Harness 开源首夜我装好了。本文给四种下载方式、四模式区别、插件生态实测,以及一段 99% 缓存命中率的真实账单
DeepSeek Harness 终于来了:开源,一切皆插件