如何让你的 codex 生成图片和修改图片的 skill

简介: Codex中文网站长宇哥介绍:通过安装Rodert的ChongPlus图片Skill,Codex可直接用自然语言生成/修改图片,无需写代码或调用API。只需提供GitHub仓库和API Key,即可实现文字生图、参考图编辑等能力,大幅提升AI图像创作效率。(239字)

大家好,我是 Codex 中文网的站长宇哥。

很多人使用 Codex,主要还是让它写代码、修改项目、分析报错。

但 Codex 的能力其实不只这些。

通过 Skill,我们可以给 Codex 安装新的工作流,让它调用外部工具完成原本不会做的事情。比如今天要介绍的这个 Skill,就可以让 Codex直接生成图片和修改图片。

整个过程不需要自己写接口,也不需要手动执行一堆命令。

你只需要把一个 GitHub 仓库交给 Codex,让它完成安装,然后用自然语言描述你想要的图片就可以了。

先看一下我生成的效果。

image.png

这张图片并不是我在其他绘图网站生成后再下载的,而是直接在 Codex 对话中生成的。

下面从安装开始讲。

一、这个 Skill 能做什么?

这次使用的是:

Rodert/chongplus-image-skill

GitHub 仓库地址:

https://github.com/Rodert/chongplus-image-skill

这是一个给 AI Agent 使用的图片生成 Skill。

安装以后,Codex 可以通过 ChongPlus Image API 完成下面两类任务:

  1. 根据文字描述生成图片。
  2. 根据参考图片修改、重绘或者更换风格。

这个 Skill 当前调用的是 gpt-image-2 模型,支持文字生图和参考图编辑,同时可以处理接口返回的 URL 图片和 Base64 图片。整个客户端只使用 Python 标准库,不需要额外安装一堆依赖。

它不是一个单独的绘图软件。

你可以把它理解成一份交给 Codex 的“操作说明书加执行脚本”。当你提出生图或者改图需求时,Codex 会自动读取 Skill,调用脚本,再把最终图片保存到本地。

OpenAI 官方对 Skill 的定义也是类似的:Skill 可以把操作说明、资源和脚本打包成一个可重复使用的工作流,让 Codex 在遇到对应任务时自动调用。

二、安装 ChongPlus Image Skill

安装方式非常简单。

打开 Codex,新建一个对话,然后直接告诉它:

安装 GitHub 仓库 Rodert/chongplus-image-skill 这个 Skill。

也可以写得完整一些:

请从 GitHub 安装 Rodert/chongplus-image-skill,
将它安装为我当前用户可使用的 Codex Skill。

接下来,Codex 会自己获取仓库、检查 SKILL.md,并将它安装到本地的 Skill 目录。

【这里放“安装 Rodert/chongplus-image-skill”截图】

我这里安装完成后,Codex 返回的是:

已安装 chongplus-image skill。

它会在新的 Codex 对话中可用。
首次生成或编辑图片时,需要提供 ChongPlus API Key。

【这里放“安装成功”截图】

不同版本的 Codex或者不同安装器,显示的本地安装目录可能不完全一样,不需要过于纠结具体路径。

只要 Codex 提示安装成功,并说明 Skill 会在新对话中可用,就代表已经安装完成。

OpenAI 官方也提供了 $skill-installer。它不仅能安装内置 Skill,也可以根据提示从其他 GitHub 仓库下载 Skill。安装后如果暂时没有识别出来,可以新建一个对话或者重新启动 Codex。

三、第一次使用:让 Codex 生成一张图片

安装完成后,我重新创建了一个 Codex 对话。

然后输入了下面这段图片描述:

照片级真实感人形机器人牛仔全身正面照,

白色机械躯体带有明显金属关节,
面部是发光的蓝色数字笑脸,
头戴棕色牛仔帽,
身穿棕色皮夹克,
脖子系红色方巾,
戴黑色手套,
佩戴带大银扣的西部风格皮带,
臀部挂枪套,

做旧机械质感,
科幻西部美学,
超细节,焦点清晰,
ARRI Alexa 65 拍摄,
体积光,
干净浅灰色纯色背景,

画面比例接近 1:2。

image.png

因为这是第一次调用 ChongPlus Image Skill,Codex 检查后发现本地还没有配置 API Key,于是会询问:

请提供你的 ChongPlus API Key(sk-...)。

我会将它安全保存到本机配置中,然后生成图片。

image.png

四、创建 ChongPlus API Key

没有 API Key 的话,需要先进入 ChongPlus 控制台创建。

Keys 页面:

https://api.chongplus.plus/keys

登录后创建一个新的 API Key,并选择支持图片生成的分组,也就是 image-generation 分组。

创建完成后会得到一个类似下面的密钥:

sk-xxxxxxxxxxxxxxxxxxxxxxxx

把密钥提供给 Codex即可。

这里特别提醒一下:

截图中的 API Key 一定要打码。

不要把完整 Key 发布到公众号、GitHub、视频或者聊天截图中。也不要把 Key 写进项目代码、Git 仓库或者命令行参数。

这个 Skill 会把 Key 保存到当前用户的本地配置目录,不要求你把 Key 设置成环境变量。macOS 和 Linux 默认保存在:

~/.config/chongplus-image/config.json

Windows 默认保存在:

%APPDATA%\chongplus-image\config.json

在 Unix 系统中,Skill 还会为配置目录和文件设置仅当前用户可访问的权限。

image.png

配置完成以后,以后的生图和改图通常不需要再次提供 Key。

五、Codex 自动生成并检查图片

Key 保存成功以后,Codex 会自动调用 Skill 中的图片生成脚本。

我这次要求的比例接近 1:2,而接口支持的竖版尺寸中,最接近的是:

1024x1536

所以 Codex 自动将我的比例要求映射成了 1024x1536

Skill 当前支持下面这些尺寸:

1024x1024
2048x2048
1536x1024
1024x1536
3840x2160
2160x3840

每次最多可以生成 1 到 4 张图片。

图片生成完成后,Codex 还会读取生成结果,检查主体、构图和背景是否符合要求。

我这里最终返回的是:

已生成,构图为正面全身、浅灰背景、1024×1536。

同时还会给出图片在本地的保存路径。

image.png

最后生成的图片如下:

image.png

整个过程里,我没有自己调用接口,也没有手动运行 Python 脚本。

从安装 Skill、配置 Key、提交提示词,到生成并保存图片,基本都是 Codex 自己完成的。

六、如何让 Codex 修改图片?

除了文字生图,这个 Skill 还支持参考图编辑。

你可以把需要修改的图片放到当前项目目录,或者直接把图片提供给 Codex,然后描述修改要求。

例如:

使用 ChongPlus Image Skill 修改这张图片。

保持机器人主体、服装、牛仔帽、姿态和镜头角度不变。

把浅灰色背景替换成黄昏时分的西部荒漠,
远处增加山脉和落日,
地面有少量风沙,
增加电影感和体积光。

不要新增人物,
不要改变机器人的面部和身体结构,
输出为 1024x1536。

对于改图任务,建议把要求分成两部分。

第一部分明确哪些内容不能变:

保持人物、服装、姿势和构图不变。

第二部分再说明哪些内容需要修改:

将背景改成黄昏沙漠,增加落日、风沙和电影光影。

这样比简单地说一句“帮我改得好看一些”更稳定。

Skill 在执行改图时,会将参考图片、提示词、模型和尺寸一起提交到图片编辑接口,然后把新的结果另存到本地。

七、几个比较实用的提示词写法

1. 生成产品图

使用 ChongPlus 生成一张产品摄影图。

主体是一台银白色桌面咖啡机,
产品位于画面中央,
白色摄影棚背景,
柔和商业布光,
真实金属反光,
电商主图风格,
不要文字和水印,
输出 2048x2048。

2. 生成公众号封面

使用 ChongPlus 生成一张科技类公众号封面。

主题是“让 Codex 学会生图和改图”,
画面中包含电脑、AI Agent 和图片生成界面,
深蓝紫色科技背景,
主体清晰,
保留标题排版空间,
横版构图,
输出 1536x1024。

3. 更换图片背景

修改这张图片。

保持主体外观、动作、衣服和面部完全不变,
只把背景替换成干净的白色摄影棚,
增加自然柔和阴影,
不要新增任何物品,
输出 2048x2048。

4. 修改局部内容

修改这张图片。

保持其他区域不变,
只将人物手中的黑色杯子改成透明玻璃杯,
保持原来的手部姿势、光线方向和透视关系。

改图时,“保持什么不变”通常和“修改什么内容”同样重要。

八、遇到报错怎么办?

1. 提示没有配置 Key

如果出现:

No ChongPlus API key is saved

说明本地还没有保存 API Key。

重新将 Key 提供给 Codex,让它通过 Skill 的安全配置命令保存即可。

2. HTTP 401

一般表示 Key 缺失或者无效。

检查 Key 是否复制完整,或者重新创建一个新的 Key。

3. HTTP 403

普通的 403 可能表示:

  • Key 没有图片模型权限。
  • Key 所在分组不支持 gpt-image-2
  • 账户额度不足。
  • 当前请求被禁止。

如果错误中还出现:

error code: 1010

则通常代表请求在到达 API 应用之前,被 Cloudflare 边缘防火墙拦截。

这个 Skill 已经携带了适合 API 客户端使用的请求头和稳定的 User-Agent,不要随意删除或者修改。

4. HTTP 429

表示请求频率过高。

降低同时生成的图片数量,等待一段时间后再重试。

5. 返回尺寸和要求不一致

建议直接使用 Skill 已支持的标准尺寸,不要提交任意宽高。

比如需要竖版图片时,可以优先选择:

1024x1536
2160x3840

需要横版图片时,可以选择:

1536x1024
3840x2160

九、Skill 和 MCP 有什么区别?

很多人看到这里可能会问:

为什么这次做的是 Skill,而不是 MCP?

简单来说:

Skill 更像是交给 Agent 的工作说明、操作流程和配套脚本。

MCP 更像是一个长期运行的标准化工具服务。

对于这次的图片生成场景,Skill 的优势是非常轻量。

用户只需要把 GitHub 仓库交给 Codex,安装完成以后就能使用,不需要额外部署 MCP Server,也不需要配置复杂的服务连接。

后面如果需要让更多 Agent 通过统一服务调用,或者需要集中管理鉴权、额度和工具列表,也可以再提供一个 MCP 版本。

也就是说,两者并不冲突。

当前仓库解决的是:

让支持 Agent Skill 的 AI Agent 快速获得生图和改图能力。

后续 MCP 仓库解决的则可以是:

让不同 AI 客户端通过标准 MCP 协议调用 ChongPlus 图片能力。

十、最后

以前我们使用 Codex,更多是在代码层面让它帮忙。

安装 Skill以后,Codex 可以开始调用各种外部能力。

生成图片只是其中一个例子。

安装完成后,你不需要记接口地址,不需要记请求参数,也不需要每次手动写 Python 或者 Curl 命令。

只需要直接告诉 Codex:

帮我生成一张图片。

或者:

保持主体不变,把这张图片的背景换成雪山。

剩下的工作,就可以交给 Codex 和 Skill 自动完成。

项目仓库:

https://github.com/Rodert/chongplus-image-skill

感兴趣的话,可以自己安装体验一下。

也欢迎给仓库点一个 Star,或者提交 Issue,一起把这个 Skill 做得更完善。


复制给你的 AI

请安装并使用这个 ChongPlus 生图 Skill:
https://github.com/Rodert/chongplus-image-skill

首次使用时请主动提示我输入 ChongPlus API Key,并自动安全保存到本机配置中,之后直接读取使用;不要要求我手动配置环境变量。
  • 原文 https://codex-zh.com/posts/codex-image-generation-skill/
目录
相关文章
|
7天前
|
人工智能 JSON 安全
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
阿里云AI安全产品联动防御Fastjson攻击
2043 11
Fastjson远程代码执行漏洞,阿里云AI安全为您保驾护航
|
7天前
|
云安全 人工智能 安全
|
7天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max-Preview深度全解析:2.4万亿参数旗舰MoE模型+Token Plan限时优惠完整落地指南
2026年7月,全新旗舰级混合专家大模型Qwen3.8-Max-Preview正式开放抢先体验,作为通义千问Qwen3系列规格最高、综合推理能力顶尖的新一代模型,该模型总参数量达到2.4万亿(2.4T),是当前线上可调用的原生多模态旗舰模型,综合推理水准对标海外顶级Fable 5模型,在复杂工程开发、长文档深度分析、多步骤智能体自治、跨境多语言创作、海量数据挖掘五大高难度业务场景实现跨越式性能提升。
903 1
|
7天前
|
人工智能 自然语言处理 数据挖掘
最新版通义千问(Qwen3.8-Max-Preview)功能介绍
2026年,通义千问正式推出全新旗舰级大模型 **Qwen3.8-Max-Preview 预览版**,作为首款突破万亿参数规格的新一代基座模型,该模型总参数量达到**2.4万亿**,采用全新迭代的MoE混合专家架构,综合推理性能、长文本处理、多模态理解、复杂任务规划能力全面超越前代Qwen3.7-Max版本,整体实力跻身全球第一梯队,可对标海外顶级旗舰模型,是当前面向复杂工程开发、多智能体协同、超长文档解析、专业办公自动化场景的最优国产基座模型。
911 0
|
9天前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
912 39
|
5天前
|
自然语言处理 测试技术 API
通义千问Qwen3.8-Max-Preview全功能解析:2.4万亿参数旗舰模型深度使用指南
在大模型技术持续迭代的当下,通义千问推出的Qwen3.8-Max-Preview作为新一代旗舰预览版模型,凭借2.4万亿参数的超大规模、多模态融合能力与全场景适配特性,成为开发者与企业用户探索AI应用的核心工具。该模型采用稀疏混合专家(MoE)架构,是通义千问首个突破万亿参数的多模态模型,可同时处理文本、图像、视频与文档等多种数据形态,在全栈代码开发、复杂逻辑推理、长文档分析与多智能体协作等场景实现跨越式升级。本文将全面拆解Qwen3.8-Max-Preview的核心功能,详解API调用流程与配置方法,覆盖多场景实战技巧,帮助用户快速掌握这款旗舰模型的使用方法,充分释放其性能潜力。
444 1
|
8天前
|
人工智能 自然语言处理 数据挖掘
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南
Qwen3.8-Max-Preview是通义千问Qwen3系列旗舰MoE大模型,参数达2.4万亿,综合推理能力居行业第一梯队。支持思考/快速双模式,擅长大模型五大高难场景。现于阿里云百炼Token Plan、Qoder及QoderWork上线体验,个人版低至39元/月。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
669 1
Qwen3.8-Max 预览版全解析:2.4 万亿参数旗舰模型,Token Plan 限时优惠指南