Qwen-Image-3.0-Pro 上线千问AI平台,支持复杂图文排版、精细渲染与图像编辑

简介: Qwen-Image-3.0-Pro 现已上线千问AI平台,支持文生图和图像编辑,可处理最高 4.5K Tokens 指令,支持 12 种语言、20 余种字体和约 10 px 小字渲染,适用于复杂图文排版、真实质感、UI 设计和知识信息图等场景。

2026-08-05模型发布

Qwen-Image-3.0-Pro 上线千问AI平台,支持复杂图文排版、精细渲染与图像编辑

一、概览

Qwen-Image-3.0-Pro 现已上线千问AI平台——面向开发者与 AI Agent 的模型服务平台。作为第三代 Qwen-Image 图像生成模型,Qwen-Image-3.0-Pro 同时支持文生图和图像编辑,围绕「内容丰实、细节真实、知识厚实」三个方向升级:可接收最高 4.5K Tokens 的复杂指令,在单张图中组织多层级、多区域内容;支持约 10 px 小字、公式和真实材质渲染;支持 12 种语言、20 余种字体,以及网页、游戏、直播等界面生成。

从报纸、试卷、论文页面和分镜,到人像摄影、产品质感、知识信息图与多语言设计稿,Qwen-Image-3.0-Pro 可将复杂内容组织、精细视觉呈现和图像编辑纳入同一工作流,为内容创作、设计、教育、电商和应用界面生产提供更完整的图像能力。

Qwen-Image-3.0-Pro 发布主视觉

延伸阅读:查看 Qwen-Image-3.0 完整发布文章

二、模型详情

1. Qwen-Image-3.0-Pro:面向复杂视觉内容生产的图像模型

模型名称 / 版本号:Qwen-Image-3.0-Pro(qwen-image-3.0-pro)

能力定位:支持文生图和图像编辑,可根据长指令生成包含复杂版面、精细文字、真实细节和专业知识的图像,也可结合参考图完成重绘、增删、批注和视觉信息重组。

2. 核心参数

参数 说明
模型标识 qwen-image-3.0-pro
任务类型 文生图、图生图 / 图像编辑
输入模态 文本、图像;图像编辑支持 1–3 张参考图
输出模态 图像,PNG 格式
指令长度 最高 4.5K Tokens
输出尺寸 总像素范围为 512 × 512 至 2,048 × 2,048;未指定尺寸时可由模型推荐
单次输出 最多生成 6 张图像
文字渲染 支持约 10 px 小字、12 种语言、20 余种字体
提示词增强 prompt_extend 默认开启;支持 direct,文生图还可使用 agent 模式
可控参数 支持反向提示词、随机种子和水印控制
在线体验 已支持
API 调用 已提供 DashScope HTTP API、Python SDK 和 Java SDK 调用方式

模型价格及最新调用限制请查看 Qwen-Image-3.0-Pro 模型详情页。

三、模型能力

1. 内容丰实

复杂版面:一张图容纳多层内容

Qwen-Image-3.0-Pro 可在同一张图中安排标题、正文、图表、示意图、公式和注释等不同元素,并保持分区关系和阅读顺序。最高 4.5K Tokens 的指令容量使模型能够处理试卷、报纸、菜单、故事板和演示页等信息密度较高的任务。

在九宫格中组织安全漫画、语文、数学、医学、金融等不同类型的密集内容

画中画与界面纵深

模型支持多层嵌套的画中画内容,可在同一画面中保持设备、应用窗口、对话界面和海报等层级关系。复杂信息不再只依赖平铺布局,也可以沿视觉纵深逐层展开。

多层应用界面与海报内容嵌套生成案例

分镜与连续视觉叙事

对于短剧、广告和脚本可视化任务,模型可在统一画幅中组织多个镜头,保持人物、场景、光线和叙事节奏的连续性,便于从文字脚本快速形成可讨论的故事板。

人物、场景和镜头语言保持连续的电影感故事板

延伸阅读:查看复杂内容与版面生成的完整案例

2. 细节真实

小字、公式与纸张排版

Qwen-Image-3.0-Pro 强化了小字号文字、公式、栏线和纸张版面的稳定呈现,可用于信息图、学术页面、报纸和说明文档等需要同时保证信息密度与可读性的场景。

鲸鲨知识信息图、学术论文页面与报纸版面三组生成案例

人像与材质

模型对皮肤、发丝、织物、光影和景深等微观细节进行更细致的还原,可生成更接近真实摄影的人像与场景,同时保持画面中的招牌文字、花束和背景层次。

逆光人像、发丝、花束与街景材质的综合呈现

图像编辑与手写批注

在图像编辑任务中,Qwen-Image-3.0-Pro 可在保留原始版面与主体结构的基础上,根据指令增加手写批注、重点标记或局部内容,为教材处理、内容审阅和视觉修改提供更直接的编辑方式。

在保持教材版面与地图内容的基础上增加红色手写批注的编辑前后对比

延伸阅读:查看真实细节与图像编辑的完整案例

3. 知识厚实

多语言与多字体

Qwen-Image-3.0-Pro 支持 12 种语言和 20 余种字体,可在不同语言的海报、杂志、宣传页和界面中完成原生文字渲染。发布案例覆盖日语、韩语、西班牙语等语言,适合多地区内容生产和本地化设计。

韩语文字、人物与杂志化版面共同组成的时尚海报

从参考图到知识信息图

模型可结合输入图像与外部知识,将单一主体扩展为包含分类、结构、特征和说明文字的专业信息图。生成过程不仅改变视觉样式,也会重新组织知识结构和版面层级。

由昆虫参考图生成包含分类关系和说明文字的知识信息图的前后对比

联网信息与主题化生成

在接入联网信息后,模型可将天气等实时数据组织为完整视觉页面;也可结合艺术家、作品风格和直播界面知识,生成具有明确主题、人物关系和平台元素的内容。

将杭州天气信息整理为移动端视觉海报

结合艺术家形象、作品元素和互动组件生成的直播界面

延伸阅读:查看多语言、知识与界面生成的完整案例

四、开发接入

1. 通过 DashScope API 调用

Qwen-Image-3.0-Pro 使用 DashScope 多模态生成接口。调用时需传入模型标识 qwen-image-3.0-pro,并在请求头中配置 API Key。以下为精简的文生图示例:

01curl --location 'https://dashscope.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation' \\

02  --header 'Content-Type: application/json' \\

03  --header "Authorization: Bearer $DASHSCOPE\_API\_KEY" \\

04  --data '{
   

05    "model": "qwen-image-3.0-pro",

06    "input": {
   

07      "messages": \[

08        {
   

09          "role": "user",

10          "content": \[

11            {
   

12              "text": "生成一张竖版城市报刊亭人像摄影:午后逆光,一名年轻女性手捧橙粉色玫瑰,背景招牌写有 Il Messaggero,呈现自然发丝、花瓣和胶片颗粒质感。"

13            }

14          \]

15        }

16      \]

17    },

18    "parameters": {
   

19      "prompt\_extend": true

20    }

21  }'

完整的 API Key 获取方式、请求示例与响应结构可查看 模型 API Reference。

2. 文生图与图像编辑

  • 文生图:在 content 中传入文本描述,适合海报、信息图、UI、摄影和分镜等从零生成任务。
  • 图像编辑:在同一条用户消息中传入 1–3 张参考图及编辑指令,可完成局部修改、内容增删、风格调整、批注和多图融合。
  • 复杂指令:长指令可描述版面分区、文字内容、元素位置、材质、光线和镜头关系;prompt_extend 默认开启,可使用 direct 模式,文生图还支持更精细的 agent 模式。

3. 关键调用说明

  • 输出尺寸的总像素范围为 512 × 512 至 2,048 × 2,048;未传入尺寸时,可由模型根据内容推荐。
  • 单次请求最多生成 6 张图像,输出格式为 PNG。
  • 参考图支持公网 URL 或 Base64 输入,格式包括 JPG、JPEG、PNG、BMP、TIFF、WEBP 和 GIF,单张不超过 10 MB。
  • 可通过反向提示词、随机种子和水印参数进一步控制生成结果。
  • 对可读文字、固定版面或参考图编辑要求较高时,建议在提示词中明确文字内容、区域位置、层级关系和需要保留的元素。
  • 更完整的请求参数、图像输入方式和响应结构可查看 图像生成与编辑 API 文档。

五、立即体验

Qwen-Image-3.0-Pro:模型详情 | 立即体验 | API Reference

Qwen-Image-3.0-Pro 现已在千问AI平台开放在线体验与 API 调用,欢迎使用。

相关文章
|
24天前
|
人工智能 自然语言处理 语音技术
阿里云千问大模型选择指南,覆盖六大核心模型方向,从文本到音视频全能力解析
本文为大家梳理了阿里云通义千问全系列大模型,覆盖通用文本、视觉语言、图片生成、视频生成、全模态、语音识别六大核心产品线,逐一拆解各主力版本的核心能力、技术优势与适用场景,同时汇总了按量折扣、夜间错峰、新人免费额度等最新优惠活动,帮助开发者快速完成模型选型,兼顾业务效果与调用成本。
|
3月前
|
人工智能
Qwen3.8抢先体验!正式版即将发布并开源!
千问Qwen3.8即将开源,参数达2.4T,进化速度以“天”计,实力媲美Fable 5。预览版Qwen3.8-Max已上线阿里Token Plan等平台,限时优惠:日间Credits低至1折,夜间更优,个人/团队版月付仅35元起!
5042 158
|
17天前
|
人工智能 自然语言处理 语音技术
阿里云大模型介绍:全模态生态全能力拆解,千问+第三方生态选型落地指南
本文全面盘点阿里云百炼平台191款大模型,系统梳理通义千问全系列及DeepSeek、智谱GLM等第三方生态的全模态能力、官方收费标准与适用场景,同步汇总2026年最新Token Plan套餐、7000万新用户免费额度、夜间错峰低至1折等省钱攻略,为开发者与企业用户提供从POC验证到规模化落地的全链路选型与成本优化参考。
|
11天前
|
人工智能 自然语言处理 运维
吃透阿里云 Qwen3 系列大模型:全维度能力解析、API 开发实操、项目落地与选型参考
通义千问Qwen3系列完成了从对话问答工具到智能体执行引擎的重要升级,依托MoE混合专家架构、百万级超长上下文、原生全模态融合、全链路Agent四大核心技术突破,搭建起梯度完整的模型家族。不同档位模型覆盖从个人轻量使用到企业复杂业务的全部需求,依托百炼平台,开发者无需搭建底层算力环境,通过简单API调用就可以快速把AI能力嵌入自有业务系统。
185 3
|
20天前
|
存储 人工智能 IDE
阿里云千问办公和Qoder有啥区别?到底是选千问办公还是Qoder?用哪个更方便省钱?
阿里云千问办公(QwenWork)专注通用办公自动化,支持文档/PPT/数据分析等,深度集成钉钉;Qoder CN主打AI编程,兼容多模型、强IDE插件;Qoder Teams是其企业团队版,提供席位管理与协同功能。选型看角色:办公选千问,开发选Qoder。
500 0
|
6月前
|
人工智能 自然语言处理 安全
Claude Code 全攻略:命令大全 + 实战工作流(建议收藏)
本文介绍了Claude Code终端AI助手的使用指南,主要内容包括:1)常用命令如版本查看、项目启动和更新;2)三种工作模式切换及界面说明;3)核心功能指令速查表,包含初始化、压缩对话、清除历史等操作;4)详细解析了/init、/help、/clear、/compact、/memory等关键命令的使用场景和语法。文章通过丰富的界面截图和场景示例,帮助开发者快速掌握如何通过命令行和交互界面高效使用Claude Code进行项目开发,特别强调了CLAUDE.md文件作为项目知识库的核心作用。
51280 73
Claude Code 全攻略:命令大全 + 实战工作流(建议收藏)
|
6月前
|
人工智能 自然语言处理 API
通义千问 Qwen 3.0 前景分析:开源为王,国产 AI 的全球化突围战
2025年4月底,阿里发布Qwen 3.0,8款模型全量开源。其dual-mode reasoning(快/慢思考)提升响应效率与推理深度;MoE架构显著降本增效,小模型性能惊艳;256K长上下文、119语种支持及强大中文理解构筑差异化优势;Apache 2.0开源生态已成全球最大。虽面临幻觉率、全球竞争与商业化挑战,但技术迭代迅猛,前景稳健可期。(239字)
阿里发布 Qwen-Image-2.0,实测复杂插画生成,手绘细节还原度很高!
阿里千问Qwen-Image-2.0刚发布即实测!我们用其生成视频封面,精准还原“手绘风格+颜色编码+精细布局”。提示词含标题、图标、配色与排版要求,效果惊艳。现可通过chat.qwen.ai免费体验!

热门文章

最新文章