阿里云Wan 3.0-Video正式上线:支持参考、编辑、复刻、驱动等多种创作功能,最长支持30秒视频生成

简介: 本文介绍阿里云百炼平台正式上线的Wan 3.0-Video全能多模态视频生成模型,该模型支持文本、图像、视频、音频、文档及网页链接等多源输入,可实现文生视频、图生视频(首帧/首尾帧)、参考生视频等多种生成模式,最高支持1080P分辨率、最长30秒高清视频输出,在角色一致性、音画真实度上实现显著升级。模型覆盖电商素材生产、广告营销、教育课件制作、IP角色延展等多类场景,在国内及新加坡、日本、德国等多地域部署,按不同分辨率按秒计费,可与阿里云Token Plan等AI权益体系深度打通,为各行业用户提供端到端的高可控AI视频生成解决方案。

阿里云Wan 3.0-Video目前已经正式上线,Wan3.0-Video是全能参考视频生成模型(All-in-One),支持文本、图像、视频、音频等多模态输入,统一实现文生视频、图生视频(首帧/首尾帧)和参考生视频等能力。支持480P、720P和1080P分辨率输出,最长可生成30秒视频,可解析文件、网页及复杂图片。生产级角色一致性保持,音画真实,带来身临其境的视听冲击力。

体验Wan3.0.png

一、阿里云 Wan 3.0-Video 是什么?

阿里云 Wan 3.0-Video 是大模型服务平台百炼(Model Studio)推出的 全能型多模态视频生成模型(All-in-One),具备统一处理文本、图像、视频、音频、文件及网页链接等多源输入的能力,可实现文生视频、图生视频(首帧/首尾帧)、参考生视频等多种生成模式。

该模型由阿里云百炼提供推理服务,当前已正式开放使用(注:部分高级能力可能仍处于邀测阶段)。相比前代 Wan 2.7 系列,Wan 3.0-Video 在生成时长、输入灵活性与内容理解深度上实现显著升级,最大支持生成 30 秒高清视频(此前为 15 秒),并新增对 PDF、PPT、DOCX 等文档及公开网页链接的自动解析能力。

其核心定位是为内容创作者、电商运营、广告制作、游戏影视等行业用户提供 端到端、高可控性、强一致性的 AI 视频生成解决方案。wan3.0-video模型的推理服务供应商为阿里云百炼:https://www.aliyun.com/product/bailian

万相3.0视频生成.png

二、阿里云 Wan 3.0-Video 有哪些功能?

Wan 3.0-Video 提供四大类视频生成能力,覆盖主流创作需求:

1. 文生视频(Text-to-Video)

  • 输入一段自然语言描述(prompt),自动生成对应动态视频。
  • 支持电影级运镜、光影变化、角色动作等复杂语义表达。
  • 示例 prompt:“一只小猫在月光下的屋顶上奔跑,城市的霓虹灯在远处闪烁,电影级画质,流畅运镜。”

2. 图生视频(Image-to-Video)

  • 首帧生视频:通过指定 first_frame 图像作为视频起始画面,确保主体一致性。
  • 首尾帧生视频:同时传入首帧与尾帧图像,模型生成中间过渡动画,适用于产品演示、叙事场景。
  • 支持分辨率:480P、720P、1080P;时长:2–30 秒(整数)。

3. 参考生视频(Reference-to-Video)

  • 可传入 参考图像、视频、文档或网页链接,模型自动理解内容并生成风格/角色一致的新视频。
  • 支持 type: "file"(PDF/PPT/DOCX)或 type: "link"(公开 URL),两者不可同时使用。
  • 适用于品牌素材复用、IP 角色延展、教程视频自动化等场景。

4. 多模态融合驱动

  • 支持 文本 + 图像 + 音频 + 文件 多模态联合输入,实现更精准的内容控制。
  • 虽然当前版本 不支持 Function Calling、联网搜索、结构化输出等能力,但其多模态理解能力已足以支撑复杂创意任务。

重要限制提醒:

  • 不支持批量推理与模型调优;
  • 不支持上下文缓存与前缀续写;
  • 请求需通过异步方式(X-DashScope-Async: enable)提交。

三、模型能力

能力项 支持情况 能力项 支持情况
输入模态 Text Image Video Audio File Link 输出模态 Video
模型体验 支持 Function Calling 不支持
结构化输出 不支持 联网搜索 不支持
前缀续写 不支持 上下文缓存 不支持
批量推理 不支持 模型调优 不支持

四、阿里云 Wan 3.0-Video 应用场景

场景 1:电商商品视频自动化生产

  • 输入商品主图 + 卖点文案,自动生成 5–30 秒展示视频,用于详情页、短视频平台投放。
  • 结合首帧控制,确保商品外观零失真。

场景 2:广告与营销内容创作

  • 基于品牌 VI 图或宣传文档(如 PPT),一键生成符合调性的广告片。
  • 支持多比例输出(adaptive ratio),适配抖音、Instagram、YouTube 等平台。

场景 3:教育与培训视频生成

  • 将教学文档(PDF/Word)自动转化为动态讲解视频,降低课件制作成本。
  • 利用首尾帧技术制作步骤演示(如实验操作、软件教程)。

场景 4:IP 角色复刻与延展

  • 上传角色设定图或过往视频,生成新剧情片段,保持角色一致性。
  • 适用于动漫、游戏、虚拟偶像等领域。

场景 5:创意短片与艺术表达

  • 输入诗意化 prompt(如“涂鸦少年从墙上活过来并说唱”),生成具有电影感的艺术短片。

五、阿里云 Wan 3.0-Video 定价

华北2(北京)

计费项 价格(元) 单位
视频生成(480P) 0.3 每秒
视频生成(720P) 0.6 每秒
视频生成(1080P) 1.2 每秒

新加坡

部署范围:国际

计费项 价格(元) 单位
视频生成(480P) 0.37471 每秒
视频生成(720P) 0.74942 每秒
视频生成(1080P) 1.49884 每秒

日本(东京)

部署范围:全球

计费项 价格(元) 单位
视频生成(480P) 0.3 每秒
视频生成(720P) 0.6 每秒
视频生成(1080P) 1.2 每秒

德国(法兰克福)

部署范围:全球

计费项 价格(元) 单位
视频生成(480P) 0.3 每秒
视频生成(720P) 0.6 每秒
视频生成(1080P) 1.2 每秒

2026年阿里云AI产品与云产品优惠权益参考:
AI 产品权益主要包括智启 AI 普惠权益,至高享 1亿+免费 tokens,加速 Al 应用落地;Token Plan 模型订阅计划,Qwen3.8-Max 首发尝鲜,限时加量 10 倍,夜间低至2折;千问办公,限时限量积分加倍,你的AI工作搭子,覆盖日常办公高频场景;万小智 AI 建站低至 15元/月,送.CN域名,送备案服务码;Night Plan 支持 Qwen 3.8-Max,夜间 5 折,Qwen/Meoo/TokenPlan 客户专享。而云产品权益主要有轻量应用服务器限时抢购2核2G38元/年;经济型e实例3.9折,通用算力型u2i实例3折,九代c9i、g9i、r9i等实例1年付6.4折起等优惠权益。详情可通过阿里云权益中心了解:https://www.aliyun.com/benefit

云启AI普惠权益2026.png

总结:Wan 3.0-Video 代表阿里云在 AI 视频生成领域的最新成果,通过 统一接口、多模态输入、30 秒长视频、文档/网页理解 等能力,大幅拓展了 AI 视频的应用边界。尽管具体价格尚未公开,但其与 Token Plan 的深度集成,为开发者提供了灵活且可扩展的使用路径。

相关文章
|
20天前
|
人工智能 编解码 API
阿里云Wan3.0模型介绍:支持参考、编辑、复刻、驱动等功能,最长支持30秒视频生成,优惠7折起
本文介绍部署于阿里云百炼平台的Wan3.0视频生成大模型,这是一款主打“稳定、真实、有质感”的全能型多模态视频生成引擎,将单次视频生成上限提升至30秒,支持文、图、音视频、文档、网页等多模态输入,首次实现办公文档直接转视频能力,覆盖480P到1080P全分辨率输出。文章拆解了其文生视频、首尾帧生视频、参考生视频等核心功能,说明其在短视频创作、影视预演、教育教程制作等场景的落地价值,并同步介绍了模型限时7折、全模型通用抵扣包低至4.5折的最新优惠活动,为创作者和企业用户提供低成本接入AI视频生产链路的参考。
阿里云Wan3.0模型介绍:支持参考、编辑、复刻、驱动等功能,最长支持30秒视频生成,优惠7折起
|
1月前
|
人工智能 编解码 搜索推荐
阿里云Wan3.0模型解析:模型能力、适用场景、模型价格、接入使用方式等
Wan3.0在生成时长、万能创作、全能参考与真实感等维度全面升级,单次可生成30秒视频,完整表达创作意图;在文本、图片、音频、视频四种基础模态之外,首次支持doc、xls、ppt、pdf、md等文档格式输入,让“万物皆可生视频”。与此同时,Wan3.0力求准确还原真实世界——人物千人千面,细节经得起审视,每一帧画面既真实、又可信。
|
15天前
|
编解码 缓存 自然语言处理
Wan3.0‑Video模型上线,阿里云万相3.0多模态生成30秒高清视频、限时7折!
阿里云Wan3.0-Video正式上线,支持文/图/音/视频及PDF、PPT等12种文档直转视频,单次原生生成最长30秒、30fps高清内容。现享7折优惠:480P仅0.21元/秒,附赠10秒免费额度。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
279 1
|
7天前
|
编解码 人工智能 自然语言处理
阿里云万相3.0视频生成模型介绍:支持参考、编辑、复刻、驱动等创作功能,最长支持30秒视频生成
本文解析了阿里云通义万相新一代全能视频生成大模型Wan3.0,它支持文生视频、多素材参考、文档直接转视频等能力,最长可生成30秒带原生音频的1080P高清视频。文章覆盖核心功能、分分辨率计费标准、API接入教程,同步介绍新用户10秒免费额度与当前限时7折活动,是短剧、广告、文旅等场景实现高效AI视频创作的实用选型参考。
|
19天前
|
编解码 缓存 自然语言处理
阿里云通义万相视频模型Wan3.0‑Video:7折活动,480P视频0.21元每秒、1080P视频价格0.84元每秒
阿里云Wan3.0-Video正式上线,全能多模态视频生成模型,支持文/图/音/视/文档(PDF/PPT等)输入,原生生成最长30秒、30fps高清视频。现享7折优惠:480P 0.21元/秒,720P 0.42元/秒,1080P 0.84元/秒;新用户赠10秒免费额度。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens
212 0
|
7月前
|
存储 数据采集 人工智能
大模型微调常见术语解析:新手也能看懂的入门指南
本文通俗解析大模型微调核心术语:涵盖预训练模型、LoRA/QLoRA等轻量方法、学习率/批次大小等训练参数,以及过拟合、数据投毒等效果与安全要点,助新手快速入门并安全实践。(239字)
|
2月前
|
缓存 文字识别 调度
一文分清阿里云千问Qwen3.7 Max、Plus、Flash:能力差异与场景适配方案
2026年阿里云推出通义千问Qwen3.7完整产品矩阵,包含Max、Plus、Flash三款主力商用模型,三款模型统一标配100万Token超长上下文窗口、最长35小时连续自治执行能力,但在架构设计、模态支持、推理上限、响应速度、计费单价上存在显著区分,分别对应极致专业推理、多模态综合商用、轻量化高并发三类核心需求。本文依托官方实测基准数据,从基础硬件参数、综合能力、推理速度、计费成本、落地场景五大维度横向拆解,为个人开发者、中小企业、政企研发团队提供清晰选型依据,避免选型不当造成性能不足或算力成本浪费。
1677 1
|
3月前
|
数据采集 人工智能 文字识别
2026企业AI如何真正落地?深度拆解60+全球案例
2026年企业AI应用已告别“大模型万能论”。本文基于斯坦福《企业AI实战手册》及16家头部企业案例,提炼7条落地共性:AI须嵌入核心业务流程;高风险行业坚持“人先于AI”;数据质量决定成效上限;行业分化加剧,通用方案失效;价值重心从个人提效转向组织决策;AI需持续运营而非一次性项目;推荐以8周闭环验证真实场景,本质是经营能力的竞争。

热门文章

最新文章