万相Wan2.1-VACE-Plus 视频编辑模型详解:收费标准、限流规则、同步调用 Demo

简介: 阿里云万相Wan2.1 VACE是统一视频编辑模型,支持局部编辑、重绘、背景扩展、时长延展及多图/姿态/深度参考等能力,兼容文本、图像、视频多模态控制。现于百炼平台免费开放千万Tokens试用。在阿里云百炼官网:https://t.aliyun.com/U/fPVHqY 免费领取千万Tokens

阿里云万相Wan2.1 VACE视频编辑统一模型,支持局部编辑、视频重绘、背景扩展、时长延展、图片参考等多种视频编辑与生成任务,支持文本、图像、视频等多模态条件控制。本文转自阿里云官网关于Wan2.1 VACE模型的多图参考、姿态参考、深度参考能力及工作流创建逻辑,关于万相Wan2.1 VACE模型的详细介绍参考阿里云百炼平台:https://www.aliyun.com/product/bailian 目前可以免费申请千万Tokens。

wanvace.jpg

核心概念

多图参考是指在生成或处理视频时,能够同时参考多张输入图片的内容信息,融合生成在同一条视频里。这种能力在电商、艺术创作等领域有着极高的应用价值。

image.png


工作流框架

整个工作流可以大致分为3个区域:中心的基础框架区域、前段的输入区域和末端的视频放大区域。

  • 中心区域的Wan2.1 VACE工作流本质是在Wan2.1文生视频工作流的基础上增加了VACE的模型加载和编码器。

image.png


  • 在前端输入区域,因为是多张图片的参考,所以每一个图像加载都会有对应着的尺寸调整,去除背景等节点。

image.png

  • 最后将处理好的图片进行联结、编码,并传输进采样器采样、解码,就可以输出成最终的视频啦。


Wan2.1 VACE工作流的基本框架搭建

采样器配置

首先,选择我们的Wan视频采样器(WanVideo Sampler),并调整参数:步数(steps)输入20cfg值输入6shift值输入8采样器(scheduler)选择dpm++

image.png


在阿里云百炼平台API调用Wan模型:https://www.aliyun.com/product/bailian  如下图:

阿里云百炼AI大模型免费领取7000万tokens.jpg

模型加载选择

model圆点下我们拖拽出Wan视频模型加载器(WanVideo Model Loader),选择Wan2.1_T2V_14b的模型。

image.png


随后,我们拖拽出Wan视频Block Swap节点(WanVideo Block Swap),参数保持默认。


image.png


vace_model圆点下拖拽出Wan视频VACE模型选择器(WanVideo VACE Module Select)选择我们的主角Wan2_1_VACE_14b的模型。


image.png


文本编码

我们回到Wan视频采样器(WanVideo Sampler),在text_embeds圆点下拖拽出Wan视频文本编码器(WanVideo TextEncode),随后t5圆点下拖拽出Wan视频T5文本编码加载器(WanVideo T5 TextEncoder Loader),选择umt5_xxl_fp8_scaled的模型。


image.png

加速与优化节点

在采样器里我们再拖拽出几个加速视频生成及提高画面质量的节点,Wan视频Enhance-A-Video(WanVideo Enhance-A-Video)节点、Wan视频TeaCache(WanVideo TeaCache)节点、Wan视频SLG(WanVideo SLG)节点以及Wan视频Experimental Args(WanVideo Experimental Args)节点。


image.png


图像编码与解码

image_embeds圆点下我们拖拽出Wan视频VACE编码器(WanVideo VACE Encode)节点,在VAE圆点下我们拖拽出Wan视频VAE加载器(WanVideo VAE Loader),选择Wan2_1_VAE_bf16模型。


image.png

最后我们在samples圆点下拖拽出Wan视频解码器(WanVideo VACE Decode)节点,将vae圆点进行连接。


image.png

输出处理

Wan视频解码器(WanVideo VACE Decode)节点之后拖拽出视频合并(Video Combine)节点,帧数保持16,输出格式选择video/h264-mp4

这样,Wan2.1 VACE工作流的基本框架我们就搭建完成了,所有的Wan2.1 VACE工作流都会基于这个框架衍生。

image.png

多图参考工作流搭建

多图输入模块构建

接下来,我们来构建一下多图参考的前期输入模块。我们创建一个加载图片(Load Image)节点,在IMAGE圆点下拖拽出调整图片尺寸(Resize Image v2)节点,调整一下参数,宽度(width)我们给480高度(heidht)保持在720upscale_method选择lanczos

image.png

随后在这个节点后拖拽出图像背景移除(Image Remove Bg)节点,我们将这三个节点复制一份,主图的rem_mode模式我们选择Inspyrenet

image.png

随后我们加载一个图像联结(Image Concatenate)节点,将两张图联结,方向(direction)保持右侧(right)

image.png

在图像联结节点下的IMAGE圆点我们拖拽出一个Get Image Size&Count节点方便我们统一处理图片尺寸。

image.png


我们还可以加载一个图像预览(Preview Image)节点待会看看合并效果。

image.png

最后我们将处理后的的图像接入Wan视频VACE编码器(WanVideo VACE Encode)节点下的ref_images圆点作为参考图,将宽(width)高(height)也连接一下。


image.png

在空白区域我们再创建一个图像联结(Image Concatenate)节点,将解码后的图像与前期预处理的图像进行一个联结,传输进我们复制的视频合并(Video Combine)节点,这样我们可以方便的看到预处理与生成画面的整体效果。


image.png


这样我们的Wan2.1 VACE多图参考的工作流就搭建完成了。


多图参考工作流测试案例

我们上传两张图片一起来测试一下效果,我希望主图的红发女人能与副图的水下金鱼场景融合,在这里因为副图是作为背景,不需要扣像,所以我们将副图的背景移除节点关闭,将节点重新连接一下,我们将负向提示词模版复制进来,输入一下正向提示词,点击运行。

image.png

可以看到人物与背景得到了一个巧妙的融合,光影与场景细节也是非常的还原。

image.png


姿态参考与深度参考能力详解


核心原理

那再让我们来看看Wan2.1 VACE的姿态参考与深度参考工作流。

姿态参考和深度参考的原理是通过openpose模型和深度预测算法,提取上传视频的人物骨骼点或画面深度图,并结合提示词语义控制最终输出视频的画面效果。因此,这两个工作流最核心的节点就是OpenPose节点与Depth Anything节点,我们可以一起着手来搭建一下这套工作流。

image.png

姿态参考与深度参考工作流搭建

基础框架复用

我们导入一个Wan2.1 VACE的基础框架工作流。

image.png


视频输入

双击空白处创建一个加载视频【Load Video(Upload)】节点,我们可以直接拖拽视频上传。随后在IMAGE圆点下拖拽出Image Resize节点,调整宽(width)480高(height)720interpolation参数选择nearest

image.png

控制节点

接着,我们拖拽出OpenPose Pose节点,这个节点主要帮助我们提取视频中的人物骨骼信息。

image.png 同样的,我们还可以拖拽出Depth Anything节点,这个节点可以提取视频的画面深度信息。


image.png

通过图像混合(Image Blend)节点我们将两个节点混合一起,这个节点就像一个开关,当我们选择0时,对应选择OpenPose模型,写入1时可以切换Depth模型。


image.png


数据传输

随后在图像混合(Image Blend)节点下的IMAGE圆点拖拽出Get Image Size&Count节点,和多图参考工作流一样,我们将图像及尺寸传输进Wan视频VACE编码器(WanVideo VACE Encode)节点。


image.png

我们双击空白处,创建加载图像【Load Image(Path)】节点,随后拖拽出调整图像(Resize Image v2)节点与Wan视频VACE编码器(WanVideo VACE Encode)节点的ref_images进行连接,作为视频的参考图。


image.png

同时,我们将视频的尺寸与图像尺寸保持一致。


image.png

可视化对比

我们再次双击空白处创建图像联结(Image Concatenate)节点,将上传的图像与解码后的视频联结

image.png

再创建一个图像联结节点将预处理的控制视频也联结过来

image.png

最后与视频合并连接,这样我们可以更直观的看到整个工作流的各个重要环节的输出结果

image.png

那么这样我们的整套工作流就搭建完成了。

姿态参考与深度参考测试案例

姿态参考测试

我们上传一张艺术感人物图像,用OpenPose模型来测试一下,这里我希望图像中的人物能参考视频的动作起舞,输入一下提示词点击运行。

image.png

我们可以看到人物完美复刻了视频中的动作,效果非常不错,实现了精准响应。

image.png

深度参考测试

我们再上传一段场景丰富一点的滑雪视频,以及一张滑沙的图像,我们使用深度控制对视频进行控制,输入提示词,点击运行。

image.png


我们可以看到滑沙的动作参考了滑雪者运动感十足,背景的处理也变得更加丰富了。

image.png


本节课系统解析了Wan2.1 VACE模型的三大核心能力——多图参考、姿态参考与深度参考,展示了其在视频生成领域对细节还原与动态控制的强大潜力。大家可以移步到阿里云百炼平台测试https://www.aliyun.com/product/bailian

相关文章
|
23天前
|
人工智能 JSON 文字识别
金融AI技能库:104个开源Skill即插即用
零API费用的金融AI技能库:104个场景纯Python实现,毫秒级响应 当金融AI遇上"账单焦虑" 金融行业的AI落地,存在一个被长期忽视的悖论:业务方要的是"即时可用",技术方给的是"先接API再说"。 一个发票查验场景,接入第三方OCR服务,单次调用0.3元,日均10万笔,月账单9万。一个财报分析需求,调用大模型API,单次Token消耗折合0.8元,季报期间批量处理500份,
|
26天前
|
人工智能 运维 自然语言处理
最新版通义千问(Qwen3.7-Max)功能介绍
通义千问Qwen3.7-Max(2026上线)是阿里云新一代旗舰大模型,支持百万级上下文、原生全模态、自主智能体、顶尖代码能力、全链路办公与阿里生态办事六大升级,实现从问答工具到通用AI代理的跃迁,个人端永久免费。
|
18天前
|
自然语言处理 测试技术 API
通义千问Qwen3.8-Max-Preview全功能解析:2.4万亿参数旗舰模型深度使用指南
在大模型技术持续迭代的当下,通义千问推出的Qwen3.8-Max-Preview作为新一代旗舰预览版模型,凭借2.4万亿参数的超大规模、多模态融合能力与全场景适配特性,成为开发者与企业用户探索AI应用的核心工具。该模型采用稀疏混合专家(MoE)架构,是通义千问首个突破万亿参数的多模态模型,可同时处理文本、图像、视频与文档等多种数据形态,在全栈代码开发、复杂逻辑推理、长文档分析与多智能体协作等场景实现跨越式升级。本文将全面拆解Qwen3.8-Max-Preview的核心功能,详解API调用流程与配置方法,覆盖多场景实战技巧,帮助用户快速掌握这款旗舰模型的使用方法,充分释放其性能潜力。
797 2
|
1月前
|
人工智能 JSON 安全
Claude Code 被封号!转向 Codex 实战教程:12 项关键配置与报错排查大全
2026年Codex CLI推出0.140及以上版本,新增`/import`一键导入指令,大幅降低从Claude Code迁移的工作量。两款工具底层逻辑相近,但配置文件格式、权限管控、钩子事件、模型支持存在明显差异,整体迁移本质是文件重命名、格式转换与局部规则重写。本文基于Codex CLI 0.142.5与Claude Code 2.1.178实测,梳理12项配置对应关系、完整迁移步骤、Claude模型兼容网关搭建、高频故障与团队协作方案,覆盖个人开发者与企业团队两种场景。
256 1
|
3月前
|
存储 Rust NoSQL
一条命令迁移,帮你实现 OpenClaw 与 Hermes Agent 记忆互通!
本文是基于阿里云 Tablestore 的 Agent 记忆共享实战指南:一条命令迁移 OpenClaw 记忆至 Hermes,通过统一 Tablestore 实例、应用 ID 与租户 ID,实现跨Agent(如龙虾与马)记忆自动互通、实时同步与语义检索,支持 CLI 管理与对话中直接调用,安全可靠,开箱即用。
3554 122
|
30天前
|
存储 人工智能 JSON
Qwen 本地部署搭配 ComfyUI 生成 AI 漫剧完整实操指南(小白零基础可落地,零成本无限生成+角色一致性天花板)
2026全网最优本地漫剧流水线:零成本、离线运行、角色统一、低配(8G显卡)可跑。融合Qwen本地大模型+ComfyUI双引擎,实现剧本生成→分镜绘图→动态成片全自动,隐私安全、无审核限流,新手30分钟上手,日更无忧。(239字)
|
23天前
|
人工智能 缓存 前端开发
刚刚 Kimi K3 炸裂发布,号称 Claude 和 GPT 的国产平替,夯爆了!
新模型 Kimi K3 实战项目测评,跟 Claude Fable 5 和 GPT-5.6 相比到底怎么样?前端和全栈工程能力如何?DeepSeek 2.0 时刻来了?
394 1
|
18天前
|
人工智能 弹性计算 API
Hermes Agent终端AI编程工具全解:功能亮点与阿里云计算巢部署接入百炼Coding Plan、Token Plan实操
在AI编程工具快速迭代的当下,终端AI编程工具凭借轻量化、高效能的特性,成为开发者提升编码效率的重要选择。Hermes Agent作为一款备受关注的终端AI编程工具,凭借强大的自主进化能力、多模型兼容与多端适配特性,为开发者提供了全新的编程体验。本文将全面解析Hermes Agent最新版的核心功能,同时详细讲解如何通过阿里云计算巢完成部署,并接入阿里云百炼的Coding Plan与Token Plan订阅计划,帮助开发者快速上手这款高效工具。
96 1