做 AI 视频工业化落地的团队,最近应该都有同感。
单靠文本提示词,已经喂不饱无限画布的精度需求了。
纯文本描述的空间位置太模糊,人物走到哪、镜头推多远,全靠模型猜,一到大尺度运镜就跑偏。只堆参考图也不行,风格能稳住,但剧情逻辑、动作语义很容易走样。
我们前前后后测了快两百组样本,结论很直观:纯文本驱动的无限画布生成,跨 8 个节点的主体一致性只有 62%;加上高质量参考图,能拉到 87%;再叠上画布坐标约束,一致性直接冲到 94%。
差距全在融合机制上。多条件不是简单的 “都加上就好”,信号之间会打架、会冗余、会互相稀释。Vera1.1 能把参考图、文本、坐标三路信号捏合得这么稳,底层的融合架构才是真东西。今天就从编码、融合、消冲突、落地四个维度,把这套机制拆透。
一、为什么无限画布必须走多条件融合路线
传统固定画幅的 AI 视频,单靠文本提示词就能覆盖大部分需求。但无限画布把生成逻辑从 “固定窗口预测” 变成了 “连续空间漫游”,单一路条件天然存在短板。
- 文本提示:语义清晰,空间模糊。自然语言能精准描述 “人物穿风衣”,但描述不了精确的空间坐标、透视关系。无限画布的空间连续性,天然缺少锚点。
- 参考图像:细节精准,语义薄弱。能锁死人物五官、服装质感,但表达不了 “往前走三步”“镜头缓慢横移” 这类动态指令,更承载不了剧情逻辑。
- 画布坐标:空间精准,内容空洞。只能定位位置和轨迹,定不了画面里有什么、是什么风格,脱离内容本身就是空架子。
三者本质是正交互补的关系:文本负责语义定义,参考图负责视觉细节,坐标负责空间锚点。叠加带来的收益,远大于单一路条件的深度优化。
很多人刚上手都会问,我只加参考图不行吗?答案是,短镜头、固定机位可以,一旦涉及无限画布的空间运动,没有坐标锚定,参考图的特征会跟着镜头漂移,越跑越歪。
二、三路条件的独立编码:先对齐,再融合
融合的前提,是三路信号先各自编码成模型能读懂的特征向量,且在特征空间里对齐维度,不然根本融不到一起。Vera1.1 给每一路都做了专属编码通路,输出的特征粒度、维度严格匹配主干网络的不同层级。
1. 参考图像编码:多尺度分层编码
参考图进入管线后,先经过归一化、主体对齐、质量增强预处理,再送入自研多尺度 ViT 编码器,输出三档特征:
- 浅层特征:高分辨率,对应像素级纹理、光影细节
- 中层特征:中分辨率,对应主体结构、轮廓形态
- 深层特征:低分辨率,对应风格语义、整体氛围
三档特征分别对应主干网络的浅、中、深层,为后续分层融合做准备。
2. 文本提示编码:语义分层嵌入
文本编码不只是生成全局提示向量,还支持区域级语义绑定。
全局文本负责整体风格和内容定义,区域文本则可以绑定画布上的特定坐标范围,实现 “左上角是城市天际线,右下角是人物主体” 的分区控制。编码时会同步生成空间掩码,和画布坐标系统做对齐。
3. 画布坐标编码:连续空间嵌入
画布坐标不是离散的像素值,而是被编码成连续的空间嵌入向量,包含四个核心维度:绝对空间坐标、相对位移量、相机视角参数、视场角大小。
编码结果会和时序位置编码做拼接,同时注入空间注意力和时序注意力两层,保证空间连续性贯穿全程。
| 条件类型 | 编码模块 | 输出特征维度 | 作用网络层级 | 核心控制目标 |
| 参考图像 | 多尺度 ViT 编码器 | 384/768/1536(三档) | 浅 / 中 / 深全层级 | 视觉一致性、细节还原 |
| 文本提示 | 语义 Transformer 编码器 | 1024 | 中深层为主 | 内容语义、风格方向 |
| 画布坐标 | 空间位置编码器 | 256 | 全层级空间注意力 | 空间连续性、运镜平滑 |
三路编码各走各的管线,互不干扰。
到了中间层,才开始交汇。
三、核心机制:双阶段门控融合架构
Vera1.1 没有用传统的直接拼接或者固定加权求和,而是做了特征级预融合 + 推理级动态门控的双阶段架构。这也是为什么多条件叠加后,不仅没打架,反而能实现 1+1+1>3 的效果。
第一阶段:同粒度特征预融合
在每个网络层级,先把相同粒度的特征做预融合,避免粗粒度信号干扰细粒度细节。
- 浅层网络:参考图的纹理特征 + 坐标的位置特征,做通道拼接后经 1x1 卷积降维,保证维度和原网络一致。核心是让纹理细节贴合空间位置,不出现错位。
- 中层网络:参考图的结构特征 + 文本的语义特征,通过交叉注意力做融合,让文本语义精准对齐到视觉结构上。比如文本说 “红色外套”,就对应到参考图的衣物区域。
- 深层网络:文本的全局语义 + 坐标的全局空间信息,通过 AdaLN 调制共同控制去噪方向,确立整体画面基调。
同粒度融合的好处很直观。不会出现全局文本描述把局部皮肤纹理抹掉的情况,也不会让坐标约束打乱主体的细节质感。各管一段,边界清晰。
第二阶段:推理级动态门控
这是整套机制最核心的设计。融合权重不是固定值,而是在每个去噪步、每个空间块,由门控单元动态分配。
门控单元会参考两个核心指标:当前去噪步的噪声强度、当前空间区域的内容复杂度,自动调整三路信号的权重占比。
整体规律很清晰:
- 去噪前期(高噪声阶段):文本权重最高,先把整体布局和语义定下来
- 去噪中期(中噪声阶段):参考图权重升高,开始细化主体结构和质感
- 去噪后期(低噪声阶段):坐标权重最高,校准空间位置和边缘连续性
同时空间维度也做了区分:主体区域参考图权重更高,背景区域坐标和文本权重更高。
| 去噪阶段 | 时间步占比 | 文本提示权重 | 参考图像权重 | 画布坐标权重 | 核心任务 |
| 前期 | 0%-30% | 60% | 25% | 15% | 确立整体布局与语义 |
| 中期 | 30%-70% | 30% | 50% | 20% | 细化主体结构与质感 |
| 后期 | 70%-100% | 15% | 25% | 60% | 校准空间位置与边缘 |
很多人调参时喜欢给参考图拉满权重,全程锁死。
踩过坑的都懂,这样出来的画面会很僵,运镜像贴图画,没有空间纵深感。动态门控就是解决这个问题的,该放权的时候放权,该锚定的时候锚定。
四、条件冲突消解:多信号打架怎么办
多条件融合绕不开一个现实问题:信号冲突。
比如参考图里人物穿黑色外套,文本提示写白色风衣;又比如坐标设定镜头快速左移,参考图里人物是正面朝向。处理不好,要么画面直接崩,要么某一路条件完全失效。
Vera1.1 设计了三层冲突消解机制,从输入到推理全程兜底。
- 输入层置信度校验:每一路条件进入编码前,都会计算置信度。模糊、低分辨率的参考图置信度低,描述模糊、语义矛盾的文本置信度低。发生冲突时,系统自动向高置信度信号倾斜。
- 特征层语义对齐校验:编码完成后,先在语义空间做相似度计算。如果两路信号语义差异超过阈值,会触发降级策略,自动压低冲突信号的权重,避免硬刚导致画面崩坏。
- 空间层分区权重分配:同一画面内不同区域执行不同融合策略。人物主体区域参考图权重优先,背景环境区域文本和坐标权重优先,不用全局一刀切。
为什么我同时加了参考图和文本,效果反而不如单加一个?这是后台提问率很高的问题。大概率就是两路信号存在核心冲突,且冲突点刚好在画面主体区域,模型左右摇摆,最后出来的结果四不像。
五、落地实践:不同场景的条件配置经验
我们团队用这套机制跑了三个多月的商用项目,最深的感受是:不是所有场景都要三路拉满,合适的配比才最重要。条件加得越多,调试成本越高,反而影响交付效率。
分享几个典型场景的配置思路,都是实测跑出来的结论。
1. 电商数字人口播场景
- 核心需求:人物不崩脸、口型对齐、镜头小幅推进
- 配置方案:参考图权重偏高,文本中等,坐标中等偏下
- 实测效果:人物相似度稳定 92%+,单条成片通过率提升 40%
- 协作要点:美术出标准化正面参考图,策划输出结构化口播文本,技术只微调运镜幅度
2. 国风漫剧大场景
- 核心需求:场景空间连续、画风统一、运镜流畅
- 配置方案:坐标权重最高,参考图中等,文本中等
- 实测效果:跨节点场景衔接瑕疵率从 28% 降到 6%
- 协作要点:策划先出分镜节点和坐标轨迹,美术同步出关键帧参考图,对齐后再生成全片
3. 产品展示 3D 运镜
- 核心需求:产品结构准确、运镜轨迹精准、光影一致
- 配置方案:参考图最高,坐标很高,文本最低
- 实测效果:运镜轨迹误差控制在 2% 以内,产品结构还原度 95%+
- 协作要点:技术先标定坐标轨迹,美术出多角度产品参考图,文本只做补充描述
聊点团队管理的心得。
多条件融合不是技术岗一个人的事。策划要输出结构化文本,不能是天马行空的散文;美术要出对应空间节点的参考图,标注清楚视角;技术负责调试权重和节点密度。我们现在的标准流程是三方先对齐关键帧,再跑全片,比之前各干各的,返工率降了快一半。
六、性能优化:多条件会不会拖慢速度
这也是大家普遍关心的点。多一路条件,就多一路编码和融合计算,会不会显存爆、速度慢?
Vera1.1 做了三项针对性优化,实际落地中,三路全开比单文本只慢 12% 左右,显存只多占 8%,完全在可接受范围内。
三项核心优化:
- 条件特征缓存:关键节点的参考图、文本特征只编码一次,全流程复用,不用每帧重新编码
- 稀疏融合计算:背景区域、低差异区域简化融合计算,只在主体、边缘区域做完整融合
- 坐标编码预计算:画布坐标的嵌入向量可提前批量算好,生成时直接调用,不用实时计算
| 配置方案 | 单路文本 | 文本 + 参考图 | 文本 + 参考图 + 坐标 | 优化后三路全开 |
| 单帧推理耗时 | 100% | 118% | 135% | 112% |
| 峰值显存占用 | 100% | 109% | 117% | 108% |
| 主体一致性得分 | 62 分 | 87 分 | 94 分 | 94 分 |
性能和效果,从来不是二选一。
工程优化做得到位,多条件的额外成本可以压到很低。
FAQ 常见问题
Q1:做无限画布是不是三个条件都必须加?少一个行不行?
不是必须。固定机位、短时长的简单场景,文本 + 参考图就够用。只有涉及大尺度运镜、多节点空间调度、对空间连续性要求高的场景,才需要加上画布坐标。条件加得越多,调试成本越高,按需选择就好。
Q2:参考图和文本描述冲突了,能不能手动调整权重?
可以。Vera1.1 提供了手动权重调节入口,支持全局权重和分阶段权重设置。如果明确知道哪路条件优先级更高,可以手动拉高对应权重。但更建议先优化输入本身,让文本描述和参考图对齐,从源头减少冲突,比后期调权重效果更好。
Q3:画布坐标调得越细,生成效果就越好吗?
不是。坐标密度要匹配运镜速度。快速运镜场景,坐标密一些能稳住轨迹;缓慢运镜、静态场景,坐标太密反而会引入不必要的约束,让画面变僵。一般来说,每秒 1-2 个坐标锚点是比较通用的设置。
Q4:多条件融合对参考图的质量有要求吗?模糊的图能不能用?
有要求。参考图分辨率建议不低于 1024×1024,主体清晰、光线均匀效果最好。模糊、裁切、角度刁钻的参考图,编码后的置信度会很低,融合时权重会被自动压低,起不到锁细节的作用。这种情况不如不用,反而避免冲突。