做 AI 视频工业化落地的团队,最近半年基本都绕不开一个词 —— 无限画布。
从固定 16:9 画幅到可自由推拉摇移的无边界空间,这不是简单的功能叠加,而是整个生成范式的重构。很多团队刚接触时都会问:同样是生成 10 秒视频,怎么开了无限画布,显存直接翻了快两倍?这话不是危言耸听,我们团队前期测过多款主流模型,同时长、同采样步数下,4K 分辨率的无限画布推理,峰值显存比 1080P 固定画幅高出 170% 左右。
而这背后,条件控制模块就是整个范式的核心枢纽。它既要承接文本、参考图、相机参数、分镜节点等多路输入,又要把控制信号精准注入时空 DiT 主干,还要保证全局一致性不崩。今天我们就从底层架构、调度逻辑、工程优化三个维度,把 Vera1.1 的条件控制体系拆到模块级。
一、无限画布的范式变革:从单帧生成到节点化空间建模
传统 AI 视频生成本质是 "固定窗口内的时序预测"。画幅边界是硬约束,镜头运动只能在预设范围内模拟,一旦涉及大尺度横移、纵深推进,要么裁切变形,要么主体直接漂移。
无限画布彻底推翻了这套逻辑。它不再是 "生成一段固定画面的视频",而是 "在一个连续虚拟空间内,沿着相机轨迹生成所见画面"。这个转变带来了三个核心差异:
- 空间维度从固定边界变为连续可扩展坐标系,所有元素都有全局空间坐标
- 控制维度从单一文本提示扩展为文本 + 相机轨迹 + 空间布局 + 参考图的多模态条件
- 生成逻辑从串行逐帧生成变为节点锚定 + 过渡插值的分层生成
Vera1.1 选择的是分镜节点化路线。简单说就是先在画布上标记关键节点,每个节点对应一个空间视角和画面状态,模型再自动生成节点间的平滑过渡。这种方案既保留了人工可控性,又避免了逐帧调节的低效。
我们做过对比测试,同样的两个分镜节点,用传统分段拼接加转场,衔接处的瑕疵率是 38%;用 Vera1.1 的原生节点过渡,瑕疵率只有 7%,差距非常明显。
二、条件控制模块核心:三级图像注入架构
条件控制模块的核心任务,是把外部参考信息精准转化为模型可理解的特征信号,同时不破坏扩散过程的自然生成能力。传统单层注入方案一直有个死结:保细节就丢语义,保主体就丢质感。
Vera1.1 采用 "编码器 — 注入器 — 传播器" 三级架构,把不同粒度的控制信号分配到不同网络深度,分层治理。整条链路分四个阶段执行:图像预处理、多尺度特征提取、扩散过程注入、时序约束传播。
| 架构层级 | 核心职责 | 对应技术模块 | 特征保留贡献占比 |
| 编码器 | 多尺度特征提取 | 自研 ViT 编码器(0.8B 参数) | 基础特征质量占比 45% |
| 注入器 | 分层精准注入 | 浅层拼接 + 中层交叉注意力 + 深层 AdaLN | 首帧一致性占比 35% |
| 传播器 | 时序持续约束 | 首帧跨帧注意力 + 相邻帧复用 + 低频锚定 | 长视频稳定性占比 20% |
1. 编码器层:多尺度特征提取
参考图进入管线后,先完成归一化、人脸对齐、质量增强三步预处理。自研 ViT 编码器会输出三个尺度的特征向量:
- 浅层特征:对应像素级纹理、光影细节,分辨率最高
- 中层特征:对应主体结构、轮廓形态,分辨率居中
- 深层特征:对应风格语义、整体氛围,分辨率最低
编码器支持最高 4096×4096 输入分辨率,会自适应下采样至原生处理分辨率,避免高分辨率参考图直接缩放导致的细节丢失。
2. 注入器层:分层精准注入
这是条件控制的核心环节。不同层级特征会在 DiT 网络的对应深度参与去噪,而不是全部堆在输入层:
- 浅层特征在网络前 1/3 段通过通道拼接注入,负责保留皮肤纹理、衣物花纹这类细节
- 中层特征在网络中间段通过交叉注意力注入,负责锁定主体结构、人物五官
- 深层特征在网络后 1/3 段通过 AdaLN(自适应层归一化)注入,负责把控整体风格和色调
这种设计的好处很直观。比如你用一张人物参考图做图生视频,不会出现 "脸像了但衣服花纹全没了",或者 "细节保留了但人物越跑越偏" 的情况。各管一段,互不干扰。
3. 传播器层:时序持续约束
首帧特征稳住了,后面帧怎么不漂移?传播器层做了三重保障:
- 首帧跨帧注意力:每生成新一帧,都会回头和首帧特征做注意力对齐,锚定主体身份
- 相邻帧特征复用:前一帧的中间特征会直接复用给下一帧,减少逐帧重复计算
- 低频分量锚定:每隔固定帧数强制对齐一次低频结构特征,抑制累积误差
实测下来,这套三级架构在 10 秒视频内的主体特征保留率能稳定在 92% 以上,比单层级注入方案高出近 20 个百分点。
三、时空解耦 DiT 与条件控制的协同机制
条件信号最终要作用于主干网络才能生效。Vera1.1 采用时空分离的 DiT 架构,将空间注意力与时序注意力解耦,条件控制模块也对应做了空间、时序双路适配。
1. 双流条件注入通路
整个主干网络有两条并行的条件通路,分别处理空间控制和时序控制:
- 空间条件流:处理参考图、布局掩码、区域提示等空间维度控制信号,注入空间注意力层
- 时序条件流:处理相机轨迹、运动幅度、帧率参数等时间维度控制信号,注入时序注意力层
两条通路在每个 DiT 块末尾做特征融合,既保证了各自控制的精准性,又避免了信号互相干扰。比如你调整镜头推进速度,只会影响时序条件流,不会改变画面里的主体外观。
2. 时序注意力窗口与帧特征缓存
Vera1.1 原生时序注意力窗口为 16 帧,采用稀疏因果注意力机制。对无限画布场景,模型做了专门优化:
- 滑动窗口内,相机轨迹参数会作为位置偏置嵌入注意力计算,让运动轨迹更平滑
- 窗口边界处,前一窗口的最后 4 帧特征会缓存下来,作为下一窗口的上下文输入
- 关键节点帧的特征会做持久化缓存,整个生成过程中可随时被调用对齐
很多人关心长视频会不会越往后越崩。答案是会,但 Vera1.1 通过帧特征缓存 + 节点锚定的组合方案,把漂移速度压得很低。我们实测 30 秒连续生成,主体相似度下降幅度控制在 8% 以内,商用场景基本可用。
3. 运镜约束的条件编码
无限画布的运镜不是简单的画面裁切。Vera1.1 把相机参数拆解成了六个自由度:水平位移、垂直位移、纵深推进、水平旋转、垂直旋转、视场角。每个参数都会被编码成连续的条件嵌入向量,在每个时间步参与计算。
两个节点之间的相机参数变化,模型会做贝塞尔曲线插值,支持加减速、缓入缓出。镜头运动和真实摄影机的运动逻辑一致,不会有生硬的瞬移感。如果两个节点差异很大,模型会自动延长过渡时长,保证变化过程自然;如果差异很小,就缩短过渡,保证节奏紧凑。不用人工手动调每一段的过渡长度。
四、分镜节点化的条件调度逻辑
无限画布不是一次性生成整张超大图再裁切,那样显存根本扛不住。Vera1.1 采用分层调度架构,分三个阶段执行,既保证全局一致性,又兼顾生成效率。
第一阶段:全局锚定生成
并行生成所有节点的关键帧,只跑关键帧的去噪步骤,速度很快。这个阶段主要做两件事:
- 全局一致性校验:检查所有节点的主体、风格、色调是否统一
- 人工调整窗口:创作者可以在这个阶段快速调整节点位置、参数,成本很低
这一步很重要。很多团队做无限画布容易踩的坑,就是先生成再返工。先把所有关键帧跑出来,确认大方向没问题再往下走,能省大量算力和时间。
第二阶段:过渡段并行生成
确认关键帧没问题后,多个节点之间的过渡段可以并行生成,充分利用算力。每个过渡段都会接收首尾两个节点的条件约束,中间帧由模型自动插值生成。
这里有个细节:相邻过渡段的重叠区域会做特征融合,而不是简单拼接。重叠帧数默认是 4 帧,可根据场景调整。这样处理后,节点衔接处不会出现明显的跳变感。
第三阶段:全局后处理与对齐
所有片段生成完成后,还会跑一遍全局一致性校准。主要校正三个地方:
- 色彩亮度统一:消除不同片段间的色差
- 主体位置对齐:确保跨节点的空间坐标连续
- 运动曲线平滑:修正过渡段衔接处的运动顿挫
五、工程落地:无限画布的显存优化方案
聊完架构,再说说大家最关心的落地问题。无限画布听着很酷,镜头一推、画幅一扩,显存占用直接跳崖式上涨。不少持 24G 显存显卡的团队,跑 2K 无限画布都得小心翼翼,稍不注意就直接崩。
Vera1.1 针对这个问题做了四层优化,我们实测在 24G 显卡上能稳定运行 2.7K/30 秒,画质无损、无缝拼接。
| 优化层级 | 技术方案 | 显存降低幅度 | 画质影响 |
| 注意力层 | 空间分块稀疏注意力 | 40%+ | 无感知 |
| 特征调度 | 时序特征分级调度 | 15% 左右 | 无感知 |
| 计算策略 | 中间特征按需重计算 | 12% 左右 | 速度换显存 |
| 窗口机制 | 滑动窗口增量复用 | 10% 左右 | 无感知 |
具体说几个关键点:
- 空间分块稀疏注意力:把大画布拆成多个块,每个块只和周边块做注意力交互,不是全图计算。块之间有重叠区域保证无缝,肉眼完全看不出拼接痕迹
- 时序特征分级调度:高频细节特征只在当前窗口保留,低频结构特征全局常驻。需要的时候再加载,不用一直占着显存
- 滑动窗口增量复用:生成窗口移动时,保留重叠区域的计算结果,只计算新增区域,既省显存又提速度
这里也解答一个高频疑问:无限画布是不是分辨率越高越好?不一定。商用场景下,2.7K 基本是性价比最高的档位。4K 固然清晰,但显存占用翻倍,生成速度慢一半,大多数交付场景其实用不上。
六、团队实践心得:从技术到落地的几个关键点
我们团队用 Vera1.1 做了三个多月的工业化落地,踩了不少坑,也总结了几条经验。
第一,条件控制不是越多越好。很多人刚上手喜欢堆条件,又加参考图又加布局掩码还加运动曲线,最后反而互相打架。通常文本 + 主参考图 + 相机轨迹这三路条件,就能覆盖 80% 以上的商用场景。条件加得越满,调试成本越高,出问题排查起来越麻烦。
第二,节点密度要匹配运动幅度。慢镜头、小范围移动,节点可以疏一些,3-5 秒一个就行;快速运镜、大场景转换,节点就要加密,1-2 秒一个。节点太疏容易中间跑偏,太密又浪费算力,得根据具体场景找平衡点。
第三,团队协作要适配新范式。传统视频生成是 "写提示词→出片→改提示词" 的线性流程,无限画布是 "搭节点→调轨迹→精修细节" 的空间化流程。策划、美术、技术的协作方式都要跟着变,不然很容易出现沟通错位。比如美术出的参考图,要标注清楚对应的空间坐标和镜头角度,而不是只给一张图。
第四,显存管理要做前置规划。做项目前先算好分辨率、时长、节点数对应的显存需求,别等到渲染一半爆显存了再救火。我们现在的标准流程是先用低分辨率跑通全链路,确认没问题再升分辨率,稳很多。