AI视频生成分辨率越做越高,从720p到4K,再到8K。
但很多人不知道,模型从来不是直接在像素空间里"画"视频的。一帧4K画面有800多万像素,一段10秒视频近20亿像素,直接在这个维度上做生成,计算量根本不可行。
解决方案是VAE时空压缩——先把视频压到一个小得多的潜空间里,在潜空间完成生成,再解码回高清像素。星宇智算AI视频工作台采用的就是这套技术路线。
VAE时空压缩到底在做什么
先说最基本的概念。VAE(变分自编码器)由编码器和解码器两部分组成。编码器把原始视频"压"成潜变量(latent),解码器再把潜变量"还原"成视频帧。
图像生成里的VAE只压缩空间维度,比如把1024×1024的图像压成128×128的潜空间(8倍下采样)。但视频多了一个时间维度,所以视频VAE要做时空双压缩——空间和时间同时下采样。
举个具体的例子。LTX-Video的VAE做到了空间32倍、时间8倍的下采样,潜空间里一个点对应原始视频中32×32×8的像素块,总压缩比达到1:192。Wan2.2的VAE是空间16倍、时间4倍,总压缩比1:1024。Step-Video用的是16×16空间加8倍时间压缩。
不同模型选不同的压缩比,背后是计算效率和重建质量的权衡。
为什么这件事值得单独讲
可能有人会问:VAE不就是个压缩工具吗,有必要单独拿出来说?
还真有必要。VAE的好坏,直接决定视频生成的上限。
第一,压缩比决定了能生成多大的分辨率。潜空间尺寸和原始视频分辨率成正比。压缩比越高,同样显存能处理的分辨率就越大。如果VAE只能做到8倍空间压缩,生成4K视频需要的潜空间是480×270,这对DiT来说已经是很大的计算量。
第二,重建质量决定了最终画面的清晰度。压缩不是无损的。VAE在编码-解码过程中会丢失高频细节——纹理、文字、细小的物体边缘。如果VAE的重建能力不行,后面的扩散模型再强,最终输出也会模糊。很多人遇到的"AI视频文字糊成一团""人脸细节丢失",根子往往在VAE。
第三,时间压缩的质量决定了帧间一致性。时间维度的下采样会把多帧信息压缩到一起,压缩策略不好,解码时就会出现帧间闪烁、运动不连贯、轨迹跳变。
技术实现:三个核心模块
星宇智算的VAE时空压缩方案,核心由三个模块构成,这个架构和当前业界主流一致——HunyuanVideo的3D VAE、CogVideoX的3D Causal VAE、Wan系列的因果3D VAE,走的都是同一条路线。
3D因果卷积编码器:时空联合下采样
编码器的核心是3D卷积(Conv3D)。和图像VAE用的2D卷积不同,3D卷积的卷积核同时覆盖高度、宽度、时间三个维度,能在一次操作中同时完成空间和时间的下采样。
更关键的是因果约束(causal)。当前帧的潜变量只能看到当前帧和之前的帧,不能"偷看"未来帧。这个约束看起来是限制,实际带来两个好处:一是训练好的VAE同时支持图像(单帧)和视频(多帧)输入,不用维护两套模型;二是支持流式生成,可以一帧一帧解码,不用等整个视频生成完再输出。
潜空间表征:通道数与压缩比的权衡
潜空间不是一个二维矩阵,而是一个三维张量——高度、宽度、通道数。通道数决定了每个空间位置能携带多少信息。
典型的图像VAE用16个通道,但视频VAE通常用更多。LTX-Video用了128个通道的潜空间深度——因为时间压缩后,每个潜变量要承载更多帧的信息,通道数不够就会信息溢出。通道数和压缩比是一对矛盾:压缩比越高,每个潜变量要承载的像素越多,就需要更多通道来编码;但通道越多,潜空间越大,计算量也跟着上去。
解码器重建:从潜空间回像素
解码器做的是编码器的逆操作——用3D反卷积把潜变量逐步上采样回原始分辨率。但解码不是简单的"放大",解码器需要学会填补编码时丢失的高频细节。
这里有个容易被忽略的点:VAE的训练目标和扩散模型的训练目标是分开的。VAE只负责重建质量,不负责语义正确性;扩散模型在潜空间里负责语义和内容。两者配合得好,最终输出才会既清晰又合理。
实际能解决什么问题
说了这么多技术,最终要落到能用的功能上。
VAE时空压缩模块优化后,AI视频工作台在三个方面有了明显提升。
高分辨率支持。 通过更高的空间压缩比和更优的潜空间通道配置,工作台可以在相同显存下生成更高分辨率的视频,4K输出不再需要分段拼接。
推理速度提升。 潜空间尺寸缩小后,DiT的计算量同比下降。以1:192的压缩比为例,DiT需要处理的token数量只有像素空间的1/192,生成速度显著加快。
帧间一致性改善。 因果3D卷积的时间压缩策略减少了帧间信息丢失,解码后的视频在运动连贯性上更稳定,闪烁和跳变明显减少。
最后
AI视频生成的每一次分辨率跃升,背后都有VAE的默默支撑。
它不像扩散模型那样引人注目,却是整个生成流程的"第一公里"和"最后一公里"——输入时把视频压进潜空间,输出时把潜空间还原成画面。压缩比和重建质量的平衡,是一个持续优化的工程问题。
星宇智算把这套能力打磨进AI视频工作台,目标很明确:让高分辨率视频生成,既快又清楚。