TransPixar:港中文联合 Adobe 开源透明背景视频生成模型,生成透明背景的 RGBA 视频,助力特效等视觉效果制作

简介: TransPixar 是由港中文、Adobe 等机构联合开源的文本到视频生成技术,支持生成包含透明背景的 RGBA 视频,适用于娱乐、广告、教育等多个领域。

❤️ 如果你也关注 AI 的发展现状,且对 AI 应用开发非常感兴趣,我会每日分享大模型与 AI 领域的最新开源项目和应用,提供运行实例和实用教程,帮助你快速上手AI技术,欢迎关注我哦!

🥦 微信公众号|搜一搜:蚝油菜花 🥦


🚀 快速阅读

  1. 功能:支持生成包含透明背景的 RGBA 视频,适用于复杂视觉效果创作。
  2. 技术:基于扩散变换器(DiT)架构,结合 LoRA 微调,实现 RGB 和 alpha 通道的联合生成。
  3. 应用:广泛应用于娱乐、广告、教育等领域,助力视觉效果和交互式内容创作。

正文(附运行示例)

TransPixar 是什么

TransPixar

TransPixar 是由香港中文大学、Adobe 研究院、香港科技大学和智能摩尔联合开源的先进文本到视频生成技术。它扩展了预训练的 RGB 视频模型,能够生成包含透明度信息的 RGBA 视频。TransPixar 基于扩散变换器(DiT)架构,通过引入 alpha 特定的 token 和基于 LoRA 的微调,实现了 RGB 和 alpha 通道的联合生成,确保了高度一致性。

TransPixar 优化了注意力机制,保留了原始 RGB 模型的优势,即使在有限的训练数据下,也能生成多样化且对齐度高的 RGBA 视频。它支持创建包含烟雾、反射等透明元素的视频,并提供高度逼真的视觉效果。TransPixar 在娱乐、广告和教育等领域的应用前景广阔,为视觉效果(VFX)和交互式内容创作提供了新的可能性。

TransPixar 的主要功能

  • RGBA 视频生成:从文本描述生成包含 RGB 颜色通道和 alpha 透明度通道的视频,实现复杂视觉效果的创建。
  • 透明效果处理:支持生成具有透明属性的元素,如烟雾、反射等,无缝融入背景场景,适用于视觉效果(VFX)等应用。
  • 高质量视频生成:在生成 RGBA 视频的同时,保留原始 RGB 视频生成模型的高质量,确保视频的清晰度和细节表现。
  • 多场景适应性:适用于各种场景和对象类型的视频生成,包括人物动作、自然景观、动态效果等,具有良好的泛化能力。
  • 文本驱动内容创作:根据输入的文本描述,生成与之匹配的视频内容,实现文本到视频的自动化创作,提高内容生产的效率和创意性。

TransPixar 的技术原理

  • 扩散变换器(DiT)架构:基于 DiT 模型,用自注意力机制捕捉视频帧之间的长程依赖关系,实现对视频内容的精细建模和生成。
  • alpha 通道生成:在 DiT 模型中引入 alpha 特定的 token,与 RGB token 的联合生成,实现 alpha 通道的生成,支持 RGBA 视频的输出。
  • LoRA 微调:基于 LoRA(Low-rank Adaptation)的微调方案,对 alpha token 的投影进行微调,保持 RGB 生成质量的同时,优化 alpha 通道的生成。
  • 注意力机制优化:系统分析并优化 RGBA 生成过程中的注意力机制,包括 Text-attend-to-RGB、RGB-attend-to-Text、RGB-attend-to-Alpha 等,基于调整注意力计算,实现 RGB 和 alpha 通道之间的强对齐和高质量生成。
  • 数据集扩展与训练策略:在有限的 RGBA 视频数据集上进行训练,基于合理的数据预处理和训练策略,提高模型对多样化场景和对象类型的适应能力,增强生成内容的多样性和一致性。

如何运行 TransPixar

1. 安装环境

首先,创建一个新的 Conda 环境并安装所需的依赖项:

conda create -n TransPixar python=3.10
conda activate TransPixar
pip install -r requirements.txt

2. 启动 Gradio 演示

你可以通过以下命令启动本地的 Gradio 演示:

python app.py

3. 使用命令行生成 RGBA 视频

要生成 RGBA 视频,可以运行以下命令:

python cli.py \
    --lora_path /path/to/lora \
    --prompt "..." \

资源


❤️ 如果你也关注 AI 的发展现状,且对 AI 应用开发非常感兴趣,我会每日分享大模型与 AI 领域的最新开源项目和应用,提供运行实例和实用教程,帮助你快速上手AI技术,欢迎关注我哦!

🥦 微信公众号|搜一搜:蚝油菜花 🥦

相关文章
|
机器学习/深度学习 监控 数据库
人脸识别主要流程2
【1月更文挑战第5天】
|
前端开发 JavaScript 数据可视化
推荐! 使用react-cropper-pro实现图片裁切压缩上传
推荐! 使用react-cropper-pro实现图片裁切压缩上传
741 0
|
JSON JavaScript 前端开发
|
5月前
|
机器学习/深度学习 人工智能 安全
AI驱动网络攻防军备竞赛的演进机理与防御范式重构
本文剖析AI驱动的网络攻防军备竞赛,揭示生成式AI如何降低攻击门槛、加剧“攻防速度差”,导致安全运营拥堵。文章解构AI赋能的钓鱼、多态恶意代码与深度伪造攻击,并提出“自适应零信任”与“AI对抗训练”等新型防御范式,强调人机协同与动态博弈。(239字)
241 6
|
机器学习/深度学习 人工智能 物联网
TransPixar AI
TransPixar是由Adobe研究院与香港科技大学合作开发的AI系统,专注于文本到视频生成,特别擅长处理透明效果。它能生成包含Alpha通道的RGBA视频,使烟雾、反射等元素自然融入场景。采用扩散变换器架构和低秩适应微调方法,确保RGB和Alpha通道的一致性。该技术简化了视觉特效制作流程,降低了成本,并在娱乐、广告等领域有广泛应用前景。在线体验demo:[TransPixar](https://transpixar-ai.net/)。
|
8月前
|
XML 算法 安全
详解RAG五种分块策略,技术原理、优劣对比与场景选型之道
RAG通过检索与生成结合,突破大模型在企业应用中的局限,支持知识动态更新、降低幻觉风险。分块策略是其核心,直接影响检索效率与答案准确性。本文系统解析固定大小、语义、递归、结构化及LLM-based五种分块方法,对比优劣,提出选择建议,并探讨RAG在高风险领域的可验证性挑战与前沿优化方向。
|
机器学习/深度学习 机器人 PyTorch
企业内训|基于华为昇腾910B算力卡的大模型部署和调优-上海某央企智算中心
近日上海,TsingtaoAI为某央企智算中心交付华为昇腾910B算力卡的大模型部署和调优课程。课程深入讲解如何在昇腾NPU上高效地训练、调优和部署PyTorch与Transformer模型,并结合实际应用场景,探索如何优化和迁移模型至昇腾NPU平台。课程涵盖从模型预训练、微调、推理与评估,到性能对比、算子适配、模型调优等一系列关键技术,帮助学员深入理解昇腾NPU的优势及其与主流深度学习框架(如PyTorch、Deepspeed、MindSpore)的结合应用。
2020 4
|
12月前
|
JSON API 定位技术
公交线路站点查询API接口详解:免费获取全国公交路线数据
公交线路站点查询API提供全国公交数据,支持线路编号查询路线、站点、票价及运营时间。具备GET/POST请求方式,免费调用,适用于公交App、智慧交通及地图导航等场景。
1640 4
|
机器学习/深度学习 存储 自然语言处理
SeACo-Paraformer
【6月更文挑战第14天】
1163 6
|
Python
Python 将PowerPoint (PPT/PPTX) 转为HTML
使用Python将PowerPoint转换为HTML以适应网络分享。需安装`Spire.Presentation for Python`库,通过`pip install Spire.Presentation`。示例包括:1) 全部转换,使用`Presentation.SaveToFile()`方法;2) 转换特定幻灯片,通过`Presentation.Slides[]`获取幻灯片再保存。代码示例展示了具体操作步骤。
1317 6

热门文章

最新文章