LeviTor:蚂蚁集团开源3D目标轨迹控制视频合成技术,能够控制视频中3D物体的运动轨迹

简介: LeviTor是由南京大学、蚂蚁集团等机构联合推出的3D目标轨迹控制视频合成技术,通过结合深度信息和K-means聚类点控制视频中3D物体的轨迹,无需显式的3D轨迹跟踪。

❤️ 如果你也关注 AI 的发展现状,且对 AI 应用开发非常感兴趣,我会每日跟你分享最新的 AI 资讯和开源应用,也会不定期分享自己的想法和开源实例,欢迎关注我哦!

🥦 微信公众号|搜一搜:蚝油菜花 🥦


🚀 快速阅读

  1. 技术背景:LeviTor结合深度信息和K-means聚类点控制视频中3D物体的轨迹,无需显式的3D轨迹跟踪。
  2. 主要功能:精确操控物体运动、增强创意应用、简化用户输入、自动提取深度信息和物体掩码。
  3. 应用场景:适用于电影特效、游戏动画、虚拟现实、增强现实和广告视频制作等多个领域。

正文(附运行示例)

LeviTor 是什么

公众号: 蚝油菜花 - LeviTor

LeviTor是由南京大学、蚂蚁集团、浙江大学等机构联合推出的图像到视频合成技术。该技术结合了深度信息和K-means聚类点,能够控制视频中3D物体的轨迹,而无需显式的3D轨迹跟踪。LeviTor使用高质量的视频对象分割数据集进行训练,能够有效捕捉复杂场景中的物体运动和交互。

通过用户友好的推理流程,LeviTor简化了3D轨迹输入,使得视频生成技术更加先进和易用。它的引入为3D物体轨迹控制铺平了道路,拓宽了创意应用的范围,适用于更广泛的用户群体。

LeviTor 的主要功能

  • 精确操控物体运动:在从静态图像生成视频时,精确控制物体的运动轨迹。
  • 增强创意应用:基于3D轨迹控制,拓宽视频合成的创意应用范围。
  • 简化用户输入:用户可以通过简单的2D图像上的绘制和深度调整输入3D轨迹,降低技术门槛。
  • 自动提取深度信息和物体掩码:系统自动从图像中提取深度信息和物体掩码,减少用户操作。
  • 交互式轨迹绘制:用户可以交互式地绘制物体轨迹,系统将其解释为3D路径。

LeviTor 的技术原理

  • K-means聚类:对视频对象掩码(mask)的像素进行K-means聚类,得到一组代表性的控制点。
  • 深度信息融合:深度估计网络DepthAnythingV2预测相对深度图,并在每个控制点采样深度,为控制点增添深度信息。
  • 控制信号构建:结合2D坐标和估计的深度值,构建控制轨迹,轨迹作为视频扩散模型的控制信号。
  • 视频扩散模型:将控制信号输入到视频扩散模型中,生成与3D轨迹对齐的视频。
  • 用户友好的推理流程:设计用户友好的交互系统,用户通过点击和调整深度值输入3D轨迹。

如何运行 LeviTor

环境设置

  1. 克隆仓库:

    git clone https://github.com/qiuyu96/LeviTor.git
    cd LeviTor
    
  2. 下载并解压检查点:
    创建checkpoints目录并下载相关检查点文件:

    mkdir checkpoints
    cd checkpoints
    

    下载以下文件:

确保所有检查点文件位于checkpoints目录下:

checkpoints/
|-- sam_vit_h_4b8939.pth
|-- depth_anything_v2_vitl.pth
|-- stable-video-diffusion-img2vid-xt/
|-- LeviTor/
    |-- random_states_0.pkl
    |-- scaler.pt
    |-- scheduler.bin
    |-- controlnet/
    |-- unet/
  1. 创建环境:

    conda create -n LeviTor python=3.9 -y
    conda activate LeviTor
    
  2. 安装依赖包:

    pip install -r requirements.txt
    
  3. 安装pytorch3d:

    pip install "git+https://github.com/facebookresearch/pytorch3d.git"
    
  4. 安装gradio:

    pip install gradio==4.36.1
    
  5. 运行LeviTor:

    python gradio_demo/gradio_run.py \
    --frame_interval 1 \
    --num_frames 16 \
    --pretrained_model_name_or_path checkpoints/stable-video-diffusion-img2vid-xt \
    --resume_from_checkpoint checkpoints/LeviTor \
    --width 288 \
    --height 512 \
    --seed 217113 \
    --mixed_precision fp16 \
    --enable_xformers_memory_efficient_attention \
    --output_dir ./outputs \
    --gaussian_r 10 \
    --sam_path checkpoints/sam_vit_h_4b8939.pth \
    --depthanything_path checkpoints/depth_anything_v2_vitl.pth
    

资源


❤️ 如果你也关注 AI 的发展现状,且对 AI 应用开发非常感兴趣,我会每日跟你分享最新的 AI 资讯和开源应用,也会不定期分享自己的想法和开源实例,欢迎关注我哦!

🥦 微信公众号|搜一搜:蚝油菜花 🥦

相关文章
|
监控 数据可视化 项目管理
CM模式是什么?如何应用?
CM 模式(Construction Management)即建设管理模式,起源于20世纪60年代的美国,通过专业的建设管理团队在项目早期介入,优化设计方案,协调各方资源,有效提升项目质量和进度控制。该模式已广泛应用于各类建筑工程,并不断创新发展,适应数字化、绿色建筑及国际化需求。未来,CM模式将继续推动建筑行业的进步。
2356 2
|
SQL 前端开发 Oracle
mysql合并查询(多张表) union 和 union all
简介 小序 :今天写首页动态业务的时候,用到了两张表,还需要分页查询,刚开始以为需要关联查询,后来发现关联的话不会放到一个实体,然后我就上网找方法,然后发现了一个我没学过的sql语句union,union all,卧槽 还是得好好学习啊,前端我想学,mysql我想学,真的时间不够用啊,还得给学弟学妹拍趣味编程课看的视频,真的是烦啊! 如果我们需要将两个select语句的结果作为一个整体显示出来,我们就需要用到union或者union all关键字。union(或称为联合)的作用是将多个结果合并在一起显示出来。 UNION 操作符用于合并两个或多个 SELECT 语句的结果集。
2158 1
mysql合并查询(多张表) union 和 union all
|
开发者
UOS系统如何给软件签名
UOS系统如何给软件签名
UOS系统如何给软件签名
|
安全 JavaScript Java
SpringBoot实现定时发送邮件
SpringBoot实现定时发送邮件
479 0
|
11月前
|
JSON API 数据安全/隐私保护
拼多多商品详情 API 的 5 个 “潜规则”
拼多多商品详情API坑多细节杂:13位商品ID、签名拼接无尾&、规格需自行组合、价格分拼团/单买。本文亲历踩坑,详解签名生成、规格解析代码,助你避坑提效,轻松对接PDD接口开发。
|
6月前
|
弹性计算 人工智能 机器人
超详细!Hermes Agent 一键部署全流程指南,轻松上手不踩坑
本文将为大家分享 Hermes Agent 一键部署全流程指南,助力大家轻松上手不踩坑!
3694 17
|
传感器 人工智能 监控
【免费开源】基于STM32的智能宠物喂食系统设计与实现(全流程技术详解)附源码
本项目基于STM32F103C8T6设计实现智能宠物喂食系统,支持定时喂食、远程控制、余粮检测、语音提示等功能,结合传感器与物联网技术,提升宠物喂养智能化水平,适用于家庭及嵌入式课程实践。源码开源,具备良好扩展性。
【免费开源】基于STM32的智能宠物喂食系统设计与实现(全流程技术详解)附源码
|
Linux iOS开发 Python
解决安装flash-attn时的错误报告
记住,程序包安装问题就像个顽皮的谜题,得一步步解开,耐心是解决问题的钥匙,没有什么问题是一顿猛敲键盘解决不了的,如果有,那就两顿。
2884 8
|
存储 人工智能 JSON
AI智能体内战终结者!A2A:谷歌开源的首个标准智能体交互协议,让AI用同一种“语言”交流
A2A是谷歌推出的首个标准化智能体交互协议,通过统一通信规范实现不同框架AI智能体的安全协作,支持多模态交互和长时任务管理,已有50多家企业加入生态。
1225 0
AI智能体内战终结者!A2A:谷歌开源的首个标准智能体交互协议,让AI用同一种“语言”交流

热门文章

最新文章