VideoPhy:UCLA 和谷歌联合推出评估视频生成模型物理模拟能力的评估工具,衡量模型生成的视频是否遵循现实世界的物理规则

简介: VideoPhy 是 UCLA 和谷歌联合推出的首个评估视频生成模型物理常识能力的基准测试,旨在衡量模型生成的视频是否遵循现实世界的物理规则。

❤️ 如果你也关注 AI 的发展现状,且对 AI 应用开发非常感兴趣,我会每日跟你分享最新的 AI 资讯和开源应用,也会不定期分享自己的想法和开源实例,欢迎关注我哦!

🥦 微信公众号|搜一搜:蚝油菜花 🥦

原文链接:https://mp.weixin.qq.com/s/xYjs-dardpLDiK3-Oo1oeg


🚀 快速阅读

  1. 功能:评估视频生成模型是否遵循物理常识。
  2. 数据集:包含 688 个描述物理互动的字幕,用于生成和评估视频。
  3. 评估方式:结合人类评估和自动评估工具 VideoCon-Physics,评估视频的语义一致性和物理常识。

正文(附运行示例)

VideoPhy 是什么

公众号: 蚝油菜花 - videophy

VideoPhy 是由 UCLA 和谷歌研究研究院联合推出的首个评估视频生成模型物理常识能力的基准测试。它旨在衡量模型生成的视频是否遵循现实世界的物理规则。VideoPhy 基准包含 688 个描述物理互动的字幕,用于从多种文本到视频模型中生成视频,并进行人类及自动评估。

研究发现,即使是最佳模型,也仅有 39.6% 的视频能同时遵循文本提示和物理法则。VideoPhy 强调视频生成模型在模拟物理世界方面的局限性,并推出了自动评估工具 VideoCon-Physics,以支持未来模型的可靠评估。

VideoPhy 的主要功能

  • 评估视频生成模型的物理常识:测试文本到视频(text-to-video)生成模型是否能生成符合物理常识的视频内容。
  • 提供标准化测试集:包含 688 个经过人类验证的描述性字幕,涉及固体-固体、固体-流体和流体-流体之间的物理互动,用于生成视频并进行评估。
  • 人类评估与自动评估:结合人类评估和自动评估工具 VideoCon-Physics,评估视频的语义一致性和物理常识。
  • 模型性能比较:比较不同模型在 VideoPhy 数据集上的表现,确定哪些模型在遵循物理法则方面表现更好。
  • 促进模型改进:揭示现有模型在模拟物理世界方面的不足,推动研究者开发出更符合物理常识的视频生成模型。

VideoPhy 的技术原理

  • 数据集构建:VideoPhy 的数据集基于三阶段的流程构建,包括使用大型语言模型生成候选字幕、人类验证字幕的质量及标注视频生成的难度。
  • 视频生成:用不同的文本到视频生成模型,根据 VideoPhy 数据集中的字幕生成视频。
  • 人类评估:基于亚马逊机械土耳其(Amazon Mechanical Turk)上的人工评估者对生成的视频进行语义一致性和物理常识的评分。
  • 自动评估模型:推出 VideoCon-Physics,基于 VIDEOCON 视频-语言模型的自动评估器,用于评估生成视频的语义一致性和物理常识。
  • 性能指标:用二元反馈(0 或 1)评估视频的语义一致性(Semantic Adherence, SA)和物理常识(Physical Commonsense, PC)。

如何运行 VideoPhy

1. 创建 conda 环境

conda create -n videophy python=3.10
conda activate videophy

2. 安装依赖

pip install -r requirements.txt

3. 下载模型检查点

git lfs install
git clone https://huggingface.co/videophysics/videocon_physics

4. 准备数据

python utils/prepare_data.py --input_csv examples/example.csv --output_folder examples/

5. 评估语义一致性

CUDA_VISIBLE_DEVICES=0 python videocon/training/pipeline_video/entailment_inference.py --input_csv examples/sa_testing.csv --output_csv examples/videocon_physics_sa_testing.csv --checkpoint <dir_for_downloaded_ckpt/videocon_physics/>

6. 评估物理常识

CUDA_VISIBLE_DEVICES=0 python videocon/training/pipeline_video/entailment_inference.py --input_csv examples/physics_testing.csv --output_csv examples/videocon_physics_pc_testing.csv --checkpoint <dir_for_downloaded_ckpt/videocon_physics/>

资源


❤️ 如果你也关注 AI 的发展现状,且对 AI 应用开发非常感兴趣,我会每日跟你分享最新的 AI 资讯和开源应用,也会不定期分享自己的想法和开源实例,欢迎关注我哦!

🥦 微信公众号|搜一搜:蚝油菜花 🥦

相关文章
|
IDE JavaScript 开发工具
卸载NotePad++/SublimeText吧:VSCode才是史上最优秀的IDE编辑器
免费,这应该是所有人都所希望的,而且居然是微软开源免费的,你敢信吗?vscode使用的是MIT Lisense, 可随意下载, 分发, 商用等。下载地址:
|
10月前
|
编解码 调度 图形学
腾讯混元世界模型1.1开源:支持多视图及视频输入,单卡部署,秒级生成_魔搭ModelScope社区-ModelScope魔搭社区
混元世界模型1.1(WorldMirror)发布,支持多视图、视频输入,单卡秒级生成3D场景。兼容CG管线,开源可部署,实现点云、深度、相机等多任务统一预测,性能领先。
697 1
|
4月前
|
人工智能 安全 Windows
2026 版 OpenClaw Win11 安装与配置全流程
OpenClaw(GitHub星标28W+)是开源本地AI智能体,支持电脑操控、文件整理、浏览器/办公自动化,数据不出设备,隐私安全。本教程专为Windows 11优化,解决Defender拦截、中文路径等问题,双击即可一键部署,3–5分钟快速启用。(239字)
|
机器学习/深度学习 人工智能 编解码
阿里开源AI视频生成大模型 Wan2.1:14B性能超越Sora、Luma等模型,一键生成复杂运动视频
Wan2.1是阿里云开源的一款AI视频生成大模型,支持文生视频和图生视频任务,具备强大的视觉生成能力,性能超越Sora、Luma等国内外模型。
8808 2
阿里开源AI视频生成大模型 Wan2.1:14B性能超越Sora、Luma等模型,一键生成复杂运动视频
|
编解码 人工智能 缓存
通义万相重磅升级,成功登顶VBench,阿里云百炼邀您第一时间体验
阿里云通义万相推出2.1视频生成模型,大幅提升复杂运动、物理规律遵循及艺术表现,在权威评测VBench中夺冠。新模型采用自研VAE和DiT架构,增强时空上下文建模,实现更稳定的大幅度肢体运动和多对象生成。通义万相支持中英文文字特效生成,满足广告设计、短视频等创作需求,并在阿里云百炼平台开放API调用,提供免费试用资源。
2276 0
|
自然语言处理 测试技术 API
MindIE BenchMark
MindIE Benchmark工具通过部署昇腾服务化配套包,以终端命令方式测试大语言模型在不同配置下的推理性能和精度。它支持Client和Engine两种推理模式:Client模式适用于多用户并发场景,兼容多种接口;Engine模式直接调用底层API,测量NPU卡的真实性能。该工具支持多个数据集进行精度和性能测试,如CEval 5-shot、CMMLU、GSM8K等,并将结果保存为本地csv文件。评测方法包括调用大模型输入题目,解析返回结果并与正确答案比较,计算平均分和其他指标如准确率、EM等。
|
编解码 并行计算 物联网
4G显存部署Flux,2分钟Wan2.1-14B视频生成,DiffSynth-Engine引擎开源!
魔搭社区的开源项目 DiffSynth-Studio 自推出以来,凭借其前沿的技术探索和卓越的创新能力,持续受到开源社区的高度关注与广泛好评。截至目前,该项目已在 GitHub 上斩获超过 8,000 颗星,成为备受瞩目的开源项目之一。作为以技术探索为核心理念的实践平台,DiffSynth-Studio 基于扩散模型(Diffusion Model),在图像生成和视频生成领域孵化出了一系列富有创意且实用的技术成果,其中包括 ExVideo、ArtAug、EliGen 等代表性模块。
2416 3
|
Ubuntu 大数据 Linux
大数据入门系列 2:全网最全,VMware 虚拟机上安装 Ubuntu 完整步骤及需要注意的问题
大数据入门系列 2:全网最全,VMware 虚拟机上安装 Ubuntu 完整步骤及需要注意的问题
2651 1
大数据入门系列 2:全网最全,VMware 虚拟机上安装 Ubuntu 完整步骤及需要注意的问题
|
机器学习/深度学习 索引
深度学习基础:标量、向量、矩阵、张量
深度学习基础:标量、向量、矩阵、张量
2263 0
深度学习基础:标量、向量、矩阵、张量
|
机器学习/深度学习 存储 运维
ICML 2024:清华提出时间序列大模型:面向通用时序分析的生成式Transformer
【8月更文挑战第7天】在2024年ICML大会上,清华大学团队推出“时间序列大模型(LTSM)”——Timer,一种处理大规模时间序列数据的生成式Transformer。该模型通过预训练学习通用特征,支持多种任务如预测与异常检测。Timer采用统一的数据格式S3处理异构序列,并在数据稀缺场景下展现出色性能。尽管如此,模型泛化能力与计算效率仍有待优化。论文详情参见:https://arxiv.org/abs/2402.02368。
3640 4

热门文章

最新文章