每日学术速递4.20

简介: 建造一个可以通过观察人类来理解和学习互动的机器人激发了几个视觉问题。然而,尽管在静态数据集上取得了一些成功的结果,但目前的模型如何直接用在机器人上仍然不清楚。在本文中,我们旨在通过以环境为中心的方式利用人类互动视频来弥合这一差距。利用人类行为的互联网视频,我们训练了一个视觉可供性模型,该模型估计人类可能在场景中的位置和方式进行交互

CV - 计算机视觉 |  ML - 机器学习 |  RL - 强化学习 | NLP 自然语言处理


Subjects: cs.CV


1.Avatars Grow Legs: Generating Smooth Human Motion from Sparse Tracking Inputs with Diffusion Model(CVPR 2023)

c56322d6892cda6afa2343acca0a133d.png

标题:化身长腿:使用扩散模型从稀疏跟踪输入生成平滑的人体运动

作者:Yuming Du, Robin Kips, Albert Pumarola, Sebastian Starke, Ali Thabet, Artsiom Sanakoyeu

文章链接:https://arxiv.org/abs/2304.08577

项目代码:https://dulucas.github.io/agrol/

9661c52146952f0ba391321c1a373731.png

8cb7565e4126351898525439ca6be62c.png

f359a17f61cde5de9e8deccc07b5a365.png

56881d73133d81d1453040aad2de5b44.png

93840849a47dcee694b059e9e9b23196.png

摘要:

       随着近期 AR/VR 应用程序的流行,对 3D 全身化身的逼真和准确控制已成为人们迫切需要的功能。一个特殊的挑战是,独立的 HMD(头戴式设备)只能提供稀疏的跟踪信号,通常仅限于跟踪用户的头部和手腕。虽然此信号对于重建上半身运动非常有用,但下半身未被跟踪,必须从上半身关节提供的有限信息中合成。在本文中,我们提出了 AGRoL,这是一种新型条件扩散模型,专门设计用于在给定稀疏上半身跟踪信号的情况下跟踪全身。我们的模型基于一个简单的多层感知器 (MLP) 架构和一种新颖的运动数据调节方案。它可以预测准确而流畅的全身运动,尤其是具有挑战性的下半身运动。与常见的扩散架构不同,我们的紧凑架构可以实时运行,使其适用于在线身体跟踪应用程序。我们在 AMASS 运动捕捉数据集上训练和评估我们的模型,并证明我们的方法在生成的运动精度和平滑度方面优于最先进的方法。我们通过广泛的实验和消融研究进一步证明了我们的设计选择。

2Align your Latents: High-Resolution Video Synthesis with Latent Diffusion Models(CVPR 2023)

7f337b785ca34e5b6c9b340d7b9ac337.png

标题:对齐你的潜在:高分辨率视频合成与潜在扩散模型

作者:Andreas Blattmann, Robin Rombach, Huan Ling, Tim Dockhorn, Seung Wook Kim, Sanja Fidler, Karsten Kreis

文章链接:https://arxiv.org/abs/2304.08818

项目代码:https://research.nvidia.com/labs/toronto-ai/VideoLDM/

07387a42b6df434b2c44df23e1a35262.png

3ac834234f8991ddb091a25afa904333.png

6d8ace693b85b10833944440ee5bf427.png

摘要:

       潜在扩散模型 (LDM) 可实现高质量图像合成,同时通过在压缩的低维潜在空间中训练扩散模型来避免过多的计算需求。在这里,我们将 LDM 范例应用于高分辨率视频生成,这是一项特别耗费资源的任务。我们首先仅在图像上预训练 LDM;然后,我们通过在潜在空间扩散模型中引入时间维度并对编码图像序列(即视频)进行微调,将图像生成器转变为视频生成器。同样,我们在时间上对齐扩散模型上采样器,将它们变成时间一致的视频超分辨率模型。我们专注于两个相关的现实世界应用:模拟野外驾驶数据和使用文本到视频建模的创意内容创建。特别是,我们在分辨率为 512 x 1024 的真实驾驶视频上验证了我们的视频 LDM,实现了最先进的性能。此外,我们的方法可以轻松利用现成的预训练图像 LDM,因为在这种情况下我们只需要训练时间对齐模型。这样做,我们将公开可用的、最先进的文本到图像 LDM 稳定扩散转变为分辨率高达 1280 x 2048 的高效且富有表现力的文本到视频模型。我们表明,时间层经过训练以这种方式推广到不同的微调文本到图像 LDM。利用此属性,我们展示了个性化文本到视频生成的第一个结果,为未来的内容创建开辟了令人兴奋的方向。

Subjects: cs.RO


3.ImAffordances from Human Videos as a Versatile Representation for Robotics

bdccbad3abc8ee2b3099ea48683439fb.png


标题:人类视频的可供性作为机器人技术的多功能表示

作者:Shikhar Bahl, Russell Mendonca, Lili Chen, Unnat Jain, Deepak Pathak

文章链接:https://arxiv.org/abs/2304.08488

项目代码:https://robo-affordances.github.io/

f2235ef6c6df0d1a4b26f0b768253022.png

3cf2029876b5dc0b6764cb2251a08206.png

2c3adda1e3a5fa3aa9652e62c37f635c.png

cd265e4b4abfc7b108a5eabb7bbe5266.png

8b5de406f0a394f7adb9476bfc81d7f8.png

522f0f3f0104a01ae22b08ad7a80beac.png


摘要:

       建造一个可以通过观察人类来理解和学习互动的机器人激发了几个视觉问题。然而,尽管在静态数据集上取得了一些成功的结果,但目前的模型如何直接用在机器人上仍然不清楚。在本文中,我们旨在通过以环境为中心的方式利用人类互动视频来弥合这一差距。利用人类行为的互联网视频,我们训练了一个视觉可供性模型,该模型估计人类可能在场景中的位置和方式进行交互。这些行为可供性的结构直接使机器人能够执行许多复杂的任务。我们展示了如何将我们的可供性模型与四种机器人学习范式无缝集成,包括离线模仿学习、探索、目标条件学习和强化学习的动作参数化。我们展示了我们称为 VRB 的方法在 4 个真实世界环境、10 多个不同任务和 2 个在野外运行的机器人平台上的有效性。此 https URL 上的结果、可视化和视频

目录
相关文章
|
7月前
|
人工智能 数据可视化 开发工具
OpenClaw学习指南:OpenClaw云上部署+1600+OpenClaw Skills快速掌握
在AI工具爆炸的2026年,OpenClaw(原Clawdbot、Moltbot)凭借其开放的技能生态成为现象级工具——官方注册表收录3000+社区技能,经严格筛选后的1715+高质量Skills覆盖办公自动化、开发工具、内容创作等全场景。但面对海量技能,不少用户陷入“无从学起、学了就忘”的困境。
1137 3
|
开发工具 Nacos git
Git如何checkout远程tag
Git如何checkout远程tag
4586 0
|
JSON TensorFlow 算法框架/工具
Windows下安装Anaconda5.3.1+Python3.8+TensorFlow2.13.0-CPU版本总结
Windows下安装Anaconda5.3.1+Python3.8+TensorFlow2.13.0-CPU版本总结
1673 0
|
3月前
|
人工智能 安全 前端开发
ECC 讲透:Claude Code 的全能增强包,不只是 Agents 和 Skills
Everything Claude Code(ECC)是2026年爆火的AI编程增强框架,非简单提示词合集,而是集Agents、Skills、Rules、Hooks、MCP与AgentShield安全扫描于一体的“AI编程操作系统”,深度优化Claude Code等Agent Harness,已获近19万Star。(239字)
555 2
ECC 讲透:Claude Code 的全能增强包,不只是 Agents 和 Skills
|
9月前
|
存储 网络安全 对象存储
《用阿里云 OSS+CDN 搭建个人静态博客,成本不到 10 元 / 月》
用阿里云OSS+CDN搭建个人静态博客,成本低至每月5-10元。通过Hexo或Hugo生成静态文件,上传至OSS并开启静态网站托管,再结合CDN加速与自定义域名,轻松实现高效、稳定访问,无需维护服务器,适合个人开发者快速建站。
|
4月前
|
UED
KKCE:使用指南:一键搞定网站测速,优化加载体验
网站加载速度关乎用户留存与体验。本文介绍核心测速指标(如LCP、FID、CLS等)、零基础工具KKCE(多节点、免安装、一键测速),并提醒避坑要点及优化方向,助您持续提升性能、保障稳定运营。(239字)
685 2
|
11月前
|
存储 编解码 算法
《宋代水墨国漫3D:动态镜头笔触连贯的开发拆解》
本文分享国漫3D RPG开发中,解决宋代水墨风格在动态镜头下笔触断层的实战经验。开发团队摒弃传统预制纹理方案,采用“实时程序化生成”思路,先联合美术团队搭建含120幅宋画特征的笔触库,按视距分类参数;再通过拆分特征库、哈希表优化查询,将CPU延迟降至20ms内。同时,将技术与叙事结合,在“烟雨江南”关卡设计雨水交互模块,让水墨随角色动作动态变化。
483 1
|
11月前
|
监控 API 开发者
淘宝获取商品详情券后价API接口
本文介绍如何通过淘宝开放平台API获取商品券后价,涵盖API调用流程、Python代码示例及注意事项。基于官方接口taobao.item.get,解析商品价格与优惠券信息,实现自动化比价与优惠监控,适合电商开发者参考。(238字)
|
人工智能 JavaScript Devops
如何在云效中使用 DeepSeek 等大模型实现 AI 智能评审
除了代码智能补全外,AI 代码智能评审是 DevOps 领域受开发者广泛关注的另一场景了。本文,我们将结合云效代码管理 Codeup、流水线 Flow 和 DeepSeek,分享一种企业可快速自主接入,即可实现的 AI 智能评审解决方案,希望给大家一些启发。
924 18