每日学术速递5.7

简介: 我们考虑重建从立体相机观察到的动态场景的问题。大多数现有的立体深度方法独立处理不同的立体帧,导致时间上不一致的深度预测。时间一致性对于身临其境的 AR 或 VR 场景尤为重要,在这些场景中,闪烁会大大降低用户体验。我们提出了 DynamicStereo,这是一种基于变换器的新型架构,用于估计立体视频的视差。

CV - 计算机视觉 |  ML - 机器学习 |  RL - 强化学习 | NLP 自然语言处理

Subjects: cs.CV


1.Multimodal Procedural Planning via Dual Text-Image Prompting


7426389bdbe6a7557c8d2f037d00ca33.png


标题:通过双文本图像提示进行多模态程序规划

作者:Yujie Lu, Pan Lu, Zhiyu Chen, Wanrong Zhu, Xin Eric Wang, William Yang Wang

文章链接:https://arxiv.org/abs/2305.01795

项目代码:https://github.com/YujieLu10/TIP

b63f80d99595bcedc0fea6ba6b917e5c.png

de668818a4ed028247c41aed0d9fd54f.png

2d08b187d5f619d66388b75240aafab2.png

0e95c5fd1de06b6d6bde9ec19ec3d872.png

e69b8bef8d0b420c07b9034db4a86e87.png

0d5599a7eadf08935a8faffc343e797c.png

摘要:

       具身代理在遵循人类指令完成任务方面取得了突出的表现。然而,提供由文本和图像告知的指令以帮助人类完成任务的潜力仍未得到充分探索。为了揭示这种能力,我们提出了多模态程序规划 (MPP) 任务,在该任务中,模型被赋予一个高级目标并生成成对的文本-图像步骤的计划,提供比单模态计划更多的补充和信息指导。MPP 的主要挑战是确保跨模式计划的信息量、时间一致性和准确性。为了解决这个问题,我们提出了文本图像提示 (TIP),这是一种双模态提示方法,它联合利用大型语言模型 (LLM) 中的零样本推理能力和基于扩散模型的引人注目的文本到图像生成能力。TIP 使用 Text-to-Image Bridge 和 Image-to-Text Bridge 改进了双模态中的交互,允许 LLM 指导基于文本的图像计划生成,并利用图像计划的描述反向地基于文本计划。为了解决缺乏相关数据集的问题,我们收集了 WIKIPLAN 和 RECIPEPLAN 作为 MPP 的测试平台。我们的结果显示了在信息量、时间一致性和计划准确性方面,针对 WIKIPLAN 和 RECIPEPLAN 上的单峰和多峰基线的令人信服的人类偏好和自动评分。我们的代码和数据:这个 https URL 。

2.Generalizing Dataset Distillation via Deep Generative Prior

87b7fc909973f1ce65534f308bdff6df.png

标题:通过深度生成先验泛化数据集蒸馏

作者:George Cazenavette, Tongzhou Wang, Antonio Torralba, Alexei A. Efros, Jun-Yan Zhu

文章链接:https://arxiv.org/abs/2305.01649

项目代码:https://github.com/GeorgeCazenavette/glad

d7855c2c02f8f422066bac630e6c03fd.png

38bf6d1f1aa8d9aa62b69f8366397fcc.png

3816b382783ef67b46b0cc9f9af8bb01.png

cb74dc605278b139e3510c990c58f783.png

摘要:

       数据集蒸馏旨在将整个数据集的知识提炼成一些合成图像。这个想法是合成少量的合成数据点,当将这些数据点作为训练数据提供给学习算法时,会产生一个近似于在原始数据上训练的模型。尽管该领域最近取得了进展,但现有的数据集蒸馏方法无法推广到新的架构和扩展到高分辨率数据集。为了克服上述问题,我们建议使用从预训练的深度生成模型中学习到的先验知识来合成蒸馏数据。为实现这一目标,我们提出了一种新的优化算法,该算法将大量图像提炼为生成模型潜在空间中的几个中间特征向量。我们的方法增强了现有技术,显着改善了所有设置中的跨架构泛化。

3.DynamicStereo: Consistent Dynamic Depth from Stereo Videos(CVPR 2023)

53f3ebf84bf3d752965519af85a54c9d.png


标题:DynamicStereo:立体视频的一致动态深度

作者:Nikita Karaev, Ignacio Rocco, Benjamin Graham, Natalia Neverova, Andrea Ved

文章链接:https://arxiv.org/abs/2305.02296

项目代码:https://dynamic-stereo.github.io/

716b4bc70f3d6db48360592e12aef752.png

d52da97e3dcfc35ad87de63d949f49e6.png

b76c3ba0a81c8af144e4d2252856a52b.png

2dd1588c0d5d82d7aaecb06220622149.png

baed408f00c20d7fcd654f9b7d53472f.png

摘要:

       我们考虑重建从立体相机观察到的动态场景的问题。大多数现有的立体深度方法独立处理不同的立体帧,导致时间上不一致的深度预测。时间一致性对于身临其境的 AR 或 VR 场景尤为重要,在这些场景中,闪烁会大大降低用户体验。我们提出了 DynamicStereo,这是一种基于变换器的新型架构,用于估计立体视频的视差。该网络学习从相邻帧中汇集信息,以提高其预测的时间一致性。我们的架构旨在通过划分的注意力层有效地处理立体视频。我们还介绍了 Dynamic Replica,这是一个新的基准数据集,包含扫描环境中人和动物的合成视频,它为动态立体提供比现有数据集更接近真实应用的补充训练和评估数据。使用此数据集进行训练进一步提高了我们提出的 DynamicStereo 以及先前方法的预测质量。最后,它作为一致立体方法的基准。

目录
相关文章
|
机器学习/深度学习 自然语言处理 算法
每日学术速递2.21
大规模文本到图像 (T2I) 模型令人难以置信的生成能力已经证明了学习复杂结构和有意义的语义的强大能力。然而,仅仅依靠文本提示并不能充分利用模型学到的知识,尤其是在需要灵活准确的结构控制时。在本文中,我们的目标是“挖掘”出 T2I 模型隐式学习的能力,然后显式地使用它们来更细粒度地控制生成。
117 0
|
机器学习/深度学习 自然语言处理 算法
每日学术速递3.9
最近的视觉语言模型显示出令人印象深刻的多模态生成能力。但是,通常它们需要在海量数据集上训练大型模型。作为更具可扩展性的替代方案,我们引入了 Prismer,这是一种数据和参数高效的视觉语言模型,它利用了领域专家的集合。
156 0
每日学术速递3.9
|
机器学习/深度学习 人工智能 自然语言处理
每日学术速递5.11
网页一直是视觉语言和纯语言任务的丰富、可扩展的资源。然而,只有网页的一部分被保留:图像标题对、长文本文章或原始 HTML,永远不会全部放在一个地方。
141 0
|
机器学习/深度学习 自然语言处理 机器人
每日学术速递2.28
最近在机器人视觉表示学习方面的工作证明了从人类执行日常任务的大型视频数据集中学习的可行性。利用掩码自动编码和对比学习等方法,这些表示表现出向视觉运动控制的策略学习的强烈迁移。但是,机器人学习包含一系列无法控制的问题,包括掌握能力预测、语言条件模仿学习和人机协作的意图评分等。
83 0
|
机器学习/深度学习 自然语言处理 自动驾驶
每日学术速递5.9
目标跟踪的大多数先前进展是在具有良好照明的白天场景中实现的。迄今为止,最先进的技术很难在夜间发挥其优势,从而大大阻碍了与视觉跟踪相关的无人机 (UAV) 应用的扩展
162 0
|
机器学习/深度学习 人工智能 自然语言处理
每日学术速递5.8
最近的 AI 助理代理,例如 ChatGPT,主要依靠带有人工注释的监督微调 (SFT) 和来自人类反馈的强化学习 (RLHF) 来使大型语言模型 (LLM) 的输出与人类意图保持一致,确保它们是乐于助人、合乎道德且可靠。然而,由于获得人工监督的高成本以及质量、可靠性、多样性、自我一致性和不良偏见等相关问题
178 0
|
机器学习/深度学习 自然语言处理 物联网
每日学术速递4.6
大型语言模型 (LLM)(如 GPT-3 和 ChatGPT)的成功导致开发了许多具有成本效益且易于访问的替代方案,这些替代方案是通过使用特定于任务的数据(例如,ChatDoctor)微调开放访问 LLM 创建的) 或指令数据(例如,Alpaca)。在各种微调方法中,基于适配器的参数高效微调(PEFT)无疑是最吸引人的话题之一
150 0
|
机器学习/深度学习 存储 自然语言处理
每日学术速递4.29
我们提出了一种将点云渲染为表面的新方法。所提出的方法是可区分的,不需要特定场景的优化。这种独特的功能支持开箱即用的表面法线估计、渲染房间尺度点云、逆向渲染和全局照明光线追踪。与专注于将点云转换为其他表示(例如曲面或隐式函数)的现有工作不同,我们的关键思想是直接推断光线与给定点云表示的底层表面的交点。
125 0
|
机器学习/深度学习 自然语言处理 测试技术
每日学术速递4.25
场景理解的一个长期目标是获得可解释和可编辑的表示,这些表示可以直接从原始单目 RGB-D 视频构建,而不需要专门的硬件设置或先验。在存在多个移动和/或变形物体的情况下,该问题更具挑战性。传统方法通过混合简化、场景先验、预训练模板或已知变形模型来处理设置。
186 0
|
机器学习/深度学习 自然语言处理 安全
每日学术速递2.27
视觉知识感知问答 (Knowledge-aware question answering, KAQA) 要求模型通过知识库回答问题,这对于开放域 QA 和特定域 QA 都是必不可少的,尤其是当仅靠语言模型无法提供所需的所有知识时。尽管最近的 KAQA 系统倾向于整合来自预训练语言模型 (PLM) 的语言知识和来自知识图 (KG) 的事实知识来回答复杂问题,但在有效融合来自 PLM 和 KG 的表征方面存在瓶颈,因为(i) 它们之间的语义和分布差距,以及 (ii) 对两种模式提供的知识进行联合推理的困难。
114 0

热门文章

最新文章