每日学术速递5.12

简介: 用户可以付费查询的大型语言模型 (LLM) 数量迅速增加。我们审查了与查询流行的 LLM API 相关的成本,例如GPT-4、ChatGPT、J1-Jumbo,并发现这些模型具有异构的定价结构,费用可能相差两个数量级。特别是,在大量查询和文本上使用 LLM 可能会很昂贵。

CV - 计算机视觉 |  ML - 机器学习 |  RL - 强化学习 | NLP 自然语言处理  


Subjects: cs.CV


1.ImageBind: Holistic AI learning across six modalities

f458c251910fa801ae7d70e6c99bf7f5.png


标题:ImageBind:跨六种模式的整体人工智能学习

作者:Mengyuan Yan Jessica Lin Montserrat Gonzalez Arenas Ted Xiao Daniel Kappler Daniel Ho

文章链接:https://dl.fbaipublicfiles.com/imagebind/imagebind_final.pdf

项目代码:https://github.com/facebookresearch/ImageBind

9d2c69dbf64fcbe89c5c10e984ac8315.png

de5d8fe428eed951a09f804aa33a1c42.png

948599744bf0a5c59f08fb6c23d604eb.png

27502b97a250f8aac914ae3e569c9c40.png

摘要:

       当人类从世界吸收信息时,我们天生会使用多种感官,例如看到繁忙的街道和听到汽车引擎的声音。今天,我们推出了一种方法,使机器更接近人类同时、整体和直接从许多不同形式的信息中学习的能力——不需要明确的监督(组织和标记原始数据的过程)。我们已经构建并正在开源 ImageBind,这是第一个能够绑定来自六种模式的信息的人工智能模型。该模型学习单个嵌入或共享表示空间,不仅适用于文本、图像/视频和音频,还适用于记录深度 (3D)、热(红外辐射)和惯性测量单元 (IMU) 的传感器,这计算运动和位置。ImageBind 使机器具备全面的理解力,将照片中的对象与它们的声音、3D 形状、它们的冷暖程度以及它们的移动方式联系起来。如我们的论文所述,ImageBind 可以胜过针对一种特定模态单独训练的先前专家模型。但最重要的是,它通过使机器能够更好地分析多种不同形式的信息来帮助推进人工智能。例如,使用 ImageBind,Meta 的 Make-A-Scene 可以从音频创建图像,例如根据雨林或熙熙攘攘的市场的声音创建图像。其他未来的可能性包括以更准确的方式识别、连接和调节内容,以及促进创意设计,例如更无缝地生成更丰富的媒体和创建更广泛的多模式搜索功能。ImageBind 是 Meta 致力于创建多模态 AI 系统的一部分,该系统可以从周围所有可能类型的数据中学习。随着模态数量的增加,ImageBind 为研究人员打开了尝试开发新的整体系统的闸门,例如结合 3D 和 IMU 传感器来设计或体验身临其境的虚拟世界。ImageBind 还可以提供一种探索记忆的丰富方式——使用文本、音频和图像的组合来搜索图片、视频、音频文件或文本消息。

2.HumanRF: High-Fidelity Neural Radiance Fields for Humans in Motion


c1ff6e475792db3f4ee23d949c2580d2.png

标题:HumanRF:运动中人体的高保真神经辐射场

作者:Mustafa Işık, Martin Rünz, Markos Georgopoulos, Taras Khakhulin, Jonathan Starck, Lourdes Agapito, Matthias Nießner

文章链接:https://arxiv.org/abs/2305.06356

项目代码:https://synthesiaresearch.github.io/humanrf/

2c76dc56ebeb4c9e174f7c357ce4f539.png

d5bda4dfc40f72e0a5bacbfcb45ecb40.png

0c184ad0928b720d2723bae5dd429ad5.png

62d4cab0b874e9f9726e9cc1783134f4.png

摘要:

       以高保真度表现人类表现是电影制作、电脑游戏或视频会议等各种应用的重要组成部分。为了缩小与生产级质量的差距,我们引入了 HumanRF,这是一种 4D 动态神经场景表示,可从多视图视频输入中捕捉运动中的全身外观,并能够从新颖的、看不见的视点进行回放。我们的新颖表示充当动态视频编码,通过将时空分解为时间矩阵向量分解来以高压缩率捕获精细细节。这使我们能够为长序列获得人类演员的时间相干重建,同时即使在具有挑战性的运动的背景下也能呈现高分辨率细节。虽然大多数研究都集中在 4MP 或更低分辨率的合成上,但我们解决了在 12MP 下运行的挑战。为此,我们介绍了 ActorsHQ,这是一种新颖的多视图数据集,它提供来自 160 个摄像机的 12MP 镜头,用于 16 个序列,具有高保真度、每帧网格重建。我们展示了使用此类高分辨率数据所带来的挑战,并表明我们新推出的 HumanRF 有效地利用了这些数据,朝着生产级质量的新颖视图合成迈出了重要一步。

3.FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance

90e65810216d05464913d7fc7e2d3202.png

标题:FrugalGPT:如何在降低成本和提高性能的同时使用大型语言模型

作者:Lingjiao Chen, Matei Zaharia, James Zou

文章链接:https://arxiv.org/abs/2305.05176

65a937d7c8a6857428f46d765e7e8bb7.png

f3911251f08fa0ca9b47574ec27cdf13.png

6918a4a6ac8c66d4109020c5f7ab2eec.png

摘要:

       用户可以付费查询的大型语言模型 (LLM) 数量迅速增加。我们审查了与查询流行的 LLM API 相关的成本,例如GPT-4、ChatGPT、J1-Jumbo,并发现这些模型具有异构的定价结构,费用可能相差两个数量级。特别是,在大量查询和文本上使用 LLM 可能会很昂贵。受此启发,我们概述并讨论了三种类型的策略,用户可以利用这些策略来降低与使用 LLM 相关的推理成本:1) 提示适应,2) LLM 近似,以及 3) LLM 级联。例如,我们提出了 FrugalGPT,这是一种简单而灵活的 LLM 级联实例,它学习将哪些 LLM 组合用于不同的查询,以降低成本并提高准确性。我们的实验表明,FrugalGPT 可以与最好的单个 LLM(例如 GPT-4)的性能相媲美,成本降低高达 98%,或者在成本相同的情况下比 GPT-4 的准确度提高 4%。这里提出的想法和发现为可持续和高效地使用 LLM 奠定了基础。

目录
相关文章
|
机器学习/深度学习 自然语言处理 机器人
每日学术速递3.27
向多指机器人教授灵巧性一直是机器人学领域的一项长期挑战。该领域最突出的工作集中在学习控制器或策略,这些控制器或策略对视觉观察或从视觉得出的状态估计进行操作。然而,这种方法在需要对接触力或手本身遮挡的物体进行推理的细粒度操作任务上表现不佳。
104 0
每日学术速递3.27
|
机器学习/深度学习 自然语言处理 算法
每日学术速递3.9
最近的视觉语言模型显示出令人印象深刻的多模态生成能力。但是,通常它们需要在海量数据集上训练大型模型。作为更具可扩展性的替代方案,我们引入了 Prismer,这是一种数据和参数高效的视觉语言模型,它利用了领域专家的集合。
123 0
每日学术速递3.9
|
机器学习/深度学习 存储 编解码
每日学术速递2.20
将强大的生成去噪扩散模型 (DDM) 应用于图像语义编辑等下游任务通常需要微调预训练 DDM 或学习辅助编辑网络。在这项工作中,我们通过仅通过冻结 DDM 优化去噪轨迹,在各种应用程序设置上实现了 SOTA 语义控制性能。
88 0
|
机器学习/深度学习 人工智能 自然语言处理
每日学术速递4.30
具有指令微调的大型语言模型 (LLM) 展示了卓越的生成能力。然而,这些模型是资源密集型的。为了缓解这个问题,我们探索从指令调整的 LLM 中提炼知识到更小的 LLM。为此,我们基于现有指令和新生成的指令精心开发了大量 2.58M 指令集。
111 0
|
机器学习/深度学习 人工智能 自然语言处理
每日学术速递5.11
网页一直是视觉语言和纯语言任务的丰富、可扩展的资源。然而,只有网页的一部分被保留:图像标题对、长文本文章或原始 HTML,永远不会全部放在一个地方。
122 0
|
机器学习/深度学习 自然语言处理 并行计算
每日学术速递4.13
最近基于扩散的生成器可以仅根据文本提示生成高质量的图像。但是,它们不能正确解释指定构图空间布局的指令。我们提出了一种简单的方法,无需训练或微调图像生成器即可实现稳健的布局控制。我们的技术,我们称之为布局指导,操纵模型用来连接文本和视觉信息的交叉注意层,并在给定的所需方向上引导重建
118 0
|
机器学习/深度学习 人工智能 自然语言处理
每日学术速递3.16
本文提出了一个统一的扩散框架(称为 UniDiffuser),以在一个模型中拟合与一组多模态数据相关的所有分布。我们的关键见解是——学习边缘分布、条件分布和联合分布的扩散模型可以统一为预测扰动数据中的噪声,其中扰动水平(即时间步长)对于不同的模式可能不同。
140 0
|
机器学习/深度学习 自然语言处理 计算机视觉
每日学术速递3.21
随着神经辐射场 (NeRFs) 的引入,新颖的视图合成最近取得了巨大飞跃。NeRF 的核心是提出每个 3D 点都可以发出辐射,从而允许使用可区分的体积渲染进行视图合成。虽然神经辐射场可以准确地表示用于计算图像渲染的 3D 场景,但 3D 网格仍然是大多数计算机图形和模拟管道支持的主要场景表示,支持实时渲染和基于物理的模拟等任务。
112 0
|
机器学习/深度学习 自然语言处理 数据可视化
每日学术速递4.19
最近,基于端到端变压器的检测器 (DETR) 取得了显着的性能。然而,DETRs 的高计算成本问题尚未得到有效解决,限制了它们的实际应用并阻止它们充分利用无后处理的好处,例如非最大抑制 (NMS)。在本文中,我们首先分析了现代实时目标检测器中 NMS 对推理速度的影响,并建立了端到端速度基准
152 0
|
机器学习/深度学习 编解码 自然语言处理
每日学术速递4.5
无论是通过从头到尾以固定分辨率处理视频,还是结合池化和缩小策略,现有的视频转换器都可以处理整个网络中的整个视频内容,而无需专门处理大部分冗余信息。在本文中,我们提出了一种 Supertoken Video Transformer (SVT),它结合了语义池模块 (SPM),根据视觉转换器的语义沿着视觉转换器的深度聚合潜在表示,从而减少视频输入中固有的冗余。
78 0