每日学术速递5.12

简介: 用户可以付费查询的大型语言模型 (LLM) 数量迅速增加。我们审查了与查询流行的 LLM API 相关的成本,例如GPT-4、ChatGPT、J1-Jumbo,并发现这些模型具有异构的定价结构,费用可能相差两个数量级。特别是,在大量查询和文本上使用 LLM 可能会很昂贵。

CV - 计算机视觉 |  ML - 机器学习 |  RL - 强化学习 | NLP 自然语言处理  


Subjects: cs.CV


1.ImageBind: Holistic AI learning across six modalities

f458c251910fa801ae7d70e6c99bf7f5.png


标题:ImageBind:跨六种模式的整体人工智能学习

作者:Mengyuan Yan Jessica Lin Montserrat Gonzalez Arenas Ted Xiao Daniel Kappler Daniel Ho

文章链接:https://dl.fbaipublicfiles.com/imagebind/imagebind_final.pdf

项目代码:https://github.com/facebookresearch/ImageBind

9d2c69dbf64fcbe89c5c10e984ac8315.png

de5d8fe428eed951a09f804aa33a1c42.png

948599744bf0a5c59f08fb6c23d604eb.png

27502b97a250f8aac914ae3e569c9c40.png

摘要:

       当人类从世界吸收信息时,我们天生会使用多种感官,例如看到繁忙的街道和听到汽车引擎的声音。今天,我们推出了一种方法,使机器更接近人类同时、整体和直接从许多不同形式的信息中学习的能力——不需要明确的监督(组织和标记原始数据的过程)。我们已经构建并正在开源 ImageBind,这是第一个能够绑定来自六种模式的信息的人工智能模型。该模型学习单个嵌入或共享表示空间,不仅适用于文本、图像/视频和音频,还适用于记录深度 (3D)、热(红外辐射)和惯性测量单元 (IMU) 的传感器,这计算运动和位置。ImageBind 使机器具备全面的理解力,将照片中的对象与它们的声音、3D 形状、它们的冷暖程度以及它们的移动方式联系起来。如我们的论文所述,ImageBind 可以胜过针对一种特定模态单独训练的先前专家模型。但最重要的是,它通过使机器能够更好地分析多种不同形式的信息来帮助推进人工智能。例如,使用 ImageBind,Meta 的 Make-A-Scene 可以从音频创建图像,例如根据雨林或熙熙攘攘的市场的声音创建图像。其他未来的可能性包括以更准确的方式识别、连接和调节内容,以及促进创意设计,例如更无缝地生成更丰富的媒体和创建更广泛的多模式搜索功能。ImageBind 是 Meta 致力于创建多模态 AI 系统的一部分,该系统可以从周围所有可能类型的数据中学习。随着模态数量的增加,ImageBind 为研究人员打开了尝试开发新的整体系统的闸门,例如结合 3D 和 IMU 传感器来设计或体验身临其境的虚拟世界。ImageBind 还可以提供一种探索记忆的丰富方式——使用文本、音频和图像的组合来搜索图片、视频、音频文件或文本消息。

2.HumanRF: High-Fidelity Neural Radiance Fields for Humans in Motion


c1ff6e475792db3f4ee23d949c2580d2.png

标题:HumanRF:运动中人体的高保真神经辐射场

作者:Mustafa Işık, Martin Rünz, Markos Georgopoulos, Taras Khakhulin, Jonathan Starck, Lourdes Agapito, Matthias Nießner

文章链接:https://arxiv.org/abs/2305.06356

项目代码:https://synthesiaresearch.github.io/humanrf/

2c76dc56ebeb4c9e174f7c357ce4f539.png

d5bda4dfc40f72e0a5bacbfcb45ecb40.png

0c184ad0928b720d2723bae5dd429ad5.png

62d4cab0b874e9f9726e9cc1783134f4.png

摘要:

       以高保真度表现人类表现是电影制作、电脑游戏或视频会议等各种应用的重要组成部分。为了缩小与生产级质量的差距,我们引入了 HumanRF,这是一种 4D 动态神经场景表示,可从多视图视频输入中捕捉运动中的全身外观,并能够从新颖的、看不见的视点进行回放。我们的新颖表示充当动态视频编码,通过将时空分解为时间矩阵向量分解来以高压缩率捕获精细细节。这使我们能够为长序列获得人类演员的时间相干重建,同时即使在具有挑战性的运动的背景下也能呈现高分辨率细节。虽然大多数研究都集中在 4MP 或更低分辨率的合成上,但我们解决了在 12MP 下运行的挑战。为此,我们介绍了 ActorsHQ,这是一种新颖的多视图数据集,它提供来自 160 个摄像机的 12MP 镜头,用于 16 个序列,具有高保真度、每帧网格重建。我们展示了使用此类高分辨率数据所带来的挑战,并表明我们新推出的 HumanRF 有效地利用了这些数据,朝着生产级质量的新颖视图合成迈出了重要一步。

3.FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance

90e65810216d05464913d7fc7e2d3202.png

标题:FrugalGPT:如何在降低成本和提高性能的同时使用大型语言模型

作者:Lingjiao Chen, Matei Zaharia, James Zou

文章链接:https://arxiv.org/abs/2305.05176

65a937d7c8a6857428f46d765e7e8bb7.png

f3911251f08fa0ca9b47574ec27cdf13.png

6918a4a6ac8c66d4109020c5f7ab2eec.png

摘要:

       用户可以付费查询的大型语言模型 (LLM) 数量迅速增加。我们审查了与查询流行的 LLM API 相关的成本,例如GPT-4、ChatGPT、J1-Jumbo,并发现这些模型具有异构的定价结构,费用可能相差两个数量级。特别是,在大量查询和文本上使用 LLM 可能会很昂贵。受此启发,我们概述并讨论了三种类型的策略,用户可以利用这些策略来降低与使用 LLM 相关的推理成本:1) 提示适应,2) LLM 近似,以及 3) LLM 级联。例如,我们提出了 FrugalGPT,这是一种简单而灵活的 LLM 级联实例,它学习将哪些 LLM 组合用于不同的查询,以降低成本并提高准确性。我们的实验表明,FrugalGPT 可以与最好的单个 LLM(例如 GPT-4)的性能相媲美,成本降低高达 98%,或者在成本相同的情况下比 GPT-4 的准确度提高 4%。这里提出的想法和发现为可持续和高效地使用 LLM 奠定了基础。

目录
相关文章
|
Unix Linux 程序员
Linux必知词汇:GNU通用公共许可证 GPL(GNU General Public License)
Linux必知词汇:GNU通用公共许可证 GPL(GNU General Public License)
3083 0
成功解决OSError: Unable to open file (truncated file: eof = 8388608, sblock->base_addr = 0, stored_eof =
成功解决OSError: Unable to open file (truncated file: eof = 8388608, sblock->base_addr = 0, stored_eof =
成功解决OSError: Unable to open file (truncated file: eof = 8388608, sblock->base_addr = 0, stored_eof =
|
XML 存储 数据处理
Python XML处理初级篇:入门lxml库
在数据处理过程中,XML(可扩展标记语言)常常被用作数据存储和传输。Python的lxml库是一个强大的库,用于解析XML和HTML文档。本文将向您介绍如何使用lxml库来解析和处理XML文档。
|
运维 Linux Apache
如何使用`systemctl status`命令来查看服务状态?
如何使用`systemctl status`命令来查看服务状态?
1390 0
|
网络架构
为什么udp流设置1316字节
为什么udp流设置1316字节
329 0
|
资源调度 JavaScript 测试技术
单元测试:编写和运行Vue组件的单元测试
【4月更文挑战第23天】本文探讨了为Vue组件编写单元测试的重要性,以及如何设置测试环境、编写和运行测试。通过使用Jest或Mocha作为测试框架,结合Vue Test Utils,可以独立测试组件的功能,如渲染、事件处理和状态管理。编写测试用例时,应注意覆盖各种行为,并使用断言验证组件状态。运行测试并观察结果,确保测试独立性和高覆盖率。单元测试是保证代码质量和维护性的关键,应随着项目发展持续更新测试用例。
337 3
|
数据可视化 C# 图形学
【推荐100个unity插件之18】Unity 新版输入系统Input System的基础使用
【推荐100个unity插件之18】Unity 新版输入系统Input System的基础使用
1072 0
|
机器学习/深度学习 数据挖掘 Go
深度学习论文阅读图像分类篇(五):ResNet《Deep Residual Learning for Image Recognition》
更深的神经网络更难训练。我们提出了一种残差学习框架来减轻 网络训练,这些网络比以前使用的网络更深。我们明确地将层变为学 习关于层输入的残差函数,而不是学习未参考的函数。我们提供了全 面的经验证据说明这些残差网络很容易优化,并可以显著增加深度来 提高准确性。在 ImageNet 数据集上我们评估了深度高达 152 层的残 差网络——比 VGG[40]深 8 倍但仍具有较低的复杂度。这些残差网络 的集合在 ImageNet 测试集上取得了 3.57%的错误率。这个结果在 ILSVRC 2015 分类任务上赢得了第一名。我们也在 CIFAR-10 上分析 了 100 层和 1000 层的残差网络。
812 0
|
JavaScript Java 测试技术
基于Java的校园闲置物品交易平台的设计与实现(源码+lw+部署文档+讲解等)
基于Java的校园闲置物品交易平台的设计与实现(源码+lw+部署文档+讲解等)
209 0