每日学术速递4.19

简介: 最近,基于端到端变压器的检测器 (DETR) 取得了显着的性能。然而,DETRs 的高计算成本问题尚未得到有效解决,限制了它们的实际应用并阻止它们充分利用无后处理的好处,例如非最大抑制 (NMS)。在本文中,我们首先分析了现代实时目标检测器中 NMS 对推理速度的影响,并建立了端到端速度基准

CV - 计算机视觉 |  ML - 机器学习 |  RL - 强化学习 | NLP 自然语言处理

Subjects: cs.CV


1.Visual Instruction Tuning

0bfaa1d5ea420196621a1647464db9a7.png


标题:可视化指令调优

作者:Haotian Liu, Chunyuan Li, Qingyang Wu, Yong Jae Lee

文章链接:https://arxiv.org/abs/2304.08485

项目代码:https://llava-vl.github.io/

cbe9244aebade4d9571253b2e18ab7a3.png

fb3738cd3c18c7cb6f8f0744d4bba2ab.png

3f2832b576fd283a3f7abb4e169b423f.png

4c5cc6f3696f8bef7a7f46a0a15694a1.png

摘要:

       使用机器生成的指令跟踪数据对大型语言模型 (LLM) 进行指令调优提高了新任务的零样本能力,但这一想法在多模式领域的探索较少。在本文中,我们首次尝试使用纯语言 GPT-4 生成多模态语言图像指令跟踪数据。通过对此类生成的数据进行指令调整,我们介绍了 LLaVA:大型语言和视觉助手,这是一种端到端训练的大型多模态模型,连接视觉编码器和 LLM 以实现通用视觉和语言理解。我们的早期实验表明,LLaVA展示了令人印象深刻的多模型聊天能力,有时在看不见的图像/指令上表现出多模态 GPT-4 的行为,并且与合成多模态指令跟随数据集上的 GPT-4 相比,产生了 85.1% 的相对分数。当在 Science QA 上进行微调时,LLaVA 和 GPT-4 的协同作用达到了 92.53% 的新的最先进的准确率。我们公开了 GPT-4 生成的视觉指令调整数据、我们的模型和代码库。

2.Learning to Render Novel Views from Wide-Baseline Stereo Pairs(CVPR 2023 )

180520d79766fe0f11ae187909bfed45.png

标题:学习从宽基线立体对中渲染新颖的视图

作者:Yilun Du, Cameron Smith, Ayush Tewari, Vincent Sitzmann

文章链接:https://arxiv.org/abs/2304.08463

项目代码:https://yilundu.github.io/wide_baseline/

57e21d1265e9685a730a1017cd8e987a.png

0b5b62a32330eb956a2f0e405cc7886e.png

4c49fb2d9d61e33d36b48cf384cb6c5c.png

9e1d02d8ef113ae7e021ddb9ba9fd257.png

摘要:

       我们介绍了一种仅给定单个宽基线立体图像对的新颖视图合成方法。在这个具有挑战性的制度中,3D 场景点仅定期观察一次,需要基于先验的场景几何和外观重建。我们发现,由于恢复不正确的 3D 几何形状,以及由于可微分渲染的高成本阻碍了它们扩展到大规模训练,现有的从稀疏观察合成新视图的方法失败了。我们朝着解决这些缺点迈出了一步,制定了多视图变换器编码器,提出了一种高效的图像空间极线采样方案来为目标射线组装图像特征,以及一种基于交叉注意力的轻量级渲染器。我们的贡献使我们的方法能够在室内和室外场景的大规模真实世界数据集上进行训练。我们证明了我们的方法在减少渲染时间的同时学习了强大的多视图几何先验。我们对两个真实世界数据集的保留测试场景进行了广泛的比较,显着优于先前从稀疏图像观察到新视图合成的工作,并实现了多视图一致的新视图合成。

3.DETRs Beat YOLOs on Real-time Object Detection

7ec17114d62622a4f3e293daddc743a5.png

标题:DETRs 在实时目标检测上击败 YOLOs

作者:Wenyu Lv, Shangliang Xu, Yian Zhao, Guanzhong Wang, Jinman Wei, Cheng Cui, Yuning Du, Qingqing Dang, Yi Liu

文章链接:https://arxiv.org/abs/2304.08069

1b3c31bea9a2229228eaed2b6beb6948.png

067c8104f1ee97b144eb429e1d52b525.png

241e61b5363162a202b4dce62e6b8b5e.png

5e47871073b42640e0b5a772d674ad48.png

70143236aac022c83d7033acf242b47a.png


摘要:

       最近,基于端到端变压器的检测器 (DETR) 取得了显着的性能。然而,DETRs 的高计算成本问题尚未得到有效解决,限制了它们的实际应用并阻止它们充分利用无后处理的好处,例如非最大抑制 (NMS)。在本文中,我们首先分析了现代实时目标检测器中 NMS 对推理速度的影响,并建立了端到端速度基准。为了避免 NMS 引起的推理延迟,我们提出了实时检测转换器 (RT-DETR),据我们所知,这是第一个实时端到端对象检测器。具体来说,我们设计了一种高效的混合编码器,通过解耦尺度内交互和跨尺度融合来高效处理多尺度特征,并提出 IoU 感知查询选择以改进对象查询的初始化。此外,我们提出的检测器支持通过使用不同的解码器层灵活调整推理速度而无需重新训练,这有助于实时目标检测器的实际应用。我们的 RT-DETR-L 在 COCO val2017 上实现了 53.0% 的 AP,在 T4 GPU 上实现了 114 FPS,而 RT-DETR-X 实现了 54.8% 的 AP 和 74 FPS,在速度和精度上都优于所有相同规模的 YOLO 检测器。此外,我们的 RT-DETR-R50 达到了 53.1% AP 和 108 FPS,准确率比 DINO-Deformable-DETR-R50 高出 2.2% AP,在 FPS 上高出约 21 倍。PaddleDetection 将提供源代码和预训练模型。

目录
相关文章
|
Python
Python传参数:传值还是传址?
【2月更文挑战第18天】
791 6
|
7月前
|
缓存 搜索推荐 安全
懂车帝item_search - 获取懂车帝搜索数据接口对接全攻略:从入门到精通
懂车帝`item_search`接口是其开放平台核心搜索服务,支持新车、二手车、车型、资讯等多类型检索,提供品牌/价格/级别等多维筛选、智能排序、分页加载及字段定制能力,附完整Python/Java/PHP实现与缓存、批量、推荐等高级功能。
|
8月前
|
人工智能 运维 Cloud Native
AI Agent 培训流程体系构建:从原理落地到云原生业务赋能的全链路指南
本培训面向阿里云开发者,以“能力闭环构建”为核心,分四阶段系统培养AI Agent能力:筑基技术认知、落地工程实践、赋能业务场景、规划职业路径。强调技术-工程-业务深度耦合与学以致用,助力开发者实现从入门到架构师的跃迁。
561 2
|
8月前
|
存储 JSON 自然语言处理
十一年实战沉淀:淘宝商品评论数据深度解析与落地技巧
深耕淘宝评论分析11年,亲历数据结构迭代与解析挑战。本文详解评论数据核心字段、解析难点及破局技巧,分享实战验证的标准化流程,涵盖字符处理、动态规则、高效存储等关键环节,助力精准情感分析与用户洞察。
|
8月前
|
人工智能 BI 数据可视化
2026 国内优质 BI 分析工具厂商盘点推荐,覆盖全行业适配方案
2026年,数据驱动决策成为企业核心竞争力。瓴羊Quick BI凭借AI Agent“智能小Q”、全链路分析与多源数据秒级响应能力,助力企业实现从报表到智能决策的升级,连续六年入选Gartner魔力象限,是零售、制造、金融等多行业数字化转型优选。
2026 国内优质 BI 分析工具厂商盘点推荐,覆盖全行业适配方案
|
机器学习/深度学习 人工智能 算法
基于FPGA的SNN脉冲神经网络之IM神经元verilog实现,包含testbench
本内容介绍了一种基于Izhikevich-Memristive(IM)神经元模型的算法,该模型结合忆阻器特性和神经元动力学,适用于神经形态计算。算法通过Vivado2019.2运行,提供无水印运行效果预览及部分核心程序,完整版含中文注释与操作视频。理论部分详细解析了Izhikevich神经元方程及其放电行为,包括膜电位、恢复变量等参数的作用,并探讨了IM模型在人工智能和脑机接口领域的应用潜力。
|
SQL 缓存 前端开发
如何开发门店业绩上报管理系统中的统计报表板块?(附架构图+流程图+代码参考)
门店业绩上报管理的核心在于统一数据口径、实现自动化统计,并将数据转化为可落地的运营动作。本文详解了如何构建高效的数据统计报表系统,涵盖总体架构、业务流程、核心功能、开发技巧及三大代码模块(DDL+ETL、后端、前端),助力企业提升运营效率与决策精准度。
|
机器学习/深度学习 运维 资源调度
【状态估计】基于UKF法、AUKF法、EUKF法电力系统三相状态估计研究(Matlab代码实现)
【状态估计】基于UKF法、AUKF法、EUKF法电力系统三相状态估计研究(Matlab代码实现)
314 0
|
机器学习/深度学习 设计模式 人工智能
workflow is all you need?探讨乐高式流程编排能否实现任意Multi-Agent模式
阿里集团安全部探索利用AI工作流(workflow)构建多智能体系统(MAS),以提升网络安全领域的创造性协作能力。文章围绕“Workflow is All You Need”这一核心观点,分析当前主流AI Workflow产品是否具备支持多种MAS协作模式的能力。通过Dify等工具演示了单Agent、路由、顺序执行、主从控制、反思、辩论、群聊等多种典型协作模式的实现方式,并指出现有平台在异步交互、动态扩展及并行化MOA模式上的局限性。最终强调,尽管目前尚存挑战,但AI Workflow仍是快速搭建多智能体系统的有效路径。
workflow is all you need?探讨乐高式流程编排能否实现任意Multi-Agent模式
|
人工智能 前端开发 程序员
AI程序员全面上线!聊着天,就把项目开发好了
AI程序员全面上线!聊着天,就把项目开发好了
478 1