每日学术速递4.7

简介: 我们引入了一种新颖的框架,可以毫不费力地训练深度立体网络,无需任何基本事实。通过利用最先进的神经渲染解决方案,我们从使用单个手持相机收集的图像序列生成立体训练数据。

CV - 计算机视觉 |  ML - 机器学习 |  RL - 强化学习 | NLP 自然语言处理  


Subjects: cs.CV


1.Enhancing Deformable Local Features by Jointly Learning to Detect and Describe Keypoints

33bf7f3f13e619e75fc4bfc6d28f0e6d.png

标题:通过联合学习检测和描述关键点来增强可变形局部特征

作者:Guilherme Potje, Felipe Cadar, Andre Araujo, Renato Martins, Erickson R. Nascimento

文章链接:https://arxiv.org/abs/2304.00583

项目代码:https://verlab.dcc.ufmg.br/descriptors/dalf_cvpr23

bdbff501b5cecdebe205e8c54675edf5.png

b13bf1551376942555b9e714ca57db63.png

0eb5ad0d0f244e36b44fe12dc974e3fd.png

7bc4a89f2ef8b2c458cec6fd604ea82e.png


摘要:

       局部特征提取是计算机视觉中处理图像匹配和检索等重要任务的标准方法。大多数方法的核心假设是图像经历仿射变换,忽略更复杂的效果,例如非刚性变形。此外,为非刚性对应量身定制的初期工作仍然依赖于为刚性变换设计的关键点检测器,由于检测器的局限性而阻碍了性能。我们提出了 DALF(变形感知局部特征),一种用于联合检测和描述关键点的新型变形感知网络,以处理匹配可变形表面的挑战性问题。所有网络组件通过特征融合方法协同工作,该方法强制描述符的独特性和不变性。使用真实变形对象的实验展示了我们方法的优越性,与之前的最佳结果相比,它在匹配分数方面提高了 8%。我们的方法还增强了两个实际应用程序的性能:可变形对象检索和非刚性 3D 表面配准。训练、推理和应用程序的代码可在此 https URL 上公开获得。

2.Single Image Depth Prediction Made Better: A Multivariate Gaussian Take


a836950f24ced0eb925659b39daed350.png

标题:单幅图像深度预测变得更好:多变量高斯取值

作者:Ce Liu, Suryansh Kumar, Shuhang Gu, Radu Timofte, Luc Van Gool

文章链接:https://arxiv.org/abs/2303.18164

9eba58277cbe459fea56066b45621b3e.png

9307cd5e2f97f40f27876e0ff2d81fac.png

09ad85614f6aca5de0047cc38ed8d7db.png

b398d555810770ab8031fd23f4dca1c3.png

63fef3798e6ca6089e4c225185f11a72.png

摘要:

       基于神经网络的单图像深度预测 (SIDP) 是一项具有挑战性的任务,其目标是在测试时预测场景的每像素深度。由于根据定义,问题是不适定的,因此基本目标是提出一种方法,该方法可以从一组训练示例中可靠地对场景深度进行建模。为了追求完美的深度估计,大多数现有的最先进的学习技术预测每个像素的单个标量深度值。然而,众所周知,经过训练的模型具有精度限制并且可以预测不精确的深度。因此,SIDP 方法必须注意模型预测在测试时的预期深度变化。因此,我们引入了一种对每像素深度进行连续建模的方法,我们可以在其中预测和推理每像素深度及其分布。为此,我们使用多元高斯分布对每像素场景深度进行建模。此外,与现有的不确定性建模方法相反——本着同样的精神,假设每像素深度是独立的,我们引入了每像素协方差建模,该模型对其深度依赖性 w.r.t 所有场景点进行编码。不幸的是,每像素深度协方差建模导致计算量大的连续损失函数,我们使用学习到的整体协方差矩阵的低秩近似有效地解决了这个问题。值得注意的是,当在 KITTI、NYU 和 SUN-RGB-D 等基准数据集上进行测试时,通过优化我们的损失函数获得的 SIDP 模型显示了最先进的结果。我们的方法(名为 MG)的准确性在 KITTI 深度预测基准排行榜上名列前茅。

3.NeRF-Supervised Deep Stereo

99216dced9323a0f2284c6c9bec8403b.png


标题:NeRF 监督的深度立体声

作者:Fabio Tosi, Alessio Tonioni, Daniele De Gregorio, Matteo Poggi

文章链接:https://arxiv.org/abs/2303.17603

项目代码:https://github.com/fabiotosi92/NeRF-Supervised-Deep-Stereo

ebc92e140cf10caf77a254c33dd18fd8.png

b8685aa95073b148e6a3bb7328f9f6e2.png

07c81ef4bfad1b7b4931910f250bb52b.png

eea9f63123dcc760b81cdd7e56bddc3a.png

摘要:

       我们引入了一种新颖的框架,可以毫不费力地训练深度立体网络,无需任何基本事实。通过利用最先进的神经渲染解决方案,我们从使用单个手持相机收集的图像序列生成立体训练数据。在它们之上,执行了 NeRF 监督的训练程序,我们从中利用渲染的立体三元组来补偿遮挡和深度图作为代理标签。这导致立体网络能够预测清晰和详细的视差图。实验结果表明,在这种机制下训练的模型在具有挑战性的 Middlebury 数据集上比现有的自监督方法提高了 30-40%,填补了与监督模型的差距,并且在大多数情况下,在零样本泛化方面优于它们。

目录
相关文章
|
Android开发 Unix 数据安全/隐私保护
|
12天前
|
人工智能 自然语言处理 安全
阿里云千问办公 QwenWork详细介绍:产品核心能力、典型场景、价格及常见问题解答
千问办公是阿里云推出的一站式AI办公平台,主打"不止于对话,更注重交付",依托通义千问旗舰大模型,用户一句话即可完成数据分析、PPT生成、视频剪辑等复杂任务,直接输出可用成果。产品深度打通钉钉生态与企业OA,覆盖桌面端、网页端,提供企业标准版198元/人/月等多档订阅方案,新用户注册即赠2000积分,适配工程师、HR、财务等多职业办公场景,成为能动手干活的"全能AI同事"。
|
12天前
|
人工智能
千问办公官网入口:阿里AI办公QwenWork产品页和免费网页端链接
千问办公官网含两大入口:一是网页端(qwenwork.cn),即开即用,支持浏览器直接访问;二是阿里云产品页 https://t.aliyun.com/U/JNKJuO 提供免费/付费版详情、功能介绍及使用指南。
|
18天前
|
网络协议 Linux iOS开发
【2026实测】Wireshark下载+安装+汉化+使用教程(图文版,巨详细)
Wireshark 是一款免费开源的网络协议分析工具,可实时捕获、解析并可视化数据包,助你诊断网络故障、分析通信协议(如HTTP、DNS、TCP等)。支持Windows/macOS/Linux,含中文界面,新手入门便捷。(239字)
|
11天前
|
IDE 开发工具
Qoder 上线 Sonus 模型,Computer Use 能力全面增强
Qoder国际版上线全新内置大模型Sonus(/ˈsoʊnəs/),全球领先,专精超长任务执行与电脑操作(Computer Use)。配合Qoder桌面端0.2.3版本,可自主完成编程、金融建模、科研及表格制作等复杂工作。现全面支持Qoder全系产品,效率提升3.2倍。
1375 8
Qoder 上线 Sonus 模型,Computer Use 能力全面增强
|
13天前
|
缓存 人工智能 自然语言处理
阿里云qwen3.8-flash大模型介绍:模型能力、模型价格、免费额度与最新活动
本文是阿里云百炼平台Qwen3.8-Flash大模型的选型接入指南,作为兼顾性能与响应速度的高性价比多模态模型,它支持百万级上下文窗口、全场景多模态输入与完整智能体能力矩阵,适配编程辅助、智能体协作等核心场景。文中同步梳理了最新下调的阶梯定价、夜间4折等优惠活动,搭配OpenAI兼容流式调用示例,帮助开发者低成本快速落地高并发AI应用。
阿里云qwen3.8-flash大模型介绍:模型能力、模型价格、免费额度与最新活动
|
13天前
|
人工智能 API 内存技术
刚刚 DeepSeek V4.1 Flash 开启内测,1 分钟教你用上!
刚刚 DeepSeek 内测群发布了 DeepSeek V4.1 Flash 中间版本内测的消息,这次的模型采用了新的结构,原生支持多模态、能力更强、速度更快、且成本更低。
1985 15
|
17天前
|
人工智能 运维 BI
阿里云千问办公QwenWork深度解析:基于Qwen3.8,六大核心能力重构企业全自动化工作流与计费选型指南
传统AI办公工具大多停留在对话问答、文档摘要、简单文案生成层面,只能完成单点碎片化任务,无法自主拆解复杂业务流程,很难串联多工具、多文档、外部业务系统完成端到端完整工作交付。很多企业在落地AI办公的时候,需要组合多款不同工具,来回切换界面,手动复制粘贴中间结果,智能化改造落地门槛居高不下。千问办公QwenWork是整合多款智能体产品能力打造的一体化企业办公智能体平台,底层基座依托Qwen3.8大模型,打通桌面端Agent、云端Agent、企业协同Agent三种运行形态,不再局限简单问答,接收业务目标之后自主拆解任务步骤,调用各类工具,处理文档、表格、浏览器自动化、数据查询,直接输出可交付的办公
1687 4
|
19天前
|
缓存 数据可视化 开发工具
DeepSeek Harness 怎么更新?dsh 更新完整指南:更新本体(npx、npm、源码)与更新插件两种方式
DeepSeek Harness 的更新分两层:本体更新(npx 自动最新、npm update -g、源码 git pull)与插件更新(插件市场点更新、命令行覆盖安装)。本文按「准备 → 更新本体 → 更新插件 → 更新后检查」四步走,覆盖新手常见疑问。
2056 1
DeepSeek Harness 怎么更新?dsh 更新完整指南:更新本体(npx、npm、源码)与更新插件两种方式
|
13天前
|
缓存 JSON API
阿里云千问Qwen3.8‑Max深度解析:核心能力、订阅计费规则、API接入配置与生产落地完整教程
Qwen3.8‑Max作为千问系列新一代MoE架构旗舰基座,总参数量达到2.4万亿,激活参数950亿,是面向复杂专业任务、长周期智能体、工程级代码开发、多模态深度解析的高阶大模型,原生支持文本、图像、视频多模态输入,最大上下文窗口达到百万Token,最大输出Token支持131072,内置深度思考推理链路,在编程、科研、法律金融专业分析、长视频文档解析、自主Agent任务等场景能力表现突出。很多开发者在项目前期直接接入该旗舰模型,却对模型能力边界、多种计费模式、订阅套餐权益、API参数配置、上下文缓存优化缺乏完整认知,出现成本失控、接口报错、长文本信息丢失、深度思考模式额外消耗大量Token等
915 3