CVPR阿里优秀论文:针对场景分割两大问题提出语境对比特征和门控多尺度融合

简介: IEEE CVPR-18是计算机视觉领域最具影响力之一的学术会议。本次会议阿里巴巴有18篇优秀论文被收录,本篇就是其中之一。本文讨论了场景分割问题,场景分割需要进行像素级别的分类,上下文语境和多尺度特征融合对实现更好的场景分割至关重要。

作者:HenghuiDing[1],Xudong Jiang[1],Bing Shuai[1],Ai Qun Liu[1]Gang Wang[2].

[1]School of Electrical and ElectronicEngineering, Nanyang Technological University, Singapore

[2]Alibaba AI Labs, Hangzhou, China

本文首先提出了一种上下文语境和局部信息对比的特征,这种特征不仅利用了信息丰富的上下文语境,而且通过与语境的对比来聚焦更具辨识度的局部信息。这种特征提高了网络的解析性能,尤其提高了对不明显物体和背景填充部分的分割效果。同时,本文提出了一种门控融合机制,不同于以往的多尺度特征融合,门控融合可以根据输入图像的特征表象来为不同位置的分类选择性地融合多尺度特征。

门控的值由本文提出的网络产生,会随输入图像的变化而变化。这种门口融合机制可以控制不同尺度特征的信息流动,使网络对不同尺度的物体有更强的适应力。本文提出的模型在Pascal Context, SUN-RGBD和COCO Stuff 三个场景分割数据集上验证了性能,取得了目前最高的场景分割性能。

本文致力于场景分割中有两大问题:场景图片中像素形式的多样化(例如,显著或者不显著,前景或者背景),场景图片中物体大小的多样性。并针对这两个问题分别提出了语境对比局部特征和门控多尺度融合。

▌一、语境对比局部特征

1.jpg

场景图片中物体形式具有多样化,如显著或者不显著,前景或者背景。图像分类问题一般仅关注于图像中最显著的物体,而场景分割需要对所有像素进行分类,所以在进行场景分割时应该对不同存在形式的物体都给予关注,尤其是不显著的物体和背景。

上下文语境信息对于实现良好的场景分割至关重要。然而语境信息容易被场景图片中的显著物体的特征所主导,导致场景中其他的不显著物体和背景的特征被弱化甚至忽略。如图一所示,像素A属于不显著物体。像素A的局部特征(Local)包含了像素A的主要信息,但是缺乏足够的全局信息(如路),不能实现稳定的分割。但是收集语境信息(Context),就会带来旁边显著物体(人)的特征信息,导致像素A的语境特征被人的特征信息所主导,像素A自身的特征信息被弱化甚至忽略。

为此,本文提出了语境对比局部特征,同时收集像素A的局部特征和全局语境特征(如图二所示),然后将两者进行对比融合,一方面可以保护并突出局部特征,另一方面充分利用了信息丰富的语境特征。语境对比的局部特征,包含了富含信息的全局特征以及对像素A至关重要的局部特征,并且使得像素A的特征不会被其他显著物体特征所主导。语境对比局部特征的效果如图一中最后一幅图片所示。同时,在最终模型CCL中,多个context-local被连接起来以获得多层次的语境对比局部特征,如图二所示。

2.png

▌二、门控多尺度融合

场景分割的数据集中存在着大量的不同大小的物体,不同大小的物体所需的感受野和特征尺度不同,用单一尺度的特征对所有像素进行分类是不合理的,因此需要进行多尺度特征融合。本文采用了FCN网络中的skip结构来获取DCNN不同特征层的特征信息,但FCN中对skip的结果简单相加融合,并没有考虑不同skip结果的差异性。不同于FCN的是,本文提出了一种门控机制来进行多尺度特征的选择性融合。门控多尺度融合根据特征尺度、语境等信息来动态决定图像中每个像素最适合的感受野,对skip的分割结果进行选择性融合。门控的值由本文提出的网络产生(如图三所示),网络根据输入图像的特征表象生成相应的门控值,由这些门控的值来决定不同层的skip以多大比例进行融合,控制网络信息流动,产生最终的预测。

通过门控多尺度融合,网络可以为每个像素选择一个合理的组合方案,将合适的特征增强并将不合适的特征进行抑制。在门控多尺度融合中,可以添加更多的skip来提取更丰富的多尺度特征信息,同时不用担心skip中有不好的结果。这种门口融合机制可以控制不同尺度特征的信息流动,使网络对不同尺度的物体有更强的适应力。

1.jpg

▌三、实验

场景分割效果对比如图四所示,本文提出的方法对不显著物体和背景的分割效果有明显提升,同时对多尺度物体有很强的适应力。

1.jpg

相关文章
|
10月前
|
人工智能 编解码 芯片
告别低效沟通|让技术提问不再头疼-这套高效AI提问模板来帮你
不会向ai提问,不知道怎么提问的 可以看看
21103 1
告别低效沟通|让技术提问不再头疼-这套高效AI提问模板来帮你
|
6月前
|
数据采集 存储 安全
主数据到底要怎么管理?看完你就知道了
企业常因客户、产品等核心数据不统一导致部门间数据混乱、决策失准。主数据管理正是解决这一问题的关键,通过统一标准、打破孤岛、明确权责,实现数据一致与共享。本文提出五步实施框架,助力企业夯实数据基石,提升运营效率与决策能力。
|
编解码
数字式电秒表、电子毫秒表,智能毫秒计,通用电脑式毫秒计,智能毫秒表
‌数字式电秒表的主要用途和作用包括在各种需要精确计时的场景中应用,如消防施工质量控制、技术检测、维护管理以及消防产品现场检查等‌。具体应用场景包括火灾自动报警系统的响应时间、水流指示器的延迟时间、电梯的迫降时间、灯具的应急工作时间等‌1。
|
机器学习/深度学习 数据采集 供应链
Python实现深度学习模型:智能库存管理系统
【10月更文挑战第5天】 Python实现深度学习模型:智能库存管理系统
1047 9
|
运维 安全 API
OAuth2.0与ASAP认证功能实测:Apipost与Apifox对比分析
在API调试中,认证机制常被忽视,却至关重要。80%的开发者认为认证是运维职责,导致授权头缺失、令牌过期等问题频发。Apifox对OAuth2.0和ASAP协议支持不足,而Apipost不仅覆盖12种主流认证类型,还实现了OAuth2.0全流程自动化及ASAP秒级配置,提供自动state管理、PKCE增强模式等优势,确保API调试安全高效。
259 1
|
SQL 关系型数据库 MySQL
数据库数据恢复——MySQL简介和数据恢复案例
MySQL数据库数据恢复环境&故障: 本地服务器,安装的windows server操作系统。 操作系统上部署MySQL单实例,引擎类型为innodb,表空间类型为独立表空间。该MySQL数据库没有备份,未开启binlog。 人为误操作,在用Delete命令删除数据时未添加where子句进行筛选导致全表数据被删除,删除后未对该表进行任何操作。
|
JSON 前端开发 JavaScript
java-ajax技术详解!!!
本文介绍了Ajax技术及其工作原理,包括其核心XMLHttpRequest对象的属性和方法。Ajax通过异步通信技术,实现在不重新加载整个页面的情况下更新部分网页内容。文章还详细描述了使用原生JavaScript实现Ajax的基本步骤,以及利用jQuery简化Ajax操作的方法。最后,介绍了JSON作为轻量级数据交换格式在Ajax应用中的使用,包括Java中JSON与对象的相互转换。
316 1
|
C语言 C++
C语言函数调用的易错点
在 C 语言中,函数调用时常见的易错点包括:参数类型不匹配、缺少或多余参数、返回值未使用、函数未声明、递归调用未终止、指针传递错误、使用未初始化的变量等。C 语言不支持函数重载,在 C++ 中使用时需注意区分。正确处理这些易错点可以提高代码的稳定性和可维护性。
|
机器学习/深度学习 人工智能 自动驾驶
深入理解深度学习中的卷积神经网络(CNN)
【10月更文挑战第18天】深入理解深度学习中的卷积神经网络(CNN)
580 0

热门文章

最新文章