理解图像分割中的卷积(Understand Convolution for Semantic Segmentation)

简介:    以最佳的101 layer的ResNet-DUC为基础,添加HDC,实验探究了几种变体:无扩张卷积(no dilation):对于所有包含扩张卷积,设置r=1r=1扩张卷积(dilation Conv ):对于所有包含扩张卷积,将2个bloc...

 

 

 

 

以最佳的101 layer的ResNet-DUC为基础,添加HDC,实验探究了几种变体:

  • 无扩张卷积(no dilation):对于所有包含扩张卷积,设置r=1r=1
  • 扩张卷积(dilation Conv ):对于所有包含扩张卷积,将2个block和为一组,设置第一个block的r=2r=2,第二个block的r=1r=1
  • Dilation-RF:对于res4bres4b包含了23个blocks,使用的r=2r=2,设置3个block一组,r=1,2,3r=1,2,3.对于最后两个block,设置r=2r=2;对于res5bres5b,包含3个block,使用r=4r=4,设置为r=3,4,5r=3,4,5.
  • Dilation-Bigger:对于res4bres4b模块,设置4个block为一组,设置r=1,2,5,9r=1,2,5,9.最后3个block设置为1,2,51,2,5;对于res5bres5b模块,设置r=5,9,17r=5,9,17

mark

可以看到增加接收野大小会获得较高的精度。如下图所示:

mark

ResNet-DUC-HDC在较大的目标物上表现较好。下图是局部放大:

mark

可以看到HDC有效的消除”gridding”产生的影响。

Deeper Networks: 同样尝试了将ResNet-101切换为ResNet-152,使用ResNet152先跑了10个epoch学习了BN层参数,再固定BN层,跑了20个epochs.结果如下:

mark

ResNet152为基础层的有1%的提升。

Test Set Results: 论文将ResNet101开始的7×77×7卷积拆分为3个3×33×3的卷积,再不带CRF的情况下达到了80.1%mIoU.与其他先进模型相比如下:

mark

模型同时在coarse labels跑了一圈,与同样以deliated convolution为主的DeepLabv2相比,提升了9.7%.

KITTI Road Segmentaiton

KITTI有289的训练图片和290个测试图片。示例如下:

mark

因为数据集有限,为了避免过拟合。论文以100的步长在数据集中裁剪320×320320×320的patch. 使用预训练模型,结果如下:

mark

结果达到了state-of-the-art水平.

PASCAL VOC2012 dataset

先用VOC2012训练集和MS-COCO数据集对ResNet-DUC做预训练。再使用VOC2012做fine-tune。使用的图片大小为512×512512×512。达到了state-of-the-art水平:

mark

可视化结果如下:
mark


Conclusion

论文提出了简单有效的卷积操作改进语义分割系统。使用DUC恢复上采样丢失的信息,使用HDC在解决”gridding”的影响的同时扩大感受野。实验证明我们的框架对各种语义分割任务的有效性。

目录
相关文章
|
6月前
|
安全 iOS开发 开发者
macOS Catalina 10.15.8 (19H2036) 发布
macOS Catalina 10.15.8 (19H2036) 发布
1788 11
macOS Catalina 10.15.8 (19H2036) 发布
|
2月前
|
Rust 安全 算法
钢材锈蚀缺陷目标检测数据集| 4300张YOLO数据集分享
本数据集含4300张高清YOLO格式图像,专注钢材表面锈蚀缺陷检测,覆盖点状、片状、层状等多种锈蚀形态及真实工业场景,标注精准、泛化性强,适用于YOLO系列等主流模型训练,支撑工业质检、基础设施巡检与学术研究。
|
5月前
|
人工智能 算法 vr&ar
边缘AI算法在工业AR眼镜中的部署实践:从模型轻量化到端侧推理
本文分享AR眼镜端侧AI部署实践:针对工业无网/弱网、毫秒级响应需求,通过知识蒸馏+INT8量化+剪枝将模型压缩至<10MB;选用MNN引擎优化推理,实测仪表OCR(38ms/99.2%)、缺陷检测(42ms/98.7%)等任务均满足实时性与精度要求。
1039 2
边缘AI算法在工业AR眼镜中的部署实践:从模型轻量化到端侧推理
|
4月前
|
机器学习/深度学习 数据采集 算法
6类钢材表面缺陷检测数据集(6000张)|YOLO训练数据集 工业质检 缺陷识别 智能制造 表面检测
本数据集含6000张真实工业场景钢材表面图像,精准标注6类典型缺陷(裂纹、夹杂、斑块、麻面、氧化皮压入、划痕),采用YOLO标准格式,结构规范、质量高,可直接用于YOLOv5/v8等模型训练,助力工业质检智能化升级。
|
7月前
|
机器学习/深度学习 算法 数据可视化
基于YOLOv8的金属锈蚀(无人机拍摄/直拍)识别项目|完整源码数据集+PyQt5界面+完整训练流程+开箱即用!
基于YOLOv8的金属锈蚀智能识别系统,支持无人机航拍与近景拍摄图像,精准检测缝隙腐蚀、点蚀、均匀腐蚀等四类锈蚀类型。项目包含完整训练代码、标注数据集、预训练权重及PyQt5可视化界面,支持图片、视频、摄像头实时检测,开箱即用,适用于桥梁、管道、机械等工业场景的锈蚀自动识别与安全评估。
基于YOLOv8的金属锈蚀(无人机拍摄/直拍)识别项目|完整源码数据集+PyQt5界面+完整训练流程+开箱即用!
|
5月前
|
机器学习/深度学习 数据采集 算法
基于YOLOV8的混凝土裂缝识别系统(中英文双版) | 附完整源码与效果演示
本项目基于YOLOv8构建中英文双语混凝土裂缝识别系统,实现高精度、实时化自动检测。含完整源码、预训练模型、专用数据集及效果演示视频,支持单图/批量检测,具备轻量化、强鲁棒、易部署等优势,显著提升工程质检效率与可靠性。
|
7月前
|
机器学习/深度学习 传感器 人工智能
构建AI智能体:九十五、YOLO视觉大模型入门指南:从零开始掌握目标检测
本文介绍了视觉大模型及YOLO目标检测技术,重点讲解YOLOv8在CPU上的部署与应用。涵盖模型选择、图像检测、实时摄像头识别及性能优化,适合初学者快速上手。
1249 2
构建AI智能体:九十五、YOLO视觉大模型入门指南:从零开始掌握目标检测
|
10月前
|
数据可视化 关系型数据库 MySQL
【可视化大屏】全流程讲解用python的pyecharts库实现拖拽可视化大屏的背后原理,简单粗暴!
本文详解基于Python的电影TOP250数据可视化大屏开发全流程,涵盖爬虫、数据存储、分析及可视化。使用requests+BeautifulSoup爬取数据,pandas存入MySQL,pyecharts实现柱状图、饼图、词云图、散点图等多种图表,并通过Page组件拖拽布局组合成大屏,支持多种主题切换,附完整源码与视频讲解。
933 4
【可视化大屏】全流程讲解用python的pyecharts库实现拖拽可视化大屏的背后原理,简单粗暴!
|
10月前
|
机器学习/深度学习 监控 数据挖掘
Python 高效清理 Excel 空白行列:从原理到实战
本文介绍如何使用Python的openpyxl库自动清理Excel中的空白行列。通过代码实现高效识别并删除无数据的行与列,解决文件臃肿、读取错误等问题,提升数据处理效率与准确性,适用于各类批量Excel清理任务。
843 0
|
Ubuntu NoSQL Linux
《docker基础篇:3.Docker常用命令》包括帮助启动类命令、镜像命令、有镜像才能创建容器,这是根本前提(下载一个CentOS或者ubuntu镜像演示)、容器命令、小总结
《docker基础篇:3.Docker常用命令》包括帮助启动类命令、镜像命令、有镜像才能创建容器,这是根本前提(下载一个CentOS或者ubuntu镜像演示)、容器命令、小总结
814 6
《docker基础篇:3.Docker常用命令》包括帮助启动类命令、镜像命令、有镜像才能创建容器,这是根本前提(下载一个CentOS或者ubuntu镜像演示)、容器命令、小总结

热门文章

最新文章