图像超分:RFB-ESRGAN(Perceptual Extreme Super Resolution Network with Receptive Field Block)

简介: 图像超分:RFB-ESRGAN(Perceptual Extreme Super Resolution Network with Receptive Field Block)

前言

论文:https://arxiv.org/pdf/2005.12597.pdf

参考:esrgan_论文阅读 | 图像超分(七) RFB-ESRGAN_weixin_39559333的博客-CSDN博客


Perceptual Extreme Super Resolution Network with Receptive Field Blockopenaccess.thecvf.com

NTIRE2020极限超分赛道的冠军。

一、介绍

研究背景:单图像超分辨率重建,旨在恢复丢失的高频细节,同时保持内容一致性。大多数超分辨率网络架构都是基于提高峰值信噪比(PSNR)值来设计的。然而,PSNR导向方法重建的图像特别平滑,缺乏高频细节。为了改善超分辨率结果的感知质量,提出了基于感知的方法。生成对抗网络(GAN)被引入到超分辨率中以更自然地生成结果。

研究目的:目的是解决单幅图像的感知极端超分辨率的难题,因为不同图像的纹理细节差异很大。

研究思路:这项研究的主要贡献包括将感受野块(RFB)应用于超分辨率,以提取多尺度信息并增强特征可分辨性;在RFB中使用多个小内核代替多尺度感受野块中的大卷积内核,以提取详细特征并减少计算复杂度;在上采样阶段交替使用不同的上采样方法,以减少高计算复杂度,同时仍保持令人满意的性能。研究人员还使用了10个不同迭代模型的集成来提高模型的鲁棒性并减少每个单独模型引入的噪声。

研究结果:实验结果表明RFB-ESRGAN具有优越的性能。根据NTIRE 2020感知极端超分辨率挑战赛的初步结果,他们的解决方案在所有参赛者中排名第一。

评价指标:峰值信噪比(PSNR)、结构相似性(SSIM)、学习感知图像块相似度(LPIPS)和感知指数(PI)。(这些指标用于评估重建图像的锐度和保真度。其中,PSNR和SSIM越高越好,而LPIPS和PI越低越好)。

数据集:其中一个数据集是NTIRE 2020感知极端超分辨率挑战赛提供的DIV8K数据集,它包括1500张高分辨率图像,分辨率从2K到8K不等。此外,研究人员还使用了其他数据集来丰富训练数据,包括来自DIV2k数据集的800张图像、来自Flickr2K数据集的2650张图像和来自OST数据集的785张图像。

二、主要内容

1、解决的问题

极限超分需要解决纹理细节问题。

本文提出了3个改进点:

       1、引入Receptive Field Block(RFB)到超分中,平衡小计算量和大感受野的问题,能抽取很细节的特征;(RFB在目标检测、图像识别上已经验证过其强大能力)。

       2、交替使用Nearest Neighborhood Interpolation(NNI)和Sub-pixel Convolution(SPC)的上采样操作实现的超分,实现空间信息和深度信息的良好交融,不至于极限超分而损失细节性能。

       3、使用权重平均的方法,对训练过程中10个优质模型进行融合,提升模型抗噪能力和鲁棒性。

2、算法细节

(1)整体结构

整体和ESRGAN一致:

所提出的网络结构由图1所示的5个部分组成,即第一卷积模块、Trunk-a模块、Trunk-RFB模块、上采样模块和最终卷积模块。

Trunk-a是原ESRGAN中RRDB结构,论文使用16个block,每个block由5层卷积组成:

RRDB:dense connection + residual scaling + small initialization.

Trunk-B就是引入RFB后的RRFDB (Residual of Receptive Field Dense Block) 结构,论文使用8个block,每个block由5层RFB组成:

就只是把RRDB中的conv层换成RFB层。

上采样部分,先使用一层RFB进行特征融合,然后交替使用NNI ( Nearest Neighborhood Interpolation 最近邻插值) 和 SPC(Sub-pixel Convolution 子像素卷积) 的上采样操作,每次上采样后会接上一层RFB和LReLU。最后接上两层卷积。

上采样部分。

(2)RFB、上采样、损失函数、模型集合

  • Receptive Field Block (RFB)

和原始的RFB结构基本一致:

  1. 去掉BN层;
  2. 最后的ReLU使用LReLU;
  3. shortcut使用residual scaling;
  4. 结构微调。

The most important reason to use RFB is the ability of extracting the very detailed features, which is exactly what is needed in the field of image reconstruction.

本论文使用的RFB层

在RFB-ESRGAN中,主干RFB由8个剩余的感受野致密块(RRFDB)堆叠而成,每个RRFDB包含5个RFB。RFB的组成结构如图4所示。

  • 上采样模块 Upsampling Module

Nearest Neighborhood Interpolation (NNI) 对输入特征起到空间转换的作用,然后接RFB层将其空间影响在深度上扩散。Sub-pixel Convolution (SPC) 发挥深度到空间的变换,然后接RFB层将该变换在空间范围内增强。

Use them alternately will improve the information communication between space and depth. Also, the use of SPC will reduce the amount of parameters and time complexity.

  • 损失函数

损失函数和ESRGAN一致。

G网络损失函数:(利用像素损失、VGG损失和对抗性损失)

D网络的损失函数:(利用真实的损失LReal和伪损失LFake)

           

  • 模型集成

我们融合前10个模型的所有相应参数以导出集合模型GEnsemble,其参数为:

最终集成模型GEnsemble可以有效地降低重建图像的噪声,并且对不同的测试图像具有更强的鲁棒性。

3、实验设置

训练集:

HR图像结果MATLAB bicubic插值得到缩小16倍的LR图像。包含高清图像数据集:800张DIV2K,2650张Flickr2K,785张OST dataset。(数据多样性很重要,在其他SR实验验证过)
训练参数设置: batch size为16;Adam

训练过程可以分为两个阶段。第一阶段,训练具有L1损失的面向PSNR的模型。学习率初始化为2×10−4(10的-4次方),并且每2.5 × 105个小批量步骤衰减2倍。第二阶段(基于GAN的训练阶段),在完全训练面向PSNR的模型之后,生成网络用预训练的PSNR导向模型的参数初始化,并使用生成损失函数训练和对抗损失函数在生成损失函数中,λ被设置为10,η被设置为5e-3(e的-3次方)。学习率被设置为1e-4(e的-4次方),并在[50k,100k,200k,200k]减半。在基于GAN的训练阶段期间,每5000次迭代记录生成网络的参数。

实验结果对比:

消融实验:

上采样只用SPC(第2列),细节会 too sharp,有点假;

上采样只用NNI(第3列),细节会 too blurry,不清晰;

交替使用SPC和NNI(第4列)可以达到比较好的效果;

使用RFB(第5列),线条会更加细致和平滑;

使用集成模型(第6列),整体更加鲁棒,去噪。

SPC、NNI、RFB、ensemble 消融分析:

不同算法的对比:

不同算法的效果对比:


三、总结

针对单幅图像的极端感知超分辨率问题,提出了RFB-ESRGAN算法。针对×16尺度的超分辨率问题,提出了利用多尺度感受野提取LR图像的多尺度特征。此外,提出了利用小卷积核提取输入图像的细节特征,并利用最近邻插值和子空间插值的方法重建SR图像的细节特征。本文的实验和NTIRE 2020感知极限超分辨率挑战赛的结果表明,本文提出的方法能够有效地实现感知极限超分辨率。

目录
相关文章
|
前端开发 Java 关系型数据库
【实训项目】you书-校园二手书交易APP
【实训项目】you书-校园二手书交易APP
1362 0
|
存储 算法 计算机视觉
OpenCV(四十二):Harris角点检测
OpenCV(四十二):Harris角点检测
779 0
|
数据采集 数据挖掘 BI
Dataphin功能Tips系列(67)如何将BI报表纳入资产管理
Dataphin通过采集BI报表元数据,实现报表资产的信息完善与上架管理,助力企业构建统一的数据资产门户。以QuickBI为例,介绍如何配置应用系统、创建采集任务,并实现报表资产的统一管理与跳转分析。
348 9
|
数据采集 自然语言处理 调度
优化通义大模型推理性能:企业级场景下的延迟与成本削减策略
本文基于金融、电商、医疗等领域的实战经验,深入探讨通义千问等大模型的推理优化技术栈。从计算图优化、批处理策略、量化压缩到系统架构四个维度展开,结合Python代码示例与压力测试数据,提供企业级解决方案。针对延迟敏感、高吞吐及成本敏感场景,分析性能瓶颈并提出算子融合、动态批处理、混合精度量化等方法,同时设计分布式推理架构与冷启动优化策略。通过案例展示,如电商大促场景优化,实现峰值QPS提升6.5倍、P99延迟降低53%、月度成本下降62%。文章还提供优化实施路线图,助力企业分阶段落地技术方案。
1663 5
|
移动开发 JavaScript 前端开发
【Html.js——图片折叠效果】折叠手风琴(蓝桥杯真题-1763)【合集】
本项目实现了一个图片折叠手风琴效果,使用jQuery完成。主要包括以下部分: - **介绍**:任务是通过点击图片实现折叠和展开的效果。 - **准备**:内置初始代码,包含 `css/style.css`、`images/` 文件夹、`js/` 文件夹及 `index.html` 等文件。启动 Web Server 服务可运行项目。 - **目标**:完善 `index.js` 文件,使页面达到预期的折叠效果。 - **规定**:严格按步骤操作,保持默认文件结构不变,并在完成后保持 Web 服务正常访问状态。 - **通关代码**:使用 jQuery 实现点击事件,为选中元素添加 `act
511 19
|
机器学习/深度学习 算法 人机交互
智能语音识别技术的最新进展与未来趋势####
【10月更文挑战第21天】 在当今这个信息爆炸的时代,人机交互方式正经历着前所未有的变革。本文深入探讨了智能语音识别技术的前沿动态,从深度学习模型的创新应用到跨语言、跨领域的适应性增强,揭示了该领域如何不断突破技术壁垒,提升用户体验的真实案例与数据支撑。通过对比分析当前主流算法的性能差异,本文旨在为研究者和开发者提供一幅清晰的技术演进蓝图,同时展望了多模态融合、情感识别等新兴方向的广阔前景。 ####
1638 7
|
机器学习/深度学习 计算机视觉
YOLOv11改进策略【卷积层】| CVPR-2021 多样分支块DBB,替换传统下采样Conv 含二次创新C3k2
YOLOv11改进策略【卷积层】| CVPR-2021 多样分支块DBB,替换传统下采样Conv 含二次创新C3k2
642 0
YOLOv11改进策略【卷积层】| CVPR-2021 多样分支块DBB,替换传统下采样Conv 含二次创新C3k2
|
机器学习/深度学习 人工智能 自然语言处理
智能化软件测试:AI驱动的自动化测试策略与实践####
本文深入探讨了人工智能(AI)在软件测试领域的创新应用,通过分析AI技术如何优化测试流程、提升测试效率及质量,阐述了智能化软件测试的核心价值。文章首先概述了传统软件测试面临的挑战,随后详细介绍了AI驱动的自动化测试工具与框架,包括自然语言处理(NLP)、机器学习(ML)算法在缺陷预测、测试用例生成及自动化回归测试中的应用实例。最后,文章展望了智能化软件测试的未来发展趋势,强调了持续学习与适应能力对于保持测试策略有效性的重要性。 ####
|
机器学习/深度学习 图计算 计算机视觉
【YOLOv8改进 - 注意力机制】 CascadedGroupAttention:级联组注意力,增强视觉Transformer中多头自注意力机制的效率和有效性
YOLO目标检测专栏探讨了Transformer在视觉任务中的效能与计算成本问题,提出EfficientViT,一种兼顾速度和准确性的模型。EfficientViT通过创新的Cascaded Group Attention(CGA)模块减少冗余,提高多样性,节省计算资源。在保持高精度的同时,与MobileNetV3-Large相比,EfficientViT在速度上有显著提升。论文和代码已公开。CGA通过特征分割和级联头部增加注意力多样性和模型容量,降低了计算负担。核心代码展示了CGA模块的实现。
|
机器学习/深度学习 编解码 Unix
超分数据集概述和超分经典网络模型总结
超分数据集概述和超分经典网络模型总结
1229 1

热门文章

最新文章