兼顾图像超分辨率、图像再缩放,ETH提出新型统一框架HCFlow,已开源

简介: 来自苏黎世联邦理工学院计算机视觉实验室的研究者提出了一种统一框架 HCFlow,该框架可以同时处理图像超分辨率和图像再缩放,并在通用图像超分辨率、人脸图像超分辨率和图像再缩放上等任务上取得了最佳结果。该论文已被 ICCV2021 接收。

近年来,归一化流(Normalizing Flow)模型在图像超分辨率(image SR)[SRFlow, ECCV2020]和图像再缩放(image rescaling)[IRN, ECCV2020]任务上取得了惊人的效果。尽管这两个任务有本质的不同,但都具有高度的相似性。基于以上两个工作,来自苏黎世联邦理工学院计算机视觉实验室的研究者提出了 HCFlow,使用一个统一的框架处理图像超分辨率和图像再缩放,并在通用图像超分辨率、人脸图像超分辨率和图像再缩放上等任务上取得了最佳结果。该论文已被 ICCV2021 接收。

微信图片_20211206113634.jpg



摘要


近期,归一化流(Normalizing Flow)模型在底层视觉领域取得了惊人的效果。在图像超分辨率上(image SR),可以用来从低分辨率图像中预测出细节不同的高质量高分辨率(diverse photo-realistic)图像。在图像再缩放(image rescaling)上,可以用来联合建模下采样和上采样过程,从而提升性能。本文提出了一个统一的框架 HCFlow,可以用于处理这两个问题。具体而言,HCFlow 通过对低分辨率图像和丢失的高频信息进行概率建模,在高分辨率和低分辨率图像之间学习一个双射(bijection)。其中,高频信息的建模过程以一种多层级的方式条件依赖于低分辨率图像。在训练中,该研究使用最大似然损失函数进行优化,并引入了感知损失函数(perceptual loss)和生成对抗损失函数(GAN loss)等进一步提升模型效果。实验结果表明,HCFlow 在通用图像超分辨率、人脸图像超分辨率和图像再缩放等任务上取得了最佳的结果。

 图像超分辨率 v.s. 图像再缩放
图像超分辨率的目标是从低分辨率图像中重建出高分辨率图像。低分辨率图像空间一般是给定的。例如,双三次降采样 (bicubic downsampling)图像。
图像再缩放的目标是将高分辨率图像下采样到视觉效果较好的低分辨率图像,并且保证可以很好地恢复出原本的高分辨率图像。与图像超分任务不同,图像再缩放中低分辨率图像空间是可以自己定义的。它的主要应用场景是减少图像存储和带宽。


方法


归一化流简单介绍

归一化流(Normalizing Flow)模型致力于在目标空间(例如高分辨率图像 x)和隐空间(例如服从高斯分布的隐变量 z)之间学习一个双射。它的模型结构通常是由多层可逆变换组成的一个可逆神经网络(invertible neural network):

微信图片_20211206113638.jpg


根据变量变换公式(change of variable formula)和链式法则,模型参数可以通过下面的最大似然损失函数进行优化:

微信图片_20211206113641.jpg


更多入门信息可以参考:


低分辨率图像空间建模
图像超分辨率和图像再缩放任务实际上都有一个图像退化(降采样)和图像超分(上采样)的过程。基于归一化流模型,该研究可以在高分辨率图像 x 和低分辨率图像 y 以及一个编码高频信息的隐变量 a 之间学习一个可逆双射变换微信图片_20211206113649.jpg由于直接对自然图像进行概率建模是很难的,该研究设计了一个基于真实低分辨率图像 y * 的条件分布模型:

微信图片_20211206113651.jpg


理想情况下,研究者希望 y 和 y * 越接近越好,所以他们将 p(y|y*)表示为狄拉克函数微信图片_20211206113902.jpg,并通过一个具有极小方差的高斯分布来近似表示 p(y|y*):

微信图片_20211206113654.jpg


由于高频信息 p(a|y)可以通过另一个归一化流模型变换为一个高斯分布 p(z),整个模型可以定义为:

微信图片_20211206113657.jpg


这样,高分辨率图像 x 就可以通过一个可逆神经网络变换为低分辨率图像 y 和编码高频信息的隐变量 z,且都服从参数已知的高斯分布。因此,我们可以方便地通过计算最大似然损失函数来优化模型。


多层级网络结构


为了更好地建模低分辨率图像和高频信息之间的关系(即 p(a|y)),该研究进一步提出了一个多层级条件依赖建模框架。在保持整体网络可逆性的条件下,逐步恢复高频信息,重建出高分辨率图像。如下图所示,归一化流的前向过程类似于二叉树的深度优先遍历,而反向过程则从最深层逐步计算至第一层。y 和 a 分别代表各层的低频和高频信息,数字代表计算顺序,蓝色箭头代表条件依赖关系。

微信图片_20211206113701.jpg


具体的网络结构如下图所示。

微信图片_20211206113704.jpg


实验


图像超分辨率

该研究使用最大似然损失函数训练模型,并使用 L1 损失函数,感知损失函数(perceptual loss)和生成对抗损失函数(GAN loss)进一步提升模型效果。在参数量下降 1/3 的情况下,HCFlow 在通用图像超分辨率和人脸图像超分辨率上,都取得了最佳的结果。在不同的随机采样中,可以生成细节不同的高质量高分辨率图像。值得注意的是,与 基于 GAN 的模型类似,基于归一化流的模型主要关注视觉效果,PSNR 通常有所下降。

微信图片_20211206113707.jpg


微信图片_20211206113711.jpg


微信图片_20211206113716.jpg


图像再缩放


由于图像再缩放通常不关注重建结果的多样性,HCFlow 采用与 IRN (ECCV2020)一致的训练策略,将前向过程和反向过程分别视为编码和解码过程。训练损失函数包括在高分辨率图像和低分辨率图像上的 L1 损失函数,以及在隐变量上的约束。在相近的模型参数量下,取得了 0.10-0.34dB 的提升

微信图片_20211206113719.jpg


微信图片_20211206113722.jpg


相关文章
|
算法 数据处理
点云地面点滤波(Progressive Morphological Filter)算法介绍(PCL库)
点云地面点滤波(Progressive Morphological Filter)算法介绍(PCL库)
2281 0
点云地面点滤波(Progressive Morphological Filter)算法介绍(PCL库)
|
存储 机器学习/深度学习 消息中间件
数据处理能力相差 2.4 倍?Flink 使用 RocksDB 和 Gemini 的性能对比实验
在本篇文章中我们将对 RocksDB、Heap 和 Gemini 在相同场景下进行压测,并对其资源消耗进行对比。测试的 Flink 内核版本为 1.10.0。
数据处理能力相差 2.4 倍?Flink 使用 RocksDB 和 Gemini 的性能对比实验
|
机器学习/深度学习 人工智能 自然语言处理
2025年AI客服机器人推荐:核心能力与实际场景应用分析
据《2024年全球客户服务机器人行业研究报告》预测,2025年全球AI客服机器人市场规模将超500亿美元,年复合增长率达25%以上。文章分析了主流AI客服机器人,如合力亿捷等服务商的核心功能、适用场景及差异化优势,并提出选型标准,包括自然语言处理能力、机器学习能力、多模态交互能力等技术层面考量,以及行业适配性、集成能力、数据安全、可定制化程度和成本效益等企业维度评估。
888 12
|
存储 人工智能 缓存
面向AI的存储软硬结合实践和创新
本次分享的主题是面向AI的存储软硬结合实践和创新,由阿里云智能集团专家袁茂军、王正勇和常存银主讲。内容涵盖三大板块:自研存储部件设计及实践、自研存储服务器设计及实践、以及面向AI场景的存储软硬一体解决方案及实践。重点介绍AliFlash系列存储部件的演进与优化,包括QLC SSD的设计挑战与解决方案,并探讨了高性能存储服务器在AI场景中的应用与未来发展方向。通过软硬件深度融合,旨在提升AI业务的性能与效率,降低总拥有成本(TCO)。
1307 7
|
机器学习/深度学习 算法 测试技术
贝叶斯优化实战(二)(2)
贝叶斯优化实战(二)
492 0
|
机器学习/深度学习 编解码 自然语言处理
深度学习进阶篇[9]:对抗生成网络GANs综述、代表变体模型、训练策略、GAN在计算机视觉应用和常见数据集介绍,以及前沿问题解决
深度学习进阶篇[9]:对抗生成网络GANs综述、代表变体模型、训练策略、GAN在计算机视觉应用和常见数据集介绍,以及前沿问题解决
深度学习进阶篇[9]:对抗生成网络GANs综述、代表变体模型、训练策略、GAN在计算机视觉应用和常见数据集介绍,以及前沿问题解决
|
机器学习/深度学习 算法 Python
机器学习中的数学原理——对数似然函数
机器学习中的数学原理——对数似然函数
2532 0
机器学习中的数学原理——对数似然函数
|
自然语言处理 安全 Linux
kali Linux的优点与缺点
Kali Linux简介: 用于数字取证操作系统 Kali Linux是基于Debian的Linux发行版, 设计用于数字取证操作系统。由Offensive Security Ltd维护和资助。最先由Offensive Secur
682 0
|
机器学习/深度学习 人工智能 算法
深度学习教程 | 网络优化:超参数调优、正则化、批归一化和程序框架
本节介绍超参数调试、批归一化和深度学习编程框架三个部分,内容包括:超参数优先级与调参技巧,超参数的合适范围确定,Batch Normalization,softmax回归,深度学习框架等。
608 1
深度学习教程 | 网络优化:超参数调优、正则化、批归一化和程序框架

热门文章

最新文章