Learning Deep CNN Denoiser Prior for Image Restoration

TL;DR

IRCNN以HQS嵌入CNN去噪先验,在BSD68上σ=25达29.15 dB,并统一支持去模糊与超分辨率。

cs.CV 🟡 进阶级 2017-04-11 18 次浏览
Kai Zhang Wangmeng Zuo Shuhang Gu Lei Zhang
图像复原 CNN去噪 HQS Plug-and-Play先验 低层视觉

核心发现

方法论

论文以退化模型y=Hx+v和MAP目标为基础,通过半二次分裂(HQS)引入辅助变量z,将数据保真与正则化分开。x子问题求解退化一致性,z子问题等价于噪声水平√(λ/μ)的高斯去噪;作者用IRCNN七层扩张卷积网络替代显式Φ(x),训练σ=0–50、步长2的25个灰度和彩色去噪器。

关键结果

  • 在BSD68灰度去噪中,σ=25时IRCNN为29.15 dB,高于BM3D的28.57、WNNM的28.83、TNRD的28.92和MLP的28.96 dB;σ=15和50时分别为31.63和26.19 dB。
  • 彩色BSD68上,IRCNN在σ=5/15/25/35/50分别取得40.36/33.86/31.16/29.50/27.86 dB,均超过CBM3D的40.24/33.52/30.71/28.89/27.38 dB。
  • 速度测试中,1024×1024图像上GPU IRCNN-64耗时0.146秒,IRCNN-24为0.059秒;扩张卷积模型在BSD68上29.15 dB,优于同深度普通卷积的28.94 dB。

研究意义

研究缓解了模型优化灵活但迭代慢、判别式网络快速但任务专用这一长期矛盾。它表明,一个按噪声等级训练的CNN去噪器集合可以作为可插拔先验,服务于去噪之外的去模糊和超分辨率。该思想降低了为每种退化单独设计网络的成本,也为后来的Plug-and-Play、深度展开和无显式先验优化提供了重要工程范式。

技术贡献

核心技术是将IRCNN与HQS结合:x更新遵循数据模型,z更新调用CNN去噪器。网络采用1、2、3、4、3、2、1扩张率的3×3卷积、64个中间特征图、BN和ReLU,并以残差为学习目标。σ=0–50、步长2的25个模型通过相邻模型迁移初始化,兼顾精度、速度和迭代中的非精确子问题求解。

新颖性

相较BM3D、GMM和K-SVD等手工或内部先验,论文系统展示了判别式CNN去噪器作为通用优化模块的可行性。新意不只是提高去噪PSNR,而是把快速、联合建模RGB的外部先验嵌入HQS,使同一组模型适配多种退化矩阵H。

局限性

  • 实验主要覆盖高斯噪声、三类模糊核和经典超分辨率设定;真实相机噪声、非线性成像、复杂边界及空间变化退化未充分验证。
  • HQS仍需多轮迭代并调节去噪噪声级,从49指数衰减至1–15;25个模型和三天训练成本也增加了部署复杂度。

未来方向

后续可学习连续噪声条件而非25个离散模型,研究真实噪声、盲去模糊和空间变化算子,并将去噪器与数据一致性联合训练。还应建立更严格的收敛、稳定性和跨域泛化分析,探索轻量化、移动端及多模态图像复原。

AI 总览摘要

图像去噪、去模糊和超分辨率都可写成y=Hx+v,但问题通常病态:单靠观测不足以恢复清晰图像。传统BM3D、WNNM等先验灵活,却可能计算昂贵;MLP、TNRD等判别式模型速度快,却往往绑定特定任务或噪声等级。论文提出IRCNN,试图把两者优势结合起来。

方法核心是半二次分裂(HQS)。它把恢复分成数据一致性更新和去噪更新:前者遵守H描述的退化,后者由CNN提供图像先验。IRCNN使用七层3×3扩张卷积,扩张率为1、2、3、4、3、2、1,配合Batch Normalization、ReLU和残差学习;作者为灰度和彩色图像分别训练25个噪声等级模型,并在每轮HQS迭代中调用相应去噪器。

结果显示,BSD68灰度去噪在σ=25时达到29.15 dB,超过BM3D的28.57 dB和TNRD的28.92 dB;彩色σ=25时达到31.16 dB,高于CBM3D的30.71 dB。1024×1024图像GPU推理仅0.146秒。更重要的是,CNN先验还能嵌入去模糊和超分辨率,说明“去噪器即先验”可以成为通用复原模块。不过,方法依赖高斯训练分布、离散噪声模型和HQS调度;真实退化、理论稳定性及更低部署成本仍是开放问题。

深度分析

研究背景

图像复原目标是从y=Hx+v恢复x。MAP模型以1/2||y-Hx||²+λΦ(x)结合数据保真和先验。BM3D、WNNM、NCSR等优化方法适应多种H,但迭代较慢;MLP、SRCNN、TNRD等判别式网络推理快,却通常为特定任务训练。Plug-and-Play思想说明,若能把正则项变成去噪子问题,就能组合两类方法。

核心问题

关键难点是获得既强大又快速、还能跨任务复用的先验。显式TV、GMM、K-SVD和非局部模型存在伪影、计算量或过平滑问题;BM3D对自相似性依赖较强,彩色处理还需手工颜色变换。论文因此研究:能否训练高效CNN去噪器,并通过变量分裂解决去模糊、超分辨率等不同逆问题?

核心创新

第一,提出IRCNN去噪器,用扩张卷积以较浅网络获得33×33感受野;同深度普通卷积仅有15×15。第二,利用BN、ReLU和残差学习提升训练稳定性与推理效率。第三,训练σ=0–50、步长2的25个模型,使迭代过程可近似匹配不同去噪强度。第四,将CNN作为HQS中的模块,而非为每种退化单独训练端到端网络。

方法详解

  • �� 建模:使用y=Hx+v,优化1/2||y-Hx||²+λΦ(x)。
  • �� 分裂:令z=x,构造Lμ=1/2||y-Hx||²+λΦ(z)+μ/2||z-x||²。
  • �� x更新:求解||y-Hx||²+μ||x-z||²;闭式形式为(HTH+μI)⁻¹(HTy+μz),卷积退化用FFT加速。
  • �� z更新:调用Denoiser(x,√(λ/μ)),因此显式Φ被隐式CNN先验替代。
  • �� 网络:七层3×3扩张卷积,扩张率1、2、3、4、3、2、1;中间层64通道,使用BN和ReLU。
  • �� 训练:35×35小块、N=256×4000样本、Adam、批量256、残差损失1/(2N)Σ||f(yi;Θ)-(yi-xi)||²;相邻噪声模型迁移初始化。

实验设计

训练集含400张BSD、400张ImageNet验证图和4744张Waterloo图像;测试包括BSD68灰度和彩色去噪。基线为BM3D、WNNM、TNRD、MLP和CBM3D,指标为PSNR与运行时间。去模糊使用σ=1.6高斯核及[38]中的真实核,加入不同高斯噪声,比较MLP、IDDBM3D、NCSR和EPLL;HQS迭代30次,去噪等级由49指数下降到1–15。

结果分析

IRCNN在BSD68灰度σ=15/25/50分别为31.63/29.15/26.19 dB,均优于主要基线。彩色σ=25达到31.16 dB,比CBM3D高0.45 dB。扩张卷积消融中,7层普通卷积为28.94 dB,IRCNN为29.15 dB,接近16层普通卷积的29.20 dB。1024×1024 GPU耗时0.059秒(24通道)或0.146秒(64通道),显示速度与容量可调。

应用场景

在去模糊中,HQS的x步保证结果符合模糊核和观测,CNN步恢复自然图像结构;FFT使循环边界下的卷积求解高效。彩色IRCNN可直接联合处理RGB,而IDDBM3D和MLP需逐通道处理。相同框架也适合超分辨率、图像修复及其他能形成数据一致性子问题的低层视觉任务。

局限与展望

方法假设加性高斯噪声、已知或可处理的退化算子,并依赖手工设定HQS噪声调度。离散25模型虽少于按退化训练网络,但仍有存储和训练成本。论文对真实噪声、盲退化、极端结构和大规模视觉任务的验证有限;此外,CNN去噪器未必对应某个显式Φ,理论收敛和固定点性质需要进一步研究。

通俗解读 非专业人士也能看懂

把复原照片想成修复一幅被水弄脏的画。第一位工人只负责检查:修好的画必须符合原来的损坏方式,例如水痕应当能解释照片为什么变模糊。第二位工人是一位看过大量清晰画作的修复师,他负责判断线条、纹理和颜色通常应该是什么样。HQS就是让两位工人轮流工作:一个纠正“是否符合证据”,一个纠正“是否像自然图像”。

IRCNN不是只会处理一种污渍的工具,而是一套强弱不同的修复师。照片越脏,就先请更强的修复师;接近完成时,再换更细致的修复师。这样,同一套人马既能处理噪点,也能帮助修复模糊照片或放大低清图片。它在BSD68上比传统工具得到更高分,同时GPU处理大图很快。

但这套方法也有条件:它主要学习了人工加入的高斯噪声,现实中的相机污点可能更复杂;修复师需要轮流工作多次,也需要提前安排工作顺序。因此,它像一条高效的标准化修复流水线,而不是面对所有损坏都无需调整的万能机器。

简单解释 像给14岁少年讲一样

想象你拍了一张照片,但照片被撒上了沙子、拉伸变模糊,或者只有很小的一部分。你当然想把它还原,可问题是:电脑只看到坏掉的结果,不知道原图到底长什么样。这就像考试卷被水泡过,缺失的答案不能凭空猜,只能结合题目规则和以前见过的题型来推断。

这篇论文训练了一个很会“看清噪声照片”的CNN,名字叫IRCNN。它先学会很多不同程度的脏照片:轻微脏、很脏,以及灰度和彩色照片。修复时,HQS让电脑轮流做两件事:先检查结果是否符合照片的损坏方式,再请IRCNN判断画面是否自然。就像一个老师检查步骤,另一个老师检查答案像不像正确答案。

它为什么厉害?因为网络里的“观察范围”被扩大了,能同时参考附近和较远的像素;而且GPU可以并行处理,所以速度很快。BSD68测试中,噪声等级25时得到29.15 dB,超过BM3D的28.57 dB;彩色图像也胜过CBM3D。

更酷的是,它不只会去噪,还能帮助去模糊和放大图片。不过它主要练习的是人工高斯噪声,现实照片可能遇到压缩、光照和传感器问题。未来如果它能自动判断损坏类型,并学会连续变化的噪声强度,就会更像真正的万能修图助手!

术语表

CNN(卷积神经网络)

一种通过局部连接学习图像模式的模型。多层卷积可从边缘逐渐组合出纹理和结构。

论文用CNN学习灰度和彩色去噪先验。

HQS(半二次分裂)

通过引入辅助变量,把复杂目标拆成较容易求解的子问题。本文将数据一致性与去噪分开。

每轮HQS交替更新x和z。

Plug-and-Play先验

把现成去噪器当作隐式图像先验,而不必显式写出正则函数。它保留优化模型的灵活性。

IRCNN被插入HQS的z更新步骤。

扩张卷积

在卷积核元素之间加入间隔,以较少参数扩大观察范围。它能捕获更大上下文。

IRCNN使用扩张率1、2、3、4、3、2、1。

残差学习

网络学习噪声或变化部分,而不是直接重建完整图像。这样通常更利于训练。

损失目标是yi−xi,即噪声残差。

开放问题 这项研究留下的未解疑问

  • 1 IRCNN主要针对合成高斯噪声;真实相机噪声往往包含泊松、读出噪声和压缩效应。需要真实数据与盲退化实验验证跨域泛化。
  • 2 去噪器是隐式先验,未必对应明确的Φ。其HQS固定点、稳定性和不同网络组合下的收敛条件仍缺少完整理论解释。

应用场景

近期应用

照片去噪与去模糊

相机、扫描仪或内容平台可将IRCNN作为GPU模块,先按噪声等级选择模型,再在HQS中结合已知模糊核恢复细节。前提是退化近似高斯且算子可估计;论文报告1024×1024图像GPU耗时最低0.059秒。

图像放大与修复

超分辨率和缺失区域修复可把采样或遮挡算子放入x更新,把IRCNN放入z更新。这样无需为每一种退化重新训练完整网络,但需要合理设置数据一致性求解和迭代噪声调度。

远期愿景

通用低层视觉平台

未来可将连续噪声条件、真实噪声建模和轻量化CNN结合,形成跨设备、跨任务的复原引擎,服务移动摄影、医学成像和遥感;关键障碍是稳定性、盲退化与域迁移。

原文摘要

Model-based optimization methods and discriminative learning methods have been the two dominant strategies for solving various inverse problems in low-level vision. Typically, those two kinds of methods have their respective merits and drawbacks, e.g., model-based optimization methods are flexible for handling different inverse problems but are usually time-consuming with sophisticated priors for the purpose of good performance; in the meanwhile, discriminative learning methods have fast testing speed but their application range is greatly restricted by the specialized task. Recent works have revealed that, with the aid of variable splitting techniques, denoiser prior can be plugged in as a modular part of model-based optimization methods to solve other inverse problems (e.g., deblurring). Such an integration induces considerable advantage when the denoiser is obtained via discriminative learning. However, the study of integration with fast discriminative denoiser prior is still lacking. To this end, this paper aims to train a set of fast and effective CNN (convolutional neural network) denoisers and integrate them into model-based optimization method to solve other inverse problems. Experimental results demonstrate that the learned set of denoisers not only achieve promising Gaussian denoising results but also can be used as prior to deliver good performance for various low-level vision applications.

cs.CV