Residual Non-local Attention Networks for Image Restoration

TL;DR

RNAN以局部与非局部混合注意力提升复原,Urban100去噪σ=70达27.45 dB。

cs.CV 🔴 高级 2019-03-25 27 次浏览
Yulun Zhang Kunpeng Li Kai Li Bineng Zhong Yun Fu
图像复原 非局部注意力 残差学习 图像去噪 深度卷积网络

核心发现

方法论

RNAN以全局残差学习预测噪声、模糊或压缩伪影。网络堆叠Residual Local Attention Block与Residual Non-local Attention Block;每块包含Trunk Branch和Mask Branch。Trunk由简化Residual Blocks提取层级特征,Mask通过大步长卷积、反卷积及Sigmoid生成通道—空间权重,部分Mask嵌入Non-local Block以建模全图像素依赖。

关键结果

  • 在彩色去噪中,RNAN于Kodak24、BSD68和Urban100的σ=70 PSNR分别为28.16、26.83和27.45 dB,较第二优方法FFDNet分别高0.48、0.30和1.06 dB。
  • 在彩色去马赛克中,RNAN在McMaster18、Kodak24、BSD68和Urban100分别达到39.71/0.9725、43.09/0.9902、42.50/0.9929和39.75/0.9848(PSNR/SSIM),均明显优于IRCNN。
  • Urban100、σ=30消融显示:无注意力为30.96 dB;加入Mask为31.17 dB;加入非局部混合注意力为31.32 dB;更深配置最高31.50 dB,证明两类模块均有效。

研究意义

论文针对图像复原中长期存在的两个矛盾:卷积感受野有限,以及不同区域、通道被近似等权处理。RNAN让模型同时参考局部纹理和远距离相似结构,并把计算资源集中到更难恢复的区域。其统一框架覆盖去噪、去马赛克、压缩伪影消除和超分辨率,说明注意力并非只适用于分类,也能直接改善低层视觉的像素保真度。

技术贡献

核心技术包括Trunk—Mask双分支、局部/非局部混合注意力和残差非局部注意力学习。非局部操作使用Embedded Gaussian:f(xi,xj)=exp((Wuxi)^T(Wvxj)),并以Softmax聚合全空间特征;输出为zi=Wzyi+xi。不同于仅用Htrunk(x)(Hmask(x)+1)的分类式注意力,RNAN采用Htrunk(x)Hmask(x)+x,直接保留低层输入,适合很深的复原网络。

新颖性

作者称其为首次将残差非局部注意力系统用于图像复原。相较DnCNN、MemNet和IRCNN等主要依赖局部卷积或普通残差堆叠的方法,RNAN把非局部关系放在Mask Branch中,用全局依赖指导Trunk特征提取,而不是简单把非局部模块置于主干流水线。

局限性

  • 非局部模块计算代价高,增加训练与推理时间;因此作者仅在低层和高层特征空间配置2个RNAB,不能证明任意层数都更优。
  • 实验主要采用L2损失、DIV2K的800张训练图和合成AWGN/JPEG退化,真实相机噪声、复杂混合退化及感知质量尚未充分验证。
  • 论文报告了去噪、去马赛克和压缩伪影结果,但完整超分辨率数据与复杂度对比在给定正文中并不完整。

未来方向

后续可研究更高效的稀疏或窗口化非局部注意力,降低全局关联的内存开销;引入真实退化数据、L1或感知损失及盲复原设置,检验跨设备泛化;还可让网络动态决定哪些层、区域或通道需要非局部计算,并系统评估速度、参数量和能耗之间的权衡。

AI 总览摘要

图像复原要从噪声、模糊、马赛克或压缩后的低质量图像中找回高质量结果。传统CNN如SRCNN、ARCNN、DnCNN和MemNet已显著提升性能,但局部卷积难以连接相距很远的像素,且常把平坦区域、纹理区域和不同通道近似同等处理,容易造成纹理过度平滑。

ICLR 2019论文提出Residual Non-local Attention Network(RNAN)。它以全局残差学习预测退化成分,并堆叠Residual Local/Non-local Attention Blocks。每个模块由Trunk Branch提取层级特征、Mask Branch生成权重;局部Mask使用大步长卷积与反卷积扩大视野,非局部Mask通过Embedded Gaussian Non-local Block计算全图依赖,再以Sigmoid同时调节空间和通道。其关键公式是H(x)=Htrunk(x)Hmask(x)+x,既强化困难区域,又保留低层细节。

实验使用DIV2K的800张训练图。彩色去噪σ=70时,RNAN在Kodak24、BSD68、Urban100分别达到28.16、26.83、27.45 dB,较FFDNet高0.48、0.30、1.06 dB;彩色去马赛克中,Urban100达到39.75 dB/0.9848,显著超过IRCNN的36.64/0.9743。消融实验最高达31.50 dB。研究表明,全局关系与选择性注意力能改善像素级复原,但非局部计算昂贵,且真实退化和感知评价仍需进一步研究。

深度分析

研究背景

图像复原是低层视觉核心任务。SRCNN、ARCNN将CNN用于超分辨率和压缩伪影消除;DnCNN引入残差学习;IRCNN使用去噪先验;MemNet和编码—解码网络则探索更深结构。它们证明深度CNN有效,但大多依赖局部卷积,难以利用远距离相似纹理,也缺少对通道信息和困难区域的自适应分配。

核心问题

退化过程不可逆,复原本质上是病态逆问题。局部感受野无法及时捕获全图依赖,重噪声或重复纹理尤其困难;平坦区易修复、纹理区难修复,却常被同等处理。不同通道还可能分别承载高频细节或退化噪声,简单融合会导致细节丢失与过平滑。

核心创新

  • ��以Trunk—Mask双分支把特征提取和权重学习分离。
  • ��局部Mask用大步长卷积/反卷积扩大感受野,同时避免MaxPooling造成的像素细节损失。
  • ��非局部Mask引入Embedded Gaussian Non-local Block,让任意位置互相匹配。
  • ��提出HtrunkHmask+x的残差注意力学习,较分类网络的Htrunk(Hmask+1)更能保留低层复原信息。

方法详解

  • ��输入IL先经卷积提取浅层特征,输出端重建IR,整体采用IR=HRNAN(IL)并学习全局残差。
  • ��每个注意力块前后含q=2个Residual Blocks;Trunk含t=2个简化RB,每个RB为两层3×3卷积和一个ReLU。
  • ��Mask以m=1个RB、步长卷积下采样、2m个RB和反卷积上采样,最后经1×1卷积与Sigmoid得到[0,1]权重。
  • ��RNAB中的NLB以全图位置j对位置i做Softmax加权,g(xj)=Wgxj,输出Wzyi+xi。
  • ��网络含10个块,其中2个为RNAB;RB通道数为64,NLB中C=32。

实验设计

训练集为DIV2K 800张图;每批抽取16个48×48低质量块。使用ADAM,β1=0.9、β2=0.999、ε=10^-8,初始学习率10^-4,每20万次迭代减半,采用L2损失。去噪测试Kodak24、BSD68、Urban100,AWGN σ=10/30/50/70;去马赛克测试McMaster18等;压缩实验使用LIVE1、Classic5和JPEG质量10/20/30/40,指标为PSNR/SSIM。

结果分析

RNAN在彩色和灰度去噪的所有报告数据集及噪声等级上均取得最佳结果。灰度Urban100的σ=70结果为25.89 dB,彩色为27.45 dB。去马赛克中,Kodak24达到43.09 dB/0.9902,BSD68达到42.50/0.9929。压缩伪影实验在LIVE1和Classic5各JPEG质量上均优于比较方法。消融表明Mask、NLB和增加RAB深度均带来收益。

应用场景

RNAN可用于照片去噪、手机图像增强、拜耳传感器去马赛克、JPEG后处理和超分辨率。部署前需要与目标设备退化相匹配的训练数据;论文采用合成AWGN和标准JPEG,适合作为受控场景基线。其优势是统一架构和中等模型规模,可服务相机、扫描、医学成像及内容生产流程。

局限与展望

全局非局部关联的计算和显存开销较大,解释了作者只放置两个RNAB。训练数据主要来自DIV2K,退化模型偏合成,真实传感器噪声、运动模糊和混合压缩可能造成域偏移。L2优化偏向平均意义上的PSNR,未充分覆盖主观纹理质量;未来应发展高效注意力、真实退化建模、盲复原和速度—质量联合评测。

通俗解读 非专业人士也能看懂

把修复照片想成一间大型修理厂。传统方法像只看眼前一小块的工人:他能处理邻近划痕,却不知道照片另一端是否有相同图案可以参考,也常把干净墙面和复杂花纹用同样力度打磨。RNAN安排两组工人:主修理线负责逐层恢复细节,检查线负责判断哪里更重要。检查线一部分只看附近,另一部分可以同时查看整张照片,寻找远处相似的颜色和形状。

检查线不会直接替代主修理线,而是给每个位置和每类信息一个0到1之间的关注分数。复杂、受损严重的纹理会得到更多关注,容易修复的平坦区域则少花时间。最后,工厂还保留原始照片的一份副本,避免深度修理把本来正确的细节也抹掉。实验中,这种安排在Kodak24、BSD68和Urban100去噪,以及去马赛克任务上都超过多种旧方法;代价是全厂同时查找远处对应位置需要更多时间和设备。

简单解释 像给14岁少年讲一样

想象你有一张被撒上沙子、压缩得很糊,或者颜色格子乱掉的照片。普通修图程序像拿放大镜一次只看一个小方格:附近信息能帮忙,但如果照片另一边刚好有一样的窗户、砖墙或文字,它就很难发现。于是它可能把细节当成噪声一起擦掉,结果看起来太平滑。

RNAN像一个会分工的超级修图队!主队一层层处理照片,先找大轮廓,再补小细节;观察队给不同地方打分,告诉主队“这里很难,认真看!”有的观察员只检查附近,有的能把整张照片放在一起比较。它们还会分别判断位置和颜色通道,所以不是所有像素都被一视同仁。

关键是,队伍不会丢掉原图中已经正确的部分,而是把修好的内容加回去。这样深层网络工作很多次,也不容易越修越糟。测试显示,Urban100在彩色噪声等级70下达到27.45 dB,Kodak24去马赛克达到43.09 dB,比IRCNN更好。

当然,超级观察员要同时比较整张照片,会更耗算力;而且实验主要使用合成噪声。未来如果它能更快、能适应手机真实噪声,就可能成为相机和社交媒体的自动修图高手!

术语表

Residual Learning(残差学习)

不直接重建完整图像,而是学习输入与目标之间的差异。跳跃连接还能保留原有低层细节并稳定深层训练。

RNAN用全局残差学习预测退化成分,并在注意力块中使用HtrunkHmask+x。

Non-local Block(非局部块)

让一个位置根据特征相似度汇聚所有位置的信息,而非只看邻域。RNAN使用Embedded Gaussian和Softmax计算关联。

它被放入Mask Branch,以生成具有全图依赖的注意力。

Mixed Attention(混合注意力)

同时在空间位置和特征通道上产生权重。Sigmoid把权重归一到0至1,用于自适应缩放特征。

RNAN的局部和非局部Mask最终生成通道—空间混合注意力。

Trunk Branch(主干分支)

负责提取层级图像特征的路径。它由简化残差块组成,不使用Batch Normalization。

RNAN设置t=2个RB,恢复纹理、边缘等基础表示。

Mask Branch(掩码分支)

负责判断哪些特征更值得保留或增强的路径。它输出逐位置、逐通道的调节权重。

其采用步长卷积、反卷积、1×1卷积和Sigmoid。

PSNR/SSIM

PSNR衡量重建误差对应的峰值信噪比,单位为dB;SSIM比较结构、亮度和对比度相似性。通常数值越高越好。

论文用二者评估去噪、去马赛克和压缩伪影消除。

开放问题 这项研究留下的未解疑问

  • 1 真实退化泛化仍不清楚:DIV2K训练及AWGN、JPEG设置无法充分代表手机传感器噪声、空间变化噪声和混合退化,需要真实配对数据与盲复原测试。
  • 2 非局部模块的效率边界尚未明确:增加模块通常提升PSNR,却会增加时间和显存;如何用稀疏、低秩或窗口化关联保持质量仍待研究。

应用场景

近期应用

相机与扫描图像去噪

相机厂商可用与设备噪声分布匹配的成对数据微调RNAN,处理高ISO照片或扫描文档。模型尤其适合纹理密集区域,但部署时需评估非局部模块的显存和延迟。

JPEG照片修复与去马赛克

内容平台或图像软件可将RNAN用于上传照片预处理、拜耳图像重建和压缩伪影消除。论文显示其在McMaster18、Kodak24等数据集上优于IRCNN,但需针对实际编码器校准。

远期愿景

统一低层视觉增强系统

未来可将真实噪声、模糊、压缩和低分辨率联合建模,形成自动判断退化类型的影像增强系统,服务移动摄影、医学成像和遥感;关键障碍是数据、效率与可靠性。

原文摘要

In this paper, we propose a residual non-local attention network for high-quality image restoration. Without considering the uneven distribution of information in the corrupted images, previous methods are restricted by local convolutional operation and equal treatment of spatial- and channel-wise features. To address this issue, we design local and non-local attention blocks to extract features that capture the long-range dependencies between pixels and pay more attention to the challenging parts. Specifically, we design trunk branch and (non-)local mask branch in each (non-)local attention block. The trunk branch is used to extract hierarchical features. Local and non-local mask branches aim to adaptively rescale these hierarchical features with mixed attentions. The local mask branch concentrates on more local structures with convolutional operations, while non-local attention considers more about long-range dependencies in the whole feature map. Furthermore, we propose residual local and non-local attention learning to train the very deep network, which further enhance the representation ability of the network. Our proposed method can be generalized for various image restoration applications, such as image denoising, demosaicing, compression artifacts reduction, and super-resolution. Experiments demonstrate that our method obtains comparable or better results compared with recently leading methods quantitatively and visually.

cs.CV