Degradation-Aware Unfolding Half-Shuffle Transformer for Spectral Compressive Imaging

TL;DR

提出基于降解感知的半洗牌Transformer深度展开框架(DAUHST),在光谱压缩成像中实现超高性能重建。

eess.IV 🔴 高级 2022-05-20 35 次浏览
Yuanhao Cai Jing Lin Haoqian Wang Xin Yuan Henghui Ding Yulun Zhang Radu Timofte Luc Van Gool
深度学习 光谱成像 Transformer 深度展开 图像重建

核心发现

方法论

本文提出的DAUF框架基于最大后验(MAP)理论,结合参数估计与深度学习,动态调节每次迭代中的线性投影和去噪过程。核心创新在于引入估算的降解参数(α、β),由专门设计的参数估算网络(E)从压缩测量和物理遮罩中提取信息。利用半洗牌多头自注意(HS-MSA)机制的半洗牌Transformer(HST)作为去噪器,结合局部和非局部信息捕获能力,有效克服传统CNN在长距离依赖捕获上的局限。多阶段(9阶)模型在多个模拟和真实数据集上均优于现有SOTA方法,显著提升PSNR达38.36dB,且计算成本低。

关键结果

  • DAUHST在10个模拟场景中平均PSNR提升超过4dB,最高达38.36dB,优于BIRNAT和MST-L等最新方法。模型参数和FLOPS显著低于对比模型,参数仅为28.15M,FLOPS为19.42G,性能提升同时保证了效率。
  • 在真实场景中,DAUHST能清晰还原复杂光谱信息,表现出优异的视觉效果和光谱一致性,相关性达0.9984,优于传统和深度学习方法。
  • 消融实验验证了参数估算的关键作用及半洗牌机制在长距离依赖建模中的优势,显示出模型在不同硬件条件下的鲁棒性。

研究意义

该研究突破了光谱成像中深度展开方法的瓶颈,首次引入降解感知机制,有效融合物理模型与深度学习,极大提升重建质量和效率。其创新的Transformer架构为高维光谱数据处理提供新思路,推动光谱成像技术向实时、高精度方向发展,具有重要的学术和工业应用价值。

技术贡献

技术上,提出基于最大后验的降解感知深度展开框架,结合参数估算网络实现动态调节,创新性引入半洗牌Transformer(HST)作为去噪器,突破CNN在长距离依赖上的局限。模型在多阶段设计中融合物理信息与深度学习,显著提升性能和效率,首次实现Transformer在光谱成像深度展开中的应用,为未来高维图像重建提供新范式。

新颖性

这是首个将Transformer引入光谱压缩成像深度展开框架的研究,提出的半洗牌机制有效降低计算复杂度,同时捕获长距离依赖。相比传统CNN方法,模型在性能和效率上均实现突破,填补了Transformer在高维成像中的应用空白。

局限性

  • 模型在极端噪声环境或极高压缩比下仍存在性能下降,主要因参数估算的鲁棒性限制。
  • 当前架构对硬件资源要求较高,未来需优化模型结构以适应嵌入式设备。
  • 对不同硬件平台的适应性和泛化能力仍需进一步验证,尤其在动态场景中表现待提升。

未来方向

未来将探索更鲁棒的参数估算机制,结合自适应机制提升模型在复杂环境下的表现。同时,计划引入更高效的Transformer变体,降低计算成本,推动实时高维光谱成像的工业应用。此外,将拓展模型适应不同硬件平台和动态场景,增强泛化能力。

AI 总览摘要

光谱压缩成像(SCI)技术近年来成为高光谱成像的研究热点,尤其是在动态场景和实时应用中展现巨大潜力。传统的光谱成像系统依赖于光谱扫描,耗时长且难以捕获运动变化。CASSI系统通过编码光阱和色散元件实现快照式成像,但逆问题的复杂性极大限制了重建质量。现有方法多为模型驱动或深度学习,难以兼顾物理模型与数据驱动的优势。本文提出的Degradation-Aware Unfolding Half-Shuffle Transformer(DAUHST)创新性结合了MAP理论、参数估算与Transformer架构,显著提升了超光谱图像的重建性能。

核心创新在于引入参数估算网络(E),动态调节每次迭代中的线性投影和去噪过程,充分利用压缩测量和物理遮罩信息。与此同时,设计的半洗牌多头自注意(HS-MSA)机制的半洗牌Transformer(HST)能够同时捕获局部细节和长距离依赖,克服了传统CNN在高维数据中的局限。多阶段(9阶)模型在模拟和真实数据集上均表现优异,PSNR最高达38.36dB,优于现有最优方法。

实验结果显示,DAUHST不仅在性能上遥遥领先,还大幅降低了参数和计算成本,参数仅为28.15M,FLOPS为19.42G,达到了效率与效果的最佳平衡。其在真实光谱成像中的表现也极为出色,能清晰还原复杂光谱信息,具有广泛的工业应用潜力。未来,模型将朝着更鲁棒、更高效的方向发展,推动高维光谱成像技术迈向实时化、普及化。

深度解读

原文摘要

In coded aperture snapshot spectral compressive imaging (CASSI) systems, hyperspectral image (HSI) reconstruction methods are employed to recover the spatial-spectral signal from a compressed measurement. Among these algorithms, deep unfolding methods demonstrate promising performance but suffer from two issues. Firstly, they do not estimate the degradation patterns and ill-posedness degree from the highly related CASSI to guide the iterative learning. Secondly, they are mainly CNN-based, showing limitations in capturing long-range dependencies. In this paper, we propose a principled Degradation-Aware Unfolding Framework (DAUF) that estimates parameters from the compressed image and physical mask, and then uses these parameters to control each iteration. Moreover, we customize a novel Half-Shuffle Transformer (HST) that simultaneously captures local contents and non-local dependencies. By plugging HST into DAUF, we establish the first Transformer-based deep unfolding method, Degradation-Aware Unfolding Half-Shuffle Transformer (DAUHST), for HSI reconstruction. Experiments show that DAUHST significantly surpasses state-of-the-art methods while requiring cheaper computational and memory costs. Code and models will be released at https://github.com/caiyuanhao1998/MST

eess.IV cs.CV