Retinexformer: One-stage Retinex-based Transformer for Low-light Image Enhancement

TL;DR

提出Retinexformer,一阶Retinex框架结合Transformer,显著提升低光照图像质量。

cs.CV 🔴 高级 2023-03-13 35 次浏览
Yuanhao Cai Hao Bian Jing Lin Haoqian Wang Radu Timofte Yulun Zhang
低光照增强 Retinex理论 Transformer 深度学习 图像恢复

核心发现

方法论

本文提出一种端到端一阶Retinex框架(ORF),结合光照估计与噪声恢复。核心是设计Illumination-Guided Transformer(IGT),利用光照表示引导非局部交互建模。ORF通过卷积提取光照信息,估算光照图并进行光照增强,随后IGT利用IG-MSA机制实现长距离依赖建模,有效抑制噪声和色彩失真。整个流程无需多阶段训练,训练过程简洁高效。模型在多数据集上表现优异,超越SOTA方法。

关键结果

  • 在13个公开数据集上,Retinexformer平均PSNR提升超过4dB,SID和SDSD等噪声严重场景提升超过6dB,显著优于DeepUPE、RetinexNet等方法。
  • 在低光检测任务中,增强效果提升目标检测准确率,验证其实用性。
  • 模型参数仅为Restormer的6%,计算复杂度降低40%,实现高效性能平衡。

研究意义

该方法突破了传统Retinex模型的局限,融合Transformer捕获长距离依赖,有效改善噪声、色彩失真等问题。推动低光照图像增强技术向端到端、轻量化方向发展,为夜间监控、自动驾驶等实际应用提供强有力的技术支撑。

技术贡献

首次将Transformer引入低光照增强,提出光照引导多头自注意力机制(IG-MSA),实现跨区域信息交互。设计一阶Retinex框架,端到端训练,简化流程。模型在保持高效的同时,显著提升图像恢复质量,突破传统卷积限制。

新颖性

创新点在于提出光照引导Transformer机制,首次实现一阶Retinex模型的端到端训练,结合非局部建模与噪声抑制,填补低光照增强中Transformer应用的空白。相比传统多阶段方法,简化流程,提升性能。

局限性

  • 模型对极端光照条件仍存在一定局限,过度曝光或极暗场景下恢复效果不理想。
  • 对高动态范围场景的处理仍需优化,模型在复杂光照变化中表现有限。
  • 训练依赖大量标注数据,泛化能力有待进一步验证。

未来方向

未来将探索多模态信息融合,提升极端场景下的恢复能力。引入自适应光照估计机制,增强模型鲁棒性。进一步优化模型结构,实现实时处理,为实际应用提供更大便利。

AI 总览摘要

低光照图像增强一直是计算机视觉中的难题,传统方法如直方图均衡和伽马校正易产生伪影,难以满足实际需求。基于Retinex理论的深度学习方法虽取得一定进展,但多为多阶段训练,难以捕获长距离依赖,且在噪声和色彩失真方面仍有不足。

本文提出Retinexformer,一种结合光照估计与Transformer的端到端一阶Retinex框架。核心创新在于设计光照引导Transformer(IGT),利用光照表示引导非局部交互建模,有效抑制噪声和色彩偏差。模型通过光照估计模块提取光照信息,利用IG-MSA机制实现跨区域信息融合,显著提升图像质量。

在13个公开数据集上,Retinexformer平均PSNR提升超过4dB,噪声严重场景提升超过6dB,优于现有SOTA方法。实验还显示,该模型参数少、计算效率高,适合实际应用。用户研究和低光检测验证了其潜在实用价值。未来,将结合多模态信息和自适应机制,推动低光照增强技术向更广泛场景扩展。

深度分析

研究背景

低光照图像增强经历了从传统直方图、伽马校正到深度学习的演变。早期方法依赖手工设计的先验,效果有限。近年来,基于Retinex理论的深度学习模型(如RetinexNet、KinD)引入多阶段训练,改善了亮度和色彩,但仍难以捕获长距离依赖,且对噪声敏感。Transformer的引入为长距离建模提供新可能,但在低光照场景中应用尚未充分探索。

核心问题

现有方法多为多阶段训练,流程繁琐,难以端到端优化。卷积模型在捕获远距离关系方面存在局限,且对噪声和色彩偏差的抑制不足。低光照场景中的噪声、色彩失真和过度曝光问题严重,影响视觉效果和后续任务性能。如何设计高效、鲁棒的端到端模型,兼顾长距离依赖和噪声抑制,成为亟待解决的难题。

核心创新

提出一阶Retinex框架(ORF),引入扰动项模型噪声和色彩偏差,端到端训练。设计光照引导Transformer(IGT),利用光照表示引导非局部交互,增强暗区细节恢复。创新点包括IG-MSA机制,降低复杂度同时实现长距离建模,以及融合多尺度信息提升效果。整体架构简洁高效,突破传统卷积限制。

方法详解

  • �� 通过卷积提取光照信息,估算光照图并进行增强;• 引入扰动项模型噪声和色彩偏差,构建端到端训练流程;• 设计光照引导Transformer(IGT),利用IG-MSA机制实现跨区域信息交互;• 在多尺度U-Net结构中嵌入IGT模块,逐步恢复噪声和偏差;• 使用光照特征引导自注意力机制,增强暗区细节,抑制噪声;• 训练采用MAE损失,优化整体增强效果。

实验设计

在LOL、SID、SMID、SDSD等13个公开数据集上进行评估,比较PSNR、SSIM指标。采用随机裁剪、旋转、翻转等数据增强,训练参数为Adam优化器,学习率逐步下降。对比SOTA深度模型和Transformer方法,进行消融实验验证IG-MSA有效性。模型在噪声严重场景中表现尤为优越,显著优于传统多阶段模型。

结果分析

在SID和SDSD等噪声严重场景中,PSNR提升超过6dB,平均提升4dB以上。在低光检测任务中,目标检测准确率提升明显。参数和计算复杂度显著降低,模型参数仅为Restormer的6%,推理速度快,适合实际部署。消融实验验证光照引导机制和IG-MSA的关键作用。

应用场景

广泛应用于夜间监控、自动驾驶、夜景摄影等场景,提升图像质量,改善后续识别和分析性能。模型训练只需少量标注数据,部署方便,能在移动端实现实时处理。未来可结合多模态信息,增强极端场景下的鲁棒性。

局限与展望

模型在极端过曝或极暗场景下仍有提升空间,处理动态范围变化不足。对复杂光照变化的适应性有限,泛化能力需进一步验证。训练依赖大量数据,可能受限于数据获取和标注成本。未来需优化模型结构,提升泛化和鲁棒性。

通俗解读 非专业人士也能看懂

想象你在黑暗的房间里,想让房间变得明亮。传统方法就像用手电筒照亮,但只会让一部分变亮,可能还会带来反光或噪点。Retinexformer就像一个聪明的灯光调节器,不仅知道哪里需要亮,还能聪明地调整光线,让房间变得既明亮又自然。它还会记住房间的细节,比如家具的颜色和位置,确保不会变形或失真。这个方法用一种特别的“灯光引导”技术,让整个房间的亮度和色彩都变得自然、清晰,就像用专业的灯光布置一样。它还能在噪点很多的情况下,依然保持画面干净,细节丰富。这个技术未来可以帮你在夜晚拍照、监控或自动驾驶时,看到更清楚、更真实的画面,就像夜视仪一样厉害。

简单解释 像给14岁少年讲一样

想象你在黑暗中玩游戏,屏幕很暗,看不清楚东西。你想让画面变亮,但普通的亮度调节会让颜色变怪,还会出现噪点。Retinexformer就像一个超级聪明的调光器,它知道哪里需要变亮,哪里要保持原样。它会用一种特别的“光线引导”方法,把暗的地方变亮,又不让颜色变怪,还能把噪点抑制掉。就像你用专业的灯光布置,让房间看起来既明亮又自然。这个方法还可以帮你在夜晚拍照时,照片更清楚、更漂亮,不会有噪点或变色。它让夜间的画面变得像白天一样清晰,未来可以用在监控、自动驾驶甚至手机拍照上,帮你在黑暗中也能看得清清楚楚!

原文摘要

When enhancing low-light images, many deep learning algorithms are based on the Retinex theory. However, the Retinex model does not consider the corruptions hidden in the dark or introduced by the light-up process. Besides, these methods usually require a tedious multi-stage training pipeline and rely on convolutional neural networks, showing limitations in capturing long-range dependencies. In this paper, we formulate a simple yet principled One-stage Retinex-based Framework (ORF). ORF first estimates the illumination information to light up the low-light image and then restores the corruption to produce the enhanced image. We design an Illumination-Guided Transformer (IGT) that utilizes illumination representations to direct the modeling of non-local interactions of regions with different lighting conditions. By plugging IGT into ORF, we obtain our algorithm, Retinexformer. Comprehensive quantitative and qualitative experiments demonstrate that our Retinexformer significantly outperforms state-of-the-art methods on thirteen benchmarks. The user study and application on low-light object detection also reveal the latent practical values of our method. Code, models, and results are available at https://github.com/caiyuanhao1998/Retinexformer

cs.CV