Overlapped Wavelet Diffusion for Low-Light Image Enhancement

TL;DR

提出重叠小波扩散框架OWDiff,提升低光图像质量,平均PSNR提升0.58dB。

eess.IV 🔴 高级 2026-06-09 67 次浏览
Fen Peng Taizo Suzuki Seisuke Kyochi
低光图像增强 小波变换 扩散模型 无块效应 细节保留

核心发现

方法论

本文提出结合重叠小波变换(OWT)与低频引导高频增强块(HFEBlock)的低光图像增强框架OWDiff。通过采用Bior4.4小波实现跨块连续性,有效抑制Haar WT引起的块效应。利用WCDM对低频分量进行条件扩散去噪,增强亮度与结构。HFEBlock则利用低频引导,针对高频细节进行自适应修复,恢复锐利边缘与纹理。整体流程包括频率分解、低频增强、高频修复及逆变换,结合多级扩散与频域引导,提升图像质量。

关键结果

  • 在LOLv1和LOLv2-real数据集上,OWDiff平均PSNR较DiffLL提升0.58dB,SSIM提升1.64%,LPIPS降低5.9%。定量指标显示其在结构保真度和感知质量方面优于现有方法。
  • 在定性方面,OWDiff成功消除块效应,增强细节,边缘更锐利,纹理更自然。对比GSAD、Retinexformer等,表现出更优的视觉效果。
  • 消融实验验证,OWT和HFEBlock的结合是性能提升的关键。多级小波变换(K=1、2、3)中,K=1效果最佳,但K=2、3在效率上更优,表现出良好的平衡。

研究意义

该研究突破了传统Haar WT块效应限制,通过引入重叠小波实现连续性,结合频域引导的细节修复,有效改善低光图像的视觉质量。对自动驾驶、安防监控等场景具有重要应用价值,推动深度学习在极暗环境下的性能提升,解决噪声与细节恢复的长期难题,为未来低光成像技术提供新思路。

技术贡献

技术创新在于首次将重叠小波变换引入扩散模型框架,结合低频引导的高频修复模块,突破块效应限制。提出多级频域分解与修复机制,兼顾结构连续性与细节恢复,提升模型鲁棒性与效率。实现频域引导的细节增强,提供理论保证与工程实现的创新可能。

新颖性

本工作首次将重叠小波变换应用于扩散模型的低光增强中,解决非重叠WT带来的块效应问题。引入低频引导的高频修复块,创新性结合频域信息与扩散机制,超越现有仅依赖空间域或非重叠变换的方案,开辟了频域引导增强的新路径。

局限性

  • 模型在极端噪声环境下仍可能出现细节过度平滑或噪声残留,尤其在多级小波变换深度较大时效果减弱。
  • 高频修复依赖低频引导,可能在纹理极为复杂或极暗场景中出现误修或细节丢失,需进一步优化引导机制。
  • 多级扩散与频域处理带来一定计算成本,虽然较传统方法高效,但在边缘设备上仍有优化空间。

未来方向

未来将探索更高效的多尺度频域融合策略,结合自注意力机制提升细节修复能力。考虑引入无监督或半监督学习,增强模型泛化能力。还将研究模型在视频连续帧中的时空一致性,推动低光视频增强技术发展。

AI 总览摘要

低光环境下的图像常因光线不足、噪声严重而影响视觉质量,传统增强方法难以兼顾细节与块效应。近年来,扩散模型在图像增强中展现出优异性能,但仍受块效应和细节恢复不足的限制。本文提出OWDiff框架,创新性引入重叠小波变换(OWT)以解决块效应,同时结合低频引导的高频修复块(HFEBlock)实现细节增强。该方法通过多级频域分解与重建,有效平衡结构连续性与细节恢复,显著提升图像质量。在LOLv1和LOLv2-real数据集上,实验结果显示,OWDiff在PSNR、SSIM和LPIPS指标上均优于现有主流方法,平均提升分别达0.58dB、1.64%和5.9%。定性分析表明,模型成功消除块效应,增强边缘锐利度和纹理细节,视觉效果更自然。该研究不仅突破了Haar WT带来的结构限制,也为频域引导的细节修复提供新思路,具有广泛的应用潜力,包括自动驾驶、安防监控等极暗环境场景。未来,将继续优化多尺度频域融合策略,提升模型鲁棒性与效率,推动低光图像增强技术的深入发展。

深度分析

研究背景

低光图像因环境限制常表现出曝光不足、噪声增强和细节丢失,传统方法如直方图均衡、Retinex和伽马校正在改善亮度的同时,易引入色彩失真和噪声放大。深度学习方法如CNN和Transformer虽提升性能,但在极暗环境中仍难以控制增强强度和抑制伪影。扩散模型近年来被引入LLIE,表现优异,但受限于块效应和细节恢复不足。Haar WT的非重叠特性导致块边界明显,HFRM在噪声环境下难以恢复细节。这些问题促使研究者探索频域变换与深度模型结合的新方案,旨在实现无块效应、细节丰富的增强效果。

核心问题

核心问题在于如何在低光条件下实现高质量图像增强,既要避免块效应,又要恢复丰富细节。Haar WT的非重叠块结构引入块效应,影响视觉连续性;而高频修复模块在噪声环境中效果有限,导致细节模糊或伪影。此外,现有扩散模型在极暗场景下表现不佳,难以兼顾效率与效果。这些限制严重制约低光图像增强的实际应用,亟需创新的频域结构设计与细节引导机制。

核心创新

本研究提出重叠小波变换(OWT),通过扩展分析滤波器支持范围,增强块间连续性,抑制块效应。引入低频引导的高频修复块(HFEBlock),利用低频信息指导高频细节修复,恢复锐利边缘与纹理。结合多级频域分解与逆变换,形成高效、无块效应的增强框架。该方案突破了传统非重叠WT的限制,创新性融合频域引导与扩散模型,提升细节还原能力与结构连续性,为极暗环境下的图像增强提供新思路。

方法详解

  • �� 频率分解:采用多级重叠小波变换(Bior4.4)对低光图像进行多尺度频域分解,得到低频和高频子带。
  • �� 低频增强:利用Wavelet Conditional Diffusion Model(WCDM)对低频分量进行条件扩散去噪,提升亮度与结构。
  • �� 高频修复:引入HFEBlock,结合低频引导,通过频域匹配机制对高频子带进行自适应修复,恢复锐利边缘和纹理。
  • �� 频域重建:采用逆重叠小波变换(IOWT)将增强后的频域子带重建为完整图像。
  • �� 损失函数:结合扩散一致性、细节重建和内容一致性,优化模型性能。

实验设计

在LOLv1和LOLv2-real数据集上,采用PSNR、SSIM、LPIPS作为指标,比较多种方法,包括DiffLL、GSAD、Retinexformer等。训练采用2000步扩散,K=1、2、3多级频域分解,调节超参数以平衡效果与效率。进行消融实验验证OWT和HFEBlock的重要性,分析不同级别的影响。模型在不同场景下表现出优异的鲁棒性和细节恢复能力,验证了设计的有效性。

结果分析

实验结果显示,OWDiff在PSNR上平均提升0.58dB,SSIM提升1.64%,LPIPS降低5.9%,明显优于DiffLL和其他对比方法。定性图像显示,无块效应,边缘更锐利,纹理更自然。消融分析确认,重叠小波变换和低频引导的高频修复是性能提升的关键因素。多级频域分解在平衡效率和效果方面表现优异,K=2或3在保持较好效果的同时提升了处理速度。

应用场景

该方法适用于自动驾驶、安防监控、夜景摄影等场景,能在极暗环境中提升图像质量,增强目标识别和场景理解能力。模型可部署于边缘设备,结合实时处理需求,实现高质量夜间视觉感知。未来还可扩展到视频连续帧的增强,推动低光环境下的智能视觉系统发展。

局限与展望

模型在极端噪声环境下仍存在细节过度平滑和噪声残留的问题。多级小波变换带来一定的计算成本,边缘设备上需优化。此外,频域引导机制在复杂纹理场景中可能误修或失真,未来需引入更鲁棒的引导策略和多尺度融合技术。

通俗解读 非专业人士也能看懂

想象你在一个黑暗的房间里拍照,照片模糊且噪声很多。传统方法就像用一块模糊的滤镜,虽然能让图片变亮,但细节变得模糊不清,还会出现像块状的边界。本文的方法像是在用一套特殊的“魔法镜”,它能让图片变得更清晰自然。它先用一种叫“重叠小波”的技术,把图片拆成不同的部分,就像把房间的不同区域分开来观察。然后,它用一种智能的“修复师”对低亮度部分进行修复,让画面变亮。接着,它还用“细节增强器”对边缘和纹理进行修补,让图片的细节更锐利。最后,这些部分被拼接回完整的图片,就像用拼图拼出一幅清晰的画。这个过程不仅让图片变得更亮、更清晰,还避免了块状边界的出现,就像用一块特殊的“魔法布”把房间变得明亮又整洁。这项技术可以帮助夜间拍照、自动驾驶等场景,让黑暗中的世界变得更加清楚明亮。

简单解释 像给14岁少年讲一样

想象你在晚上用手机拍照,照片看起来很暗,还有很多噪点,像在看一幅模糊的画。以前的方法就像用一块普通的橡皮擦,虽然能让照片变亮,但会把细节擦掉,还会出现块块的边界。现在,这个新方法就像用一块神奇的“魔法布”,它能让照片变得更亮、更清晰。它会把照片拆成不同的部分,就像把房子、树木和天空分开来看。然后,它用聪明的“修复机器人”先让暗的部分变亮,再用“细节专家”修补模糊的边缘和纹理,让树叶变得更清楚,房子轮廓更锐利。最后,把这些部分拼在一起,就像拼图一样,得到一张明亮、细节丰富的照片。这样,即使在黑暗中拍照,也能看到更多细节,不会出现奇怪的块块边界。这项技术就像给你的夜景照片装上了“夜视镜”,让黑暗变得明亮又漂亮。

术语表

Overlapped Wavelet Transform (OWT) (重叠小波变换)

一种扩展的多尺度频域分析方法,通过共享滤波器支持,增强块间连续性,避免块效应。技术上采用宽支持滤波器实现跨块分析。

在论文中,OWT用以替代传统非重叠Haar WT,改善块效应问题。

High-Frequency Enhance Block (HFEBlock) (高频增强块)

利用低频引导,针对高频子带进行自适应修复,恢复锐利边缘和纹理,提升细节表现。

在OWDiff中,HFEBlock补偿由OWT引起的高频细节损失。

Wavelet Conditional Diffusion Model (WCDM) (小波条件扩散模型)

基于扩散机制的深度模型,用于对低频分量进行条件去噪,提升亮度和结构信息。

在低频增强阶段,WCDM对低频子带进行优化。

Inverse Overlapped Wavelet Transform (IOWT) (逆重叠小波变换)

将频域子带重建为完整图像的逆变换操作,保证频域修复后图像的连续性。

用于频域重建阶段,将增强后频域子带拼接成完整图像。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升极端噪声环境下的细节恢复能力,特别是在多级频域分解深度较大时的效果优化。
  • 2 模型在不同类型噪声(如高斯、泊松)下的泛化能力及其鲁棒性提升策略。
  • 3 多尺度频域融合的最优设计方案,兼顾效率与效果的平衡问题。

应用场景

近期应用

夜景摄影增强

可应用于手机夜景拍摄,提升暗光环境下的图像质量,减少噪声,增强细节,改善视觉体验。

自动驾驶夜间感知

增强车载摄像头在极暗环境中的图像,提升目标检测和场景理解的准确性,保障行车安全。

远期愿景

智能夜视系统

结合硬件与算法,打造全天候夜视系统,广泛应用于安防、军事、无人机等领域,实现全天候监控。

原文摘要

In this study, we propose an overlapped wavelet diffusion framework for Low-Light Image Enhancement (LLIE), which incorporates two complementary components to achieve blocking artifact-free and detail-preserving enhancement. Although recent diffusion-based LLIE methods have demonstrated remarkable performance compared with traditional approaches, DiffLL still suffers from blocking artifacts caused by the Haar Wavelet Transform (WT) and blurred edges or over-smoothed textures due to the limitations of its High-Frequency Restoration Module (HFRM). To overcome these issues, we introduce an Overlapped WT (OWT) that incorporates correlations across neighboring regions, thereby structurally preventing blocking artifacts. Furthermore, we integrate a low-frequency-guided High-Frequency Enhance Block (HFEBlock) to strengthen detail recovery, yielding sharper edges and more reliable textures. Extensive experiments on the LOLv1 and LOLv2-real datasets demonstrate that our framework, termed OWDiff, consistently outperforms existing LLIE methods both qualitatively and quantitatively, achieving superior visual quality while maintaining computational efficiency. OWDiff effectively addresses the structural limitations of the Haar WT and the HFRM, achieving an average PSNR gain of 0.58 dB, along with a 1.64% relative improvement in SSIM and a 5.9% relative reduction in LPIPS, compared to DiffLL across both the LOLv1 and LOLv2-real datasets.

eess.IV cs.CV