NTIRE 2025 Image Shadow Removal Challenge Report
采用多尺度Transformer与频域融合,提升阴影去除性能,PSNR达25.90。
核心发现
方法论
本研究提出基于多尺度Transformer架构的阴影去除方法,结合频域特征融合技术。核心模型包括Hierarchical Transformer Block用于全局信息提取,结合NAFNet进行细节恢复。利用辅助的深度估计和反射信息增强模型鲁棒性。训练采用多数据集融合策略,优化目标包括PSNR、SSIM和LPIPS指标,结合用户感知的MOS评分进行评价。模型通过双路径设计实现空间与频域信息的互补,显著提升阴影区域的还原质量。
关键结果
- 在WSRD+数据集上,模型达到25.90的PSNR,优于现有SOTA方法,且在SSIM和LPIPS指标上表现优异,分别为0.842和0.078。用户感知评分MOS达8.75,说明视觉效果优良。多尺度融合策略有效缓解阴影边界模糊问题,模型参数仅为25.9M,推理速度快,适合实际应用。对比传统方法,性能提升超过10%,在复杂场景中表现尤为突出。
研究意义
该研究突破了阴影去除中的多尺度信息整合瓶颈,为复杂场景下的阴影处理提供了新思路。其结合Transformer与频域特征的创新设计,为深度学习在图像修复中的应用树立了新标杆,推动了智能图像编辑、增强等行业的发展。模型的高性能与高效率,为自动驾驶、监控等场景的视觉感知提供了技术支撑,具有广泛的实际价值。
技术贡献
提出融合Transformer与频域特征的多尺度阴影去除框架,创新性引入频域特征增强细节恢复,结合多数据集训练策略提升模型泛化能力。模型结构采用Hierarchical Transformer和NAFNet的结合,优化了阴影边界处理与细节保持。引入多尺度融合机制,有效缓解阴影区域模糊与色彩偏差问题,显著优于传统卷积或单一Transformer模型。该方法在保证高质量还原的同时,兼具计算效率,为工业应用提供技术保障。
新颖性
首次将多尺度Transformer与频域特征融合应用于阴影去除任务,突破了以往仅依赖空间域信息的局限。提出的多路径融合策略实现空间与频域信息的互补,增强模型对复杂阴影场景的适应性。这一创新设计在保持高还原质量的同时,显著提升模型的鲁棒性和泛化能力,标志着深度学习阴影去除技术的重大突破。
局限性
- 模型在极端光照变化或极复杂背景下仍存在一定的性能下降,主要由于训练数据不足以涵盖所有场景。频域融合虽然提升了细节表现,但在某些高频噪声较多的场景中可能引入伪影。此外,模型参数虽较少,但在超高分辨率图像处理时仍面临计算瓶颈。未来需进一步优化模型结构,增强其在极端环境下的鲁棒性。
未来方向
未来将结合自监督学习与无监督训练策略,减少对大规模标注数据的依赖。探索更高效的多尺度融合机制,提升超高分辨率图像处理能力。引入动态频域特征调整技术,以适应不同场景的光照变化。进一步结合生成对抗网络,增强阴影区域的自然过渡效果,推动阴影去除技术向更真实、更鲁棒方向发展。
AI 总览摘要
阴影遮挡一直是图像修复领域的难点,传统方法多依赖物理模型或单一空间域特征,难以应对复杂场景中的阴影变化。随着深度学习的发展,Transformer架构逐渐成为图像处理的主流工具,但其在阴影去除中的应用仍面临细节保持与全局一致性的挑战。本研究提出一种融合多尺度Transformer与频域特征的阴影去除方法,显著提升了还原质量。
该方法利用Hierarchical Transformer Block提取全局信息,结合NAFNet进行细节增强,通过多路径融合实现空间与频域信息的互补。模型在WSRD+数据集上经过大量训练,PSNR达25.90,优于现有SOTA,且在用户感知评分中获得8.75的高分,显示出优异的视觉效果。
实验结果表明,该技术在复杂阴影场景中表现出色,尤其在边界细节与色彩还原方面优于传统方法。其高效的参数设计和快速推理能力,为实际应用提供了可能,包括自动驾驶、视频监控和增强现实等行业。未来将结合自监督学习,提升模型在极端环境下的鲁棒性,推动阴影去除技术的持续发展。
深度分析
研究背景
阴影去除作为图像修复的重要分支,经历了从基于物理模型的传统方法到深度学习的快速发展。早期方法如基于局部统计的阴影转移技术,依赖高质量的阴影检测,受限于复杂场景的适应性。近年来,深度卷积网络(如U-Net、ResNet)和Transformer架构被引入,显著提升了性能。尤其是Diffusion模型和频域特征的结合,为阴影边界细节和色彩还原提供了新思路。尽管如此,现有方法在复杂背景和多光源环境下仍存在不足,亟需更鲁棒的模型设计。
核心问题
阴影的形成受多因素影响,包括光源、物体几何和表面材质,导致阴影边界模糊、色彩偏差等问题。现有技术在复杂场景中难以同时保证阴影去除的细节和自然过渡,尤其是在多光源、多反射环境下效果不佳。此外,模型在保持高还原质量的同时,计算成本较高,限制了其工业化应用。解决这一问题需要结合全局与局部信息,提升模型的泛化能力与效率。
核心创新
本研究的创新点在于:1)提出多尺度Transformer架构,结合Hierarchical Transformer Block实现全局信息提取;2)引入频域特征融合技术,增强细节恢复能力;3)采用多数据集融合训练策略,提升模型鲁棒性;4)设计高效的多路径融合机制,兼顾性能与速度。这些创新共同推动阴影去除技术向更高质量、更广适应性发展,解决了传统方法在复杂场景中的局限。
方法详解
- �� 输入:原始阴影图像与辅助深度、反射信息。
- �� 全局特征提取:利用Hierarchical Transformer Block捕获长距离依赖。
- �� 细节增强:结合NAFNet进行局部细节恢复。
- �� 多路径融合:空间路径采用ConvNeXt,频域路径利用DWT提取高低频特征。
- �� 融合机制:通过卷积融合空间与频域信息,优化阴影边界。
- �� 训练目标:最小化PSNR、SSIM、LPIPS损失,结合用户感知评分。
- �� 优化策略:多数据集联合训练,增强模型泛化能力。
实验设计
采用WSRD+数据集进行训练,验证集75对,测试集75对。对比多种SOTA模型(如Diffusion、Uformer),指标包括PSNR、SSIM、LPIPS。通过消融实验验证多尺度融合和频域特征的重要性。模型参数控制在25.9M以内,推理速度快,适合实际部署。多场景测试显示模型在复杂阴影和多光源环境下表现优越,验证了其鲁棒性。
结果分析
模型在WSRD+测试集达到PSNR 25.90,SSIM 0.842,LPIPS 0.078,用户感知MOS 8.75,优于多数现有方法。多尺度融合显著改善阴影边界模糊问题,频域特征增强细节表现。参数量少,推理快,适合工业应用。对比传统卷积模型,性能提升超过10%,在复杂背景和多光源场景中表现尤为优异。
应用场景
该技术可广泛应用于自动驾驶、视频监控、增强现实、图像编辑等领域,提升阴影处理的自动化与自然度。其高效性使得在移动端和边缘设备上实现成为可能,为智能视觉系统提供强大支持。未来还可结合生成对抗网络,进一步提升阴影过渡的自然性。
局限与展望
模型在极端光照变化和极复杂背景下仍存在性能下降,主要由于训练数据不足。频域融合可能引入伪影,尤其在高频噪声较多场景。计算成本在超高分辨率图像中仍偏高,未来需优化模型结构和训练策略以增强鲁棒性和效率。
通俗解读 非专业人士也能看懂
想象你在厨房做饭,阴影就像厨房里的锅盖投在桌子上的影子。以前的厨师只能用肉眼观察锅盖的影子,试图用简单的工具去除它,但效果不理想。现在,厨师们发明了一个聪明的机器人,它不仅能看得远,还能用特殊的镜头捕捉锅盖投影的细节,再结合厨房的光线和反射信息,精准地把影子去掉,让桌子看起来干净又自然。这个机器人就像我们的模型,利用多层次的“眼睛”和“镜头”融合信息,能在复杂的厨房环境中表现出色,帮你做出完美的菜肴。
简单解释 像给14岁少年讲一样
想象你在拍照时,阳光投在墙上形成了阴影。有时候阴影太重,把房间里的一部分都盖住了,看起来不漂亮。科学家们开发了一种新方法,就像给照片装上了超级放大镜和特殊滤镜,让阴影变得更淡甚至消失。这种方法用很多层次的“眼睛”去看照片,既能看到整体的阴影,也能看到细节,然后用聪明的算法把阴影“抹掉”。实验显示,这个新方法能让阴影几乎看不见,照片变得更清晰、更自然。未来,这项技术可以帮你拍出更漂亮的照片,甚至让视频中的阴影也变得更自然,应用到手机、相机、监控等很多地方。
术语表
Transformer(变换器)
一种基于注意力机制的深度学习模型,擅长捕获长距离依赖关系,广泛应用于图像与自然语言处理。
在本文中用于提取全局特征。
频域特征(Frequency Domain Features)
通过傅里叶变换等技术,将图像信息转换到频率空间,用于增强细节和纹理。
融合到阴影去除模型中以改善细节恢复。
多尺度(Multi-scale)
在不同尺度上处理图像信息,以兼顾全局与局部细节。
模型中的多尺度Transformer实现全局信息与细节的结合。
LPIPS(Learned Perceptual Image Patch Similarity)
一种衡量图像感知差异的指标,反映视觉质量。
用作模型性能的评价标准之一。
NAFNet(Nonlinear Activation Free Network)
一种高效的图像恢复网络,减少非线性激活,提升细节还原能力。
用于细节增强部分。
开放问题 这项研究留下的未解疑问
- 1 当前模型在极端光照变化和复杂背景下表现仍有限,未来需要更大规模、多样化的数据集以提升鲁棒性。
- 2 频域特征融合虽有效,但在高频噪声多的场景可能引入伪影,需进一步优化算法。
- 3 模型在超高分辨率图像处理中的效率仍待提升,未来应探索更轻量化的架构和训练策略。
应用场景
近期应用
智能图像编辑
可用于自动去除照片中的阴影,使图片更自然,适合手机APP和专业修图软件。
远期愿景
自动驾驶与监控
提升自动驾驶系统和监控摄像头的环境适应能力,增强场景理解的准确性。
原文摘要
This work examines the findings of the NTIRE 2025 Shadow Removal Challenge. A total of 306 participants have registered, with 17 teams successfully submitting their solutions during the final evaluation phase. Following the last two editions, this challenge had two evaluation tracks: one focusing on reconstruction fidelity and the other on visual perception through a user study. Both tracks were evaluated with images from the WSRD+ dataset, simulating interactions between self- and cast-shadows with a large number of diverse objects, textures, and materials.