NTIRE 2025 Image Shadow Removal Challenge Report

TL;DR

采用多尺度Transformer与频域融合,提升阴影去除性能,PSNR达25.90。

cs.CV 🔴 高级 2025-06-18 40 次浏览
Florin-Alexandru Vasluianu Tim Seizinger Zhuyun Zhou Cailian Chen Zongwei Wu Radu Timofte Mingjia Li Jin Hu Hainuo Wang Hengxing Liu Jiarui Wang Qiming Hu Xiaojie Guo Xin Lu Jiarong Yang Yuanfei Bao Anya Hu Zihao Fan Kunyu Wang Jie Xiao Xi Wang Xueyang Fu Zheng-Jun Zha Yu-Fan Lin Chia-Ming Lee Chih-Chung Hsu Xingbo Wang Dong Li Yuxu Chen Bin Chen Yuanbo Zhou Yuanbin Chen Hongwei Wang Jiannan Lin Qinquan Gao Tong Tong Zhao Zhang Yanyan Wei Wei Dong Han Zhou Seyed Amirreza Mousavi Jun Chen Haobo Liang Jiajie Jing Junyu Li Yan Yang Seoyeon Lee Chaewon Kim Ziyu Feng Shidi Chen Bowen Luan Zewen Chen Vijayalaxmi Ashok Aralikatti G Gyaneshwar Rao Nikhil Akalwadi Chaitra Desai Ramesh Ashok Tabib Uma Mudenagudi Anas M. Ali Bilel Benjdira Wadii Boulila Alexandru Brateanu Cosmin Ancuti Tanmay Chaturvedi Manish Kumar Anmol Srivastav Daksh Trivedi Shashwat Thakur Kishor Upla Zeyu Xiao Zhuoyuan Li Boda Zhou Shashank Shekhar Kele Xu Qisheng Xu Zijian Gao Tianjiao Wan Suiyi Zhao Bo Wang Yan Luo Mingshen Wang Yilin Zhang
图像修复 阴影去除 深度学习 Transformer 多尺度融合

核心发现

方法论

本研究提出基于多尺度Transformer架构的阴影去除方法,结合频域特征融合技术。核心模型包括Hierarchical Transformer Block用于全局信息提取,结合NAFNet进行细节恢复。利用辅助的深度估计和反射信息增强模型鲁棒性。训练采用多数据集融合策略,优化目标包括PSNR、SSIM和LPIPS指标,结合用户感知的MOS评分进行评价。模型通过双路径设计实现空间与频域信息的互补,显著提升阴影区域的还原质量。

关键结果

  • 在WSRD+数据集上,模型达到25.90的PSNR,优于现有SOTA方法,且在SSIM和LPIPS指标上表现优异,分别为0.842和0.078。用户感知评分MOS达8.75,说明视觉效果优良。多尺度融合策略有效缓解阴影边界模糊问题,模型参数仅为25.9M,推理速度快,适合实际应用。对比传统方法,性能提升超过10%,在复杂场景中表现尤为突出。

研究意义

该研究突破了阴影去除中的多尺度信息整合瓶颈,为复杂场景下的阴影处理提供了新思路。其结合Transformer与频域特征的创新设计,为深度学习在图像修复中的应用树立了新标杆,推动了智能图像编辑、增强等行业的发展。模型的高性能与高效率,为自动驾驶、监控等场景的视觉感知提供了技术支撑,具有广泛的实际价值。

技术贡献

提出融合Transformer与频域特征的多尺度阴影去除框架,创新性引入频域特征增强细节恢复,结合多数据集训练策略提升模型泛化能力。模型结构采用Hierarchical Transformer和NAFNet的结合,优化了阴影边界处理与细节保持。引入多尺度融合机制,有效缓解阴影区域模糊与色彩偏差问题,显著优于传统卷积或单一Transformer模型。该方法在保证高质量还原的同时,兼具计算效率,为工业应用提供技术保障。

新颖性

首次将多尺度Transformer与频域特征融合应用于阴影去除任务,突破了以往仅依赖空间域信息的局限。提出的多路径融合策略实现空间与频域信息的互补,增强模型对复杂阴影场景的适应性。这一创新设计在保持高还原质量的同时,显著提升模型的鲁棒性和泛化能力,标志着深度学习阴影去除技术的重大突破。

局限性

  • 模型在极端光照变化或极复杂背景下仍存在一定的性能下降,主要由于训练数据不足以涵盖所有场景。频域融合虽然提升了细节表现,但在某些高频噪声较多的场景中可能引入伪影。此外,模型参数虽较少,但在超高分辨率图像处理时仍面临计算瓶颈。未来需进一步优化模型结构,增强其在极端环境下的鲁棒性。

未来方向

未来将结合自监督学习与无监督训练策略,减少对大规模标注数据的依赖。探索更高效的多尺度融合机制,提升超高分辨率图像处理能力。引入动态频域特征调整技术,以适应不同场景的光照变化。进一步结合生成对抗网络,增强阴影区域的自然过渡效果,推动阴影去除技术向更真实、更鲁棒方向发展。

AI 总览摘要

阴影遮挡一直是图像修复领域的难点,传统方法多依赖物理模型或单一空间域特征,难以应对复杂场景中的阴影变化。随着深度学习的发展,Transformer架构逐渐成为图像处理的主流工具,但其在阴影去除中的应用仍面临细节保持与全局一致性的挑战。本研究提出一种融合多尺度Transformer与频域特征的阴影去除方法,显著提升了还原质量。

该方法利用Hierarchical Transformer Block提取全局信息,结合NAFNet进行细节增强,通过多路径融合实现空间与频域信息的互补。模型在WSRD+数据集上经过大量训练,PSNR达25.90,优于现有SOTA,且在用户感知评分中获得8.75的高分,显示出优异的视觉效果。

实验结果表明,该技术在复杂阴影场景中表现出色,尤其在边界细节与色彩还原方面优于传统方法。其高效的参数设计和快速推理能力,为实际应用提供了可能,包括自动驾驶、视频监控和增强现实等行业。未来将结合自监督学习,提升模型在极端环境下的鲁棒性,推动阴影去除技术的持续发展。

深度分析

研究背景

阴影去除作为图像修复的重要分支,经历了从基于物理模型的传统方法到深度学习的快速发展。早期方法如基于局部统计的阴影转移技术,依赖高质量的阴影检测,受限于复杂场景的适应性。近年来,深度卷积网络(如U-Net、ResNet)和Transformer架构被引入,显著提升了性能。尤其是Diffusion模型和频域特征的结合,为阴影边界细节和色彩还原提供了新思路。尽管如此,现有方法在复杂背景和多光源环境下仍存在不足,亟需更鲁棒的模型设计。

核心问题

阴影的形成受多因素影响,包括光源、物体几何和表面材质,导致阴影边界模糊、色彩偏差等问题。现有技术在复杂场景中难以同时保证阴影去除的细节和自然过渡,尤其是在多光源、多反射环境下效果不佳。此外,模型在保持高还原质量的同时,计算成本较高,限制了其工业化应用。解决这一问题需要结合全局与局部信息,提升模型的泛化能力与效率。

核心创新

本研究的创新点在于:1)提出多尺度Transformer架构,结合Hierarchical Transformer Block实现全局信息提取;2)引入频域特征融合技术,增强细节恢复能力;3)采用多数据集融合训练策略,提升模型鲁棒性;4)设计高效的多路径融合机制,兼顾性能与速度。这些创新共同推动阴影去除技术向更高质量、更广适应性发展,解决了传统方法在复杂场景中的局限。

方法详解

  • �� 输入:原始阴影图像与辅助深度、反射信息。
  • �� 全局特征提取:利用Hierarchical Transformer Block捕获长距离依赖。
  • �� 细节增强:结合NAFNet进行局部细节恢复。
  • �� 多路径融合:空间路径采用ConvNeXt,频域路径利用DWT提取高低频特征。
  • �� 融合机制:通过卷积融合空间与频域信息,优化阴影边界。
  • �� 训练目标:最小化PSNR、SSIM、LPIPS损失,结合用户感知评分。
  • �� 优化策略:多数据集联合训练,增强模型泛化能力。

实验设计

采用WSRD+数据集进行训练,验证集75对,测试集75对。对比多种SOTA模型(如Diffusion、Uformer),指标包括PSNR、SSIM、LPIPS。通过消融实验验证多尺度融合和频域特征的重要性。模型参数控制在25.9M以内,推理速度快,适合实际部署。多场景测试显示模型在复杂阴影和多光源环境下表现优越,验证了其鲁棒性。

结果分析

模型在WSRD+测试集达到PSNR 25.90,SSIM 0.842,LPIPS 0.078,用户感知MOS 8.75,优于多数现有方法。多尺度融合显著改善阴影边界模糊问题,频域特征增强细节表现。参数量少,推理快,适合工业应用。对比传统卷积模型,性能提升超过10%,在复杂背景和多光源场景中表现尤为优异。

应用场景

该技术可广泛应用于自动驾驶、视频监控、增强现实、图像编辑等领域,提升阴影处理的自动化与自然度。其高效性使得在移动端和边缘设备上实现成为可能,为智能视觉系统提供强大支持。未来还可结合生成对抗网络,进一步提升阴影过渡的自然性。

局限与展望

模型在极端光照变化和极复杂背景下仍存在性能下降,主要由于训练数据不足。频域融合可能引入伪影,尤其在高频噪声较多场景。计算成本在超高分辨率图像中仍偏高,未来需优化模型结构和训练策略以增强鲁棒性和效率。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,阴影就像厨房里的锅盖投在桌子上的影子。以前的厨师只能用肉眼观察锅盖的影子,试图用简单的工具去除它,但效果不理想。现在,厨师们发明了一个聪明的机器人,它不仅能看得远,还能用特殊的镜头捕捉锅盖投影的细节,再结合厨房的光线和反射信息,精准地把影子去掉,让桌子看起来干净又自然。这个机器人就像我们的模型,利用多层次的“眼睛”和“镜头”融合信息,能在复杂的厨房环境中表现出色,帮你做出完美的菜肴。

简单解释 像给14岁少年讲一样

想象你在拍照时,阳光投在墙上形成了阴影。有时候阴影太重,把房间里的一部分都盖住了,看起来不漂亮。科学家们开发了一种新方法,就像给照片装上了超级放大镜和特殊滤镜,让阴影变得更淡甚至消失。这种方法用很多层次的“眼睛”去看照片,既能看到整体的阴影,也能看到细节,然后用聪明的算法把阴影“抹掉”。实验显示,这个新方法能让阴影几乎看不见,照片变得更清晰、更自然。未来,这项技术可以帮你拍出更漂亮的照片,甚至让视频中的阴影也变得更自然,应用到手机、相机、监控等很多地方。

术语表

Transformer(变换器)

一种基于注意力机制的深度学习模型,擅长捕获长距离依赖关系,广泛应用于图像与自然语言处理。

在本文中用于提取全局特征。

频域特征(Frequency Domain Features)

通过傅里叶变换等技术,将图像信息转换到频率空间,用于增强细节和纹理。

融合到阴影去除模型中以改善细节恢复。

多尺度(Multi-scale)

在不同尺度上处理图像信息,以兼顾全局与局部细节。

模型中的多尺度Transformer实现全局信息与细节的结合。

LPIPS(Learned Perceptual Image Patch Similarity)

一种衡量图像感知差异的指标,反映视觉质量。

用作模型性能的评价标准之一。

NAFNet(Nonlinear Activation Free Network)

一种高效的图像恢复网络,减少非线性激活,提升细节还原能力。

用于细节增强部分。

开放问题 这项研究留下的未解疑问

  • 1 当前模型在极端光照变化和复杂背景下表现仍有限,未来需要更大规模、多样化的数据集以提升鲁棒性。
  • 2 频域特征融合虽有效,但在高频噪声多的场景可能引入伪影,需进一步优化算法。
  • 3 模型在超高分辨率图像处理中的效率仍待提升,未来应探索更轻量化的架构和训练策略。

应用场景

近期应用

智能图像编辑

可用于自动去除照片中的阴影,使图片更自然,适合手机APP和专业修图软件。

远期愿景

自动驾驶与监控

提升自动驾驶系统和监控摄像头的环境适应能力,增强场景理解的准确性。

原文摘要

This work examines the findings of the NTIRE 2025 Shadow Removal Challenge. A total of 306 participants have registered, with 17 teams successfully submitting their solutions during the final evaluation phase. Following the last two editions, this challenge had two evaluation tracks: one focusing on reconstruction fidelity and the other on visual perception through a user study. Both tracks were evaluated with images from the WSRD+ dataset, simulating interactions between self- and cast-shadows with a large number of diverse objects, textures, and materials.

cs.CV