核心发现
方法论
本文提出结合CLIP跨模态能力的H2C文本引导损失,将去雾任务转化为潜在空间的语义对齐问题。通过BiLaLoRA策略,自动搜索关键网络层的注入位置,利用低秩适应实现参数高效微调。具体流程包括:利用CLIP提取雾图与清晰图的语义特征,定义H2C损失优化潜在空间的语义方向;采用双层优化框架,动态搜索最优注入层位置,并微调LoRA参数以适应不同场景。实验在RTTS、URHI和Fattal等多个真实场景数据集上验证优越性能。
关键结果
- 在RTTS、URHI和Fattal数据集上,BiLaLoRA在FADE、BIQME、Entropy和MUSIQ指标上均优于SOTA方法,平均提升达4.5%。
- 引入H2C损失后,模型在不同场景中表现出更强的跨域适应能力,夜间和复杂雾霾场景下效果显著优于传统方法。
- 参数微调仅需少量训练时间(约0.94小时),参数量与全微调相当,极大提升了实际应用的效率和灵活性。
研究意义
该研究突破了实景去雾中的无监督目标设计难题,利用跨模态语义对齐实现无需标注的泛化能力,解决了传统模型在复杂真实场景中的性能瓶颈。其参数高效微调策略为模型快速适应多场景提供了新思路,推动了深度学习在低成本、实时应用中的落地。未来,该方法有望扩展到其他低层次视觉任务,促进跨模态信息融合技术的发展。
技术贡献
提出基于CLIP的H2C文本引导损失,重塑去雾为潜在空间的语义对齐问题,增强无监督能力。引入BiLaLoRA策略,通过双层优化自动搜索关键层位置,实现参数微调的高效性。结合低秩适应和架构搜索,显著降低微调成本,同时保持模型性能,支持多场景快速切换。该方案在多个真实场景中验证了其优越性,超越现有SOTA技术。
新颖性
首次将CLIP跨模态能力引入实景去雾任务,提出H2C损失实现无监督的语义引导,突破传统依赖配对数据的限制。创新性地结合双层优化的BiLaLoRA策略,自动搜索关键层位置,提升参数微调效率。相较于以往只关注特征空间对齐或全模型微调的方法,该方案实现了性能与效率的双重突破,具有重要的理论和工程价值。
局限性
- 当前方法依赖预训练的CLIP模型,受限于其在特定场景中的语义表达能力,可能在极端或特殊场景下表现不足。
- 双层优化过程虽高效,但在极大模型或多目标任务中可能存在计算瓶颈,未来需进一步优化算法复杂度。
- 模型在极端天气或极端光照条件下的鲁棒性仍需验证,未来可结合多模态信息增强性能。
未来方向
未来将探索多模态信息融合,提升极端场景下的鲁棒性;同时结合自监督学习,减少对预训练模型的依赖;还计划将BiLaLoRA扩展到其他低层次视觉任务,如超分辨率和图像修复,推动参数高效迁移学习的发展。
AI 总览摘要
图像去雾作为低层次视觉的重要任务,旨在恢复因大气散射引起的图像模糊与色彩失真。传统方法多依赖手工先验或物理模型,但在复杂真实场景中表现有限。近年来,深度学习模型虽取得突破,但在泛化能力和适应多样场景方面仍存在瓶颈。本文提出一种结合CLIP跨模态能力的H2C文本引导损失,将去雾任务转化为潜在空间的语义对齐问题,有效实现无监督优化。通过BiLaLoRA策略,自动搜索关键网络层位置,利用低秩适应实现参数微调的高效性。实验结果显示,该方法在RTTS、URHI和Fattal数据集上均优于现有SOTA技术,显著提升了夜间和复杂雾霾场景的去雾效果。其参数微调仅需少量时间,模型具有良好的泛化能力和实用性,为低成本、实时的实景去雾提供了新思路。未来,结合多模态信息和自监督学习,有望推动该技术在自动驾驶、监控和增强现实等领域的广泛应用。
深度分析
研究背景
图像去雾技术经历了从传统基于先验的算法到深度学习模型的演变。早期方法如Dark Channel Prior(DCP)通过统计先验实现去雾,但在复杂场景中效果有限。深度学习方法如DehazeNet、AOD-Net等,利用卷积神经网络(CNN)学习端到端映射,显著提升性能。然而,这些模型在合成数据训练后,面对真实场景时表现不佳,存在域差问题。近年来,领域适应和无监督学习成为研究热点,尝试通过生成对抗网络(GAN)或特征空间对齐缓解域差,取得一定进展。尽管如此,模型在多样化场景中的泛化能力仍需提升,尤其在夜间或极端天气条件下。
核心问题
当前深度去雾模型多依赖大量标注数据,且全模型微调成本高,难以快速适应不同场景。尤其在真实场景中,缺乏配对清晰图像,导致监督学习难以实现。模型在复杂环境中的性能受限,表现出明显的域差,影响实际应用效果。如何在保证性能的同时,实现参数高效微调,成为亟待解决的问题。此外,现有方法缺乏利用跨模态信息的能力,限制了模型的泛化潜力。
核心创新
本研究提出结合CLIP跨模态能力的H2C损失,将去雾任务转化为潜在空间的语义对齐问题,突破了传统依赖配对数据的限制。引入BiLaLoRA策略,通过双层优化自动搜索关键层位置,显著提升参数微调的效率和效果。该方案结合低秩适应和架构搜索,实现模型在不同场景中的快速迁移,兼顾性能和效率。创新点在于将视觉-语言模型引入低层次视觉任务,开辟了无监督、多模态融合的新途径。
方法详解
- �� 利用预训练CLIP模型提取雾图与清晰图的语义特征,定义潜在空间的语义差异。
- �� 设计H2C损失,通过最大化潜在空间中语义变化的方向与文本引导的目标方向一致性,实现无监督优化。
- �� 采用双层优化框架,第一层搜索最优注入层位置,第二层微调LoRA参数。
- �� 通过参数α调控不同网络层的注入比例,结合梯度下降实现自动化搜索。
- �� 在RTTS、URHI、Fattal等多个真实场景数据集上进行训练和验证,确保模型的泛化能力。
实验设计
在RTTS、URHI、Fattal等真实场景数据集上,采用FADE、BIQME、Entropy、MUSIQ等指标进行评估。设置不同场景(昼夜、复杂雾霾)进行测试,比较全微调、传统微调和BiLaLoRA的性能差异。通过消融实验验证H2C损失的引导效果,分析不同层位置搜索的影响。参数设置包括:LoRA秩r=8,学习率1e-6,训练时间约0.94小时。模型在多场景、多域条件下表现出优异的适应性和稳定性。
结果分析
实验显示,BiLaLoRA在FADE指标上提升4.5%,在多个场景中优于传统微调方法。夜间和复杂雾霾场景中表现尤为突出,显著减少色彩失真和细节丢失。参数微调时间大幅缩短,模型参数量与全微调相当,但训练效率提升77%。消融分析验证了H2C损失和自动搜索机制的有效性,模型在不同域和场景中均保持优异性能,展现出强大的泛化能力。
应用场景
该方法适用于自动驾驶、监控、无人机视觉等需要实时去雾的场景。只需少量场景特定数据,即可快速适应不同环境,降低部署成本。未来,还可结合多模态信息和自监督技术,拓展到超分辨率、图像修复等低层次视觉任务,推动智能视觉系统的普及。
局限与展望
目前模型依赖预训练的CLIP,可能在极端或特殊场景下表现不足。双层优化虽高效,但在超大模型或多目标任务中仍存在计算瓶颈。模型在极端天气和光照条件下的鲁棒性需进一步验证,未来需结合多模态信息和增强学习以提升性能。
通俗解读 非专业人士也能看懂
想象你在厨房里做饭,厨房里有很多不同的厨具和食材。传统的去雾方法就像用一种固定的调料,试图解决所有菜的问题,但有时候味道不够好或者不适合某个菜。现在,这个新方法就像请了一位懂多种菜系的厨师(CLIP),他可以根据你想做的菜(清晰或有雾的图片)提供建议。通过观察你用的食材和调料(潜在空间的语义特征),厨师帮你调整调料的比例(H2C损失)和厨具的位置(自动搜索关键层),让菜变得更美味、更符合你的口味。这种方法不仅节省时间,还能做出更符合实际需求的菜肴(去雾效果),而且可以快速适应不同的菜系(场景变化),让厨房变得更智能、更高效。
简单解释 像给14岁少年讲一样
想象你在学校的科学实验室里做实验,老师让你用一种新方法去除照片中的雾气。以前,你需要用很多试剂和时间,试了很多次才能得到满意的结果。而现在,你有一个聪明的助手(CLIP),他能理解你想要的清晰图片,就像知道你想做的菜一样。你只需要告诉他“我想要一张没有雾的照片”,他会帮你调整实验步骤(H2C损失),让你不用试很多次就能得到好效果。更厉害的是,这个助手还能帮你找到最重要的实验步骤(自动搜索关键层),只调整那些关键的部分,节省时间和材料。这样,你就可以更快、更好地完成实验,得到漂亮的照片,也可以用在其他需要清晰图片的场景,比如无人驾驶或监控,变得更智能、更高效。
术语表
CLIP (Contrastive Language-Image Pretraining)
一种结合视觉和语言理解的深度模型,能提取图像和文本的语义特征,用于跨模态任务。
在本文中用于提取雾图和清晰图的语义特征,实现潜在空间的语义对齐。
H2C (Haze-to-Clear) Loss
一种利用CLIP跨模态能力设计的无监督损失,将去雾任务转化为潜在空间的语义方向对齐。
作为核心创新,用于引导模型在无标注数据上实现语义一致性。
BiLaLoRA (Bilevel Layer-Positioning LoRA)
一种结合双层优化的参数高效微调策略,自动搜索关键网络层位置,优化低秩适应参数。
提升模型在不同场景中的适应性和微调效率。
LoRA (Low-Rank Adaptation)
一种通过低秩矩阵注入实现参数微调的技术,减少训练参数量。
用于模型参数高效微调,结合BiLaLoRA实现自动层选择。
潜在空间 (Latent Space)
深度模型中抽象的特征表达空间,用于捕获图像的语义信息。
H2C损失在此空间实现语义对齐。
开放问题 这项研究留下的未解疑问
- 1 如何进一步提升H2C损失在极端场景下的鲁棒性,仍需结合多模态信息或增强学习技术。
- 2 双层优化在超大模型或多任务场景中的计算复杂度仍是挑战,未来需优化算法效率。
原文摘要
Learning-based real image dehazing methods have achieved notable progress, yet they still face adaptation challenges in diverse real haze scenes. These challenges mainly stem from the lack of effective unsupervised mechanisms for unlabeled data and the heavy cost of full model fine-tuning. To address these challenges, we propose the haze-to-clear text-directed loss that leverages CLIP's cross-modal capabilities to reformulate real image dehazing as a semantic alignment problem in latent space, thereby providing explicit unsupervised cross-modal guidance in the absence of reference images. Furthermore, we introduce the Bilevel Layer-positioning LoRA (BiLaLoRA) strategy, which learns both the LoRA parameters and automatically search the injection layers, enabling targeted adaptation of critical network layers. Extensive experiments demonstrate our superiority against state-of-the-art methods on multiple real-world dehazing benchmarks. The code is publicly available at https://github.com/YanZhang-zy/BiLaLoRA.