DINO Soars: DINOv3 for Open-Vocabulary Semantic Segmentation of Remote Sensing Imagery

TL;DR

提出CAFe-DINO,利用DINOv3实现无需RS微调的开域语义分割,性能超越现有方法。

cs.CV 🔴 高级 2026-05-05 48 次浏览
Ryan Faulkenberry Saurabh Prasad
遥感 语义分割 开域学习 深度学习 DINOv3

核心发现

方法论

该方法基于DINOv3作为基础骨架,结合成本聚合模块和无训练的特征上采样(AnyUp)实现开域遥感语义分割。通过引入成本聚合网络对DINOv3.txt生成的文本-图像相似性图进行空间和语义细化,再利用AnyUp进行无训练的高分辨率上采样,最终实现无需遥感微调的高性能分割。模型在COCO-Stuff的RS目标子集上微调,充分发挥自然图像预训练的泛化能力,显著优于微调的RS专用模型。

关键结果

  • CAFe-DINO在Potsdam、Vaihingen、OEM和LoveDA数据集上平均mIoU分别达56.5%、54.4%、39.6%、65.3%,超越所有微调遥感模型,尤其在城市场景表现优异,提升幅度达20%以上。
  • 在只用RGB通道的情况下,DINOv3.txt在GEO-bench上的表现明显落后,经过成本聚合后性能提升显著,尤其在城市景观中准确率提升超过30%。
  • 消融实验显示,成本聚合和无训练上采样的结合是性能提升的关键,微调视觉编码器的最后两层能带来额外的性能改善,整体模型无需遥感微调即可实现优异性能。

研究意义

该研究突破了遥感领域对密集标注数据的依赖,展示了基于自然图像预训练模型的零样本遥感语义分割潜力。其无需遥感微调的特性极大降低了模型部署门槛,为遥感应用中的大规模、多类别场景提供了新的解决方案。模型的泛化能力和高效性推动了遥感智能分析的技术进步,有望在环境监测、城市规划、灾害响应等领域实现快速部署与应用。

技术贡献

创新点在于引入成本聚合机制对DINOv3.txt生成的相似性图进行空间和语义细化,结合无训练特征上采样(AnyUp)实现高分辨率输出,突破了传统依赖遥感微调的局限。模型在自然图像预训练基础上,通过少量遥感目标微调,达成超越微调遥感模型的性能,展示了预训练模型在遥感任务中的强大泛化能力。此架构为未来开域遥感分割提供了新思路。

新颖性

首次将DINOv3.txt与成本聚合和无训练特征上采样结合,用于遥感开域语义分割,避免了对遥感微调的依赖,显著提升了模型的泛化能力和实用性。这一方法在自然图像预训练模型基础上实现了遥感任务的突破,填补了该领域缺乏无需微调的高性能模型的空白。

局限性

  • 模型在农村和低分辨率场景中的表现仍有限,主要由于自然图像预训练对细粒度纹理区分能力不足,导致在复杂土地覆盖类型上误差较大。
  • 成本聚合的内存需求随类别数线性增长,限制了大类别开域场景的扩展。
  • 对多光谱信息的利用不足,未来可结合多光谱或高光谱数据提升性能。

未来方向

未来将探索多模态融合(如多光谱、多时相信息)以增强模型对复杂场景的区分能力,优化成本聚合的内存效率,并结合少样本学习策略进一步提升模型在低资源环境下的表现。此外,推动模型在全球多样化遥感场景中的适应性和鲁棒性,拓展其工业应用潜力。

AI 总览摘要

遥感影像的语义分割一直面临标注成本高昂和数据稀缺的挑战。传统方法依赖大量标注数据,难以实现大规模应用。近年来,开域语义分割(OVSS)借助视觉-语言模型(VLM)实现了零样本识别,但在遥感领域仍受限于模型微调和纹理细节的识别能力。

本文提出CAFe-DINO,一种基于DINOv3的OVSS框架,无需遥感微调即可实现高性能遥感场景分割。该方法结合成本聚合机制对DINOv3.txt生成的相似性图进行空间和语义细化,利用无训练的特征上采样(AnyUp)实现高分辨率输出。通过在COCO-Stuff的遥感目标子集微调,模型在多个遥感数据集上均超越微调模型,表现出极强的泛化能力。

实验结果显示,CAFe-DINO在Potsdam、Vaihingen、OEM和LoveDA数据集上的平均mIoU分别达56.5%、54.4%、39.6%、65.3%,在城市和农村场景中均优于现有方法。特别是在城市场景中,性能提升超过20%。模型的核心创新在于成本聚合和无训练上采样的结合,显著改善了细粒度纹理识别能力,减少了对遥感微调的依赖。这一突破为遥感智能分析提供了新思路,极大降低了模型部署门槛。

未来,作者计划结合多光谱、多时相信息,优化模型的内存效率和鲁棒性,推动其在全球多样化遥感场景中的应用。该研究展示了自然图像预训练模型在遥感任务中的巨大潜力,预示着遥感智能化的广阔前景。

深度分析

研究背景

遥感影像技术发展迅速,应用范围涵盖环境监测、城市规划和灾害响应。早期方法依赖手工特征和少量标注数据,逐渐演变为深度学习模型如FCN、U-Net等,但受限于标注成本和数据稀缺。近年来,开域学习和视觉-语言模型(如CLIP、DINO)为遥感提供新思路,尤其在零样本识别方面展现潜力。尽管如此,遥感特有的多光谱、多尺度特性仍未充分利用,模型在复杂场景中的表现仍有限。

核心问题

核心问题在于如何在缺乏大量标注的情况下,实现高精度、多类别的遥感场景语义分割。现有方法多依赖微调遥感数据,成本高且泛化能力有限。开域模型虽具潜力,但在遥感场景中的表现受限,尤其在纹理细节和多光谱信息的识别上存在瓶颈。如何突破模型微调依赖,提升零样本性能,成为亟待解决的难题。

核心创新

主要创新包括:1)引入成本聚合机制,空间和语义细化DINOv3.txt的相似性图,提升细粒度识别能力;2)结合无训练的AnyUp特征上采样,实现高分辨率输出,避免过拟合;3)在自然图像预训练基础上,微调遥感目标子集,显著提升城市场景中的表现。这些创新共同推动了遥感开域语义分割的技术边界。

方法详解

  • �� 以DINOv3作为基础骨架,提取图像特征和文本特征,构建相似性图;
  • �� 通过成本聚合网络对相似性图进行空间和类别细化,增强局部细节;
  • �� 利用无训练的AnyUp进行高分辨率特征上采样,保持模型泛化能力;
  • �� 在COCO-Stuff的遥感目标子集上微调成本聚合模块,优化模型性能;
  • �� 最终通过类别最大概率操作生成像素级分割图。

实验设计

在Potsdam、Vaihingen、OEM和LoveDA四个公开遥感数据集上进行评估,采用mIoU指标。模型在不同场景下进行对比,包括微调和非微调模型,进行消融实验验证成本聚合和AnyUp的贡献。超参数包括:微调在45,000次迭代,图像尺寸为512×512,使用NVIDIA Ada 6000 GPU。对比分析显示,CAFe-DINO在城市场景中表现优异,农村场景中仍有提升空间。

结果分析

模型在四个数据集上的平均mIoU达56.5%,明显优于现有遥感微调模型。城市场景中性能提升超过20%,尤其在高分辨率城市区域表现出色。消融实验验证了成本聚合和无训练上采样的关键作用。模型在只用RGB通道的情况下,仍能实现优异性能,展示了预训练模型的强大泛化能力。

应用场景

该方法适用于大规模遥感场景的快速部署,尤其在环境监测、城市规划和灾害应急中。无需大量标注,便于在不同地区和不同传感器条件下应用。未来可结合多光谱信息,提升农村和低分辨率场景的识别能力,为智能遥感提供强大工具。

局限与展望

模型在农村和低分辨率场景中表现仍有限,主要因自然图像预训练对复杂纹理区分不足。成本聚合的内存需求随类别数线性增长,限制大类别场景应用。未来需结合多光谱和多时相数据,提升模型鲁棒性和效率。

通俗解读 非专业人士也能看懂

想象你在一个工厂里工作,工厂里有很多不同的机器和流程。每个机器都需要被识别和分类,但工厂没有详细的标签或说明书。传统的方法就像用人工逐个标记机器,非常耗时。现在,有一种智能助手可以通过观察工厂的整体布局,快速识别不同的机器类型。它用一种特殊的“观察”方法,学习了很多类似工厂的场景,然后可以在没有专门培训的情况下,准确识别新工厂里的机器。这就像你用手机拍照,助手能告诉你照片里的内容,而不用你手动标记。这个助手还可以通过分析不同机器之间的关系,细化识别结果,确保每个机器都被正确分类。这样一来,即使工厂环境变化,它也能快速适应,帮你节省大量时间和精力。这个比喻说明了CAFe-DINO的工作原理:它用预先学到的“观察技巧”,结合智能分析,快速、准确地识别遥感图像中的各种场景和物体,无需专门为每个新场景重新训练。

简单解释 像给14岁少年讲一样

想象你在学校的图书馆里,有很多不同的书架和书本。每次找书都要花很长时间,因为没有标签或者分类系统。现在,假设有个聪明的机器人,它能一眼看出每个书架上的书是什么类型,比如小说、科学、历史等。这个机器人之前看过很多书,学会了识别不同类型的特征。它还可以通过观察书架的布局,判断哪些书属于同一类。即使没有专门教它每个类别,它也能根据之前学到的知识,快速找到想要的书。这个机器人还可以用一种特殊的方法,把低分辨率的图片变得更清晰,让你能更容易看清楚每本书的内容。这样一来,你就不用花很多时间逐个分类了。CAFe-DINO的工作原理就像这个机器人:它用之前学到的“观察技巧”,结合智能分析,快速、准确地识别遥感图像中的各种场景和物体,不需要专门为每个新场景重新训练。它可以在城市、农村、森林等不同环境中工作,帮助我们更快了解地球上的变化。

术语表

DINOv3 (Self-supervised learning model)

一种基于自监督学习的视觉基础模型,能在没有标签的情况下学习图像特征。In this paper, it serves as backbone for feature extraction.

作为模型的基础骨架,用于提取遥感图像的深层特征。

Cost Aggregation (成本聚合)

一种空间和语义细化技术,用于提升相似性图的细节表现。It refines similarity maps for better segmentation accuracy.

用于增强DINO生成的相似性图的空间和类别细节。

AnyUp (无训练特征上采样)

一种无需训练的高分辨率特征上采样方法,保持模型泛化能力。It upscales low-res features to high-res images.

在模型中用以实现高分辨率输出,避免过拟合。

Open Vocabulary Semantic Segmentation (开域语义分割)

无需预定义类别,利用预训练模型识别任意类别的像素级标签。It enables zero-shot segmentation.

实现对未知类别的识别,减少标注依赖。

COCO-Stuff

包含丰富语义类别的自然图像数据集,用于模型训练和微调。In this work,用于微调成本聚合模块。

作为遥感目标微调的主要数据源。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步利用多光谱和高光谱数据,提升模型在农村和低分辨率场景中的表现仍未充分解决。
  • 2 模型在极端复杂场景(如城市密集区或森林火灾区域)中的鲁棒性和泛化能力仍需验证。
  • 3 大规模类别数下的内存和计算成本优化策略仍待开发,尤其在超大开域场景中。

应用场景

近期应用

城市环境监测

可快速部署在城市规划和交通管理中,利用模型识别不同土地利用类型,减少人工标注成本。

灾害应急响应

在自然灾害发生后,快速识别受影响区域的土地覆盖变化,辅助救援决策。

远期愿景

全球遥感监测系统

结合多模态数据,构建全自动、低成本的全球环境监测平台,实现实时监控与预警。

原文摘要

The remote sensing (RS) domain suffers from a lack of densely labeled datasets, which are costly to obtain. Thus, models that can segment RS imagery well without supervised fine-tuning are valuable, but existing solutions fall behind supervised methods. Recently, DINOv3 surpassed SOTA RS foundation models on the GEO-bench segmentation benchmark without pre-training on RS data. Additionally, DINO.txt has enabled open vocabulary semantic segmentation (OVSS) with the DINOv3 backbone. We leverage these developments to form an OVSS model for RS imagery, free of RS-domain fine-tuning. Our model, CAFe-DINO (Cost Aggregation + Feature Upsampling with DINO) exploits the strong OVSS performance of DINOv3 for RS imagery via cost aggregation and training-free upsampling of text-image similarity scores. The robust latent of the DINOv3 backbone eliminates the need for fine-tuning on RS imagery; we instead fine-tune our model on a RS-targeted subset of COCO-Stuff. CAFe-DINO achieves state-of-the-art performance on key RS segmentation datasets, outperforming OVSS methods fine-tuned on RS data. Our code and data are publicly available at https://github.com/rfaulk/DINO_Soars.

cs.CV