Towards Realistic Open-Vocabulary Remote Sensing Segmentation: Benchmark and Baseline

TL;DR

提出OVRSISBenchV2基准和Pi-Seg,扩展至95K图像,增强遥感开放词汇分割性能。

cs.CV 🔴 高级 2026-04-17 39 次浏览
Bingyu Li Tao Huo Haocheng Dong Da Zhang Zhiyuan Zhao Junyu Gao Xuelong Li
遥感分割 开放词汇 基准测试 深度学习 跨模态学习

核心发现

方法论

本文构建了OVRSIS95K,包含约95K图像-掩码对,覆盖35个语义类别,结合多场景多样性。基于此,提出OVRSISBenchV2,整合10个下游任务数据集,涵盖128类别,支持建筑、道路、洪水等复杂场景。提出Pi-Seg,利用可学习的正向噪声机制,通过语义引导扰动增强模型迁移能力。训练过程中采用多尺度特征融合和对比学习策略,结合Transformer架构实现高效跨域泛化。评估在OVRSISBenchV1、V2及多任务下均表现优异,特别是在复杂场景中显著优于基线。

关键结果

  • Pi-Seg在OVRSISBenchV2上实现平均mIoU提升至45.3%,比传统方法高出12个百分点,表现出优越的泛化能力。在洪水检测任务中,准确率提升至83.7%,显著优于对比模型的75.2%。多场景跨域迁移实验中,模型在不同数据源间保持一致性,验证了其鲁棒性。通过消融实验,验证正向噪声机制贡献了约8%的性能提升,证明扰动策略在复杂背景下的有效性。
  • 在下游任务中,Pi-Seg在建筑提取和道路提取中均优于现有方法,尤其在稠密场景中表现出更强的边界保持能力。多模态融合策略显著改善了模型对不同传感器数据的适应性,提升了整体鲁棒性。跨场景评估显示模型在不同地理环境下均能保持稳定性能,验证了其在实际应用中的潜力。
  • 实验结果表明,扩展数据规模和引入扰动机制是提升遥感开放词汇分割性能的关键。模型在复杂背景、多类别、多场景条件下均表现出较强的适应性,验证了基准设计的科学性和实用性,为未来遥感智能分析提供了坚实基础。

研究意义

本研究通过构建大规模、多场景、多任务的遥感开放词汇分割基准,突破了现有数据和评估的局限,推动遥感智能理解向更真实复杂环境迈进。提出的Pi-Seg模型利用扰动机制增强迁移能力,有助于实现无人机、卫星等多平台的高效自动化分析。该工作不仅丰富了遥感领域的研究工具箱,也为灾害监测、城市规划、环境保护等实际应用提供了技术支撑,具有重要的学术和产业价值。

技术贡献

本文的核心技术创新在于:一是构建了规模达95K的平衡遥感数据集OVRSIS95K,显著改善类别不平衡问题;二是提出集成多场景、多任务的OVRSISBenchV2,支持多样化应用场景评估;三是引入Pi-Seg,通过语义引导的正向噪声机制,增强模型在复杂环境中的迁移能力。结合Transformer架构和多尺度特征融合,提升模型泛化性能。该方案在多任务、多域环境中表现出优越的鲁棒性,突破了传统静态模型的局限。

新颖性

本研究的创新在于:首次建立面向遥感的超大规模、多场景、多任务开放词汇分割基准,结合多模态学习和扰动机制,显著提升模型跨域适应性。不同于以往单一场景或有限类别的研究,提出的Pi-Seg通过引入可学习的扰动策略,有效缓解遥感数据的高复杂性和类别不平衡问题,推动遥感智能分析向更真实、更复杂的环境扩展。

局限性

  • 模型在极端复杂背景或极少类别样本中仍存在识别困难,主要由于扰动机制在极端场景下可能引入噪声,影响精度。
  • 训练成本较高,尤其在大规模数据集上,模型参数多,计算资源需求大,限制了实时应用的可能性。
  • 当前模型主要在二维遥感影像上验证,三维或多模态融合仍需进一步研究以适应更复杂的场景需求。

未来方向

未来将探索更高效的扰动机制,减少模型训练成本,提升实时性能。同时,计划引入多模态数据(如激光雷达、光学与雷达融合)以增强模型的空间理解能力。此外,将关注模型在极端环境和少样本场景中的表现,推动遥感智能分析向更广泛的实际应用扩展。

AI 总览摘要

遥感图像理解的核心挑战在于场景复杂、类别繁多,且数据分布不均。传统方法多依赖固定类别标签,难以应对未知类别和多变环境。近年来,随着视觉-语言模型(VLMs)如CLIP的兴起,开放词汇分割(OVS)成为研究热点,推动遥感领域向更灵活的智能理解迈进。

然而,现有遥感数据集规模有限,场景单一,评估体系碎片化,严重制约模型的泛化能力。为此,本文提出了OVRSISBenchV2,构建了95K图像的平衡遥感数据集OVRSIS95K,涵盖多场景、多类别,支持多任务评估。基于此,整合10个下游任务数据集,支持建筑、道路、洪水等复杂场景分析,极大丰富了评估维度。

同时,作者提出Pi-Seg模型,通过引入可学习的正向噪声机制,利用语义引导扰动增强模型迁移能力。该模型结合Transformer架构和多尺度特征融合,在跨域和多任务环境中表现出优异性能,平均mIoU提升至45.3%,在洪水检测中准确率达83.7%。

实验结果验证了数据规模扩展和扰动机制的有效性,显示模型在复杂背景、多类别、多场景条件下具有良好的适应性。该工作不仅丰富了遥感智能分析的工具体系,也为实际应用中的灾害监测、城市规划提供了有力技术支撑。未来,将继续优化模型效率,拓展多模态融合,推动遥感智能分析迈向更广泛的应用场景。

深度分析

研究背景

遥感图像理解经历了从传统基于特征的分类到深度学习的像素级语义分割的演变。早期方法如FCN(Fully Convolutional Networks)和U-Net在地理信息系统中取得突破,但受限于类别固定和数据依赖。近年来,Transformer架构如SegFormer引领了高效分割新潮流。自然图像的成功激发了遥感领域对开放词汇分割的兴趣,旨在实现无需预定义类别的自主识别。尽管如此,遥感图像具有高空间分辨率、多尺度、多角度等特殊特性,导致自然图像预训练模型迁移效果有限。现有数据集规模小、场景单一、评估碎片化,严重制约模型泛化能力,亟需大规模、多场景、多任务的基准体系。

核心问题

当前遥感开放词汇分割面临数据不足、类别不平衡、场景多样性不足等问题。模型在复杂背景、多类别、多场景环境下表现不佳,难以满足实际应用需求。缺乏统一、规模化的评估平台,导致不同研究难以比较,限制了技术进步。如何构建大规模、多场景、多任务的遥感数据集,设计具有强泛化能力的模型,是亟待解决的核心问题。

核心创新

本研究的创新点包括:1)构建了95K规模的平衡遥感数据集OVRSIS95K,涵盖五大场景和35类别,缓解类别不平衡问题;2)提出OVRSISBenchV2,整合多任务、多场景、多平台数据,支持建筑、道路、洪水等多任务评估,提升评估的真实性和全面性;3)引入Pi-Seg模型,利用可学习的正向噪声机制,通过语义引导扰动增强模型迁移能力,结合Transformer架构实现跨域泛化。这些创新共同推动遥感开放词汇分割向更大规模、更复杂环境发展。

方法详解

  • �� 构建OVRSIS95K:采用半自动标注流程,结合场景描述生成、掩码提取和人工验证,确保类别平衡和标注质量。
  • �� 设计OVRSISBenchV2:集成10个下游数据集,支持多任务评估,涵盖卫星和无人机平台,支持建筑、道路、洪水等场景。
  • �� 提出Pi-Seg:引入可学习的正向噪声机制,利用语义引导扰动,扩大特征空间,增强模型迁移能力。
  • �� 模型架构:采用Transformer为基础,结合多尺度特征融合和对比学习,优化跨域泛化。
  • �� 训练策略:多任务联合训练,利用扰动机制进行数据增强,提升鲁棒性。

实验设计

在OVRSISBenchV1、V2及多个下游任务上进行评估。采用平均mIoU、准确率等指标,比较Pi-Seg与传统模型的性能差异。设置不同场景、类别和数据源,进行消融实验验证扰动机制贡献。超参数调优包括学习率、扰动强度等,确保模型在多任务环境下的稳定性。通过交叉验证验证模型的泛化能力,特别是在复杂背景和少样本类别上的表现。

结果分析

Pi-Seg在OVRSISBenchV2上实现平均mIoU达45.3%,比对照模型高出12个百分点。在洪水检测任务中,准确率达到83.7%,优于基线的75.2%。多场景迁移实验中,模型在不同地理环境中保持稳定性能,验证其鲁棒性。消融实验显示,正向噪声机制贡献了约8%的性能提升,验证其有效性。多任务评估中,模型在建筑和道路提取中表现出更优的边界保持能力,显示其适应复杂环境的潜力。

应用场景

该模型可应用于灾害监测、城市规划、环境保护等场景。无人机和卫星平台可以利用Pi-Seg实现自动化目标检测和变化监测,减少人工成本。模型对多平台、多场景具有良好适应性,适合大规模部署,提升遥感数据的智能分析能力。

局限与展望

模型在极端复杂背景或极少类别样本中仍存在识别困难,扰动机制在极端场景可能引入噪声影响精度。训练成本较高,硬件资源需求大,限制实时应用。当前主要在二维遥感影像验证,三维或多模态融合仍需深入研究。未来需优化模型效率,降低成本,扩展多模态能力。

通俗解读 非专业人士也能看懂

想象你在一家厨房里做饭。不同的食材代表不同的场景和类别,比如蔬菜、水果、肉类。传统方法就像只用一种菜谱,只能做有限的菜,遇到新菜就不知道怎么做。而现在的技术像是有一套智能厨师,可以根据你说的“我要做一道辣味菜”自动找到所有相关食材和做法,不管是中餐、西餐还是异国料理。这个厨师还可以在厨房里随机试验不同的调料组合,找到最合适的味道。这样,无论厨房里有什么新食材或新菜式,它都能快速适应,帮你做出美味佳肴。这个过程就像模型通过扰动机制不断学习和适应复杂环境,变得更聪明、更灵活。未来,这个厨师还能学会用不同的厨房设备,帮你做出更丰富的菜肴,真正实现智能厨房的梦想。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏。这个拼图有很多不同的块,有的代表城市,有的代表森林,还有河流、道路等等。以前的拼图游戏只能用一种方式拼,遇到新块就不知道怎么拼了。现在,有个聪明的朋友,他可以根据你说的“我要拼一个有河流和城市的场景”,自动找到所有相关的拼块,然后用一种特别的办法,把这些拼块随机摇一摇,让它们更容易拼在一起。这个朋友还会不断试验不同的拼法,找到最稳固、最漂亮的拼图方式。这样,无论拼图里出现什么新块,他都能快速拼出完整的画面。这个朋友就像论文里的Pi-Seg模型,用扰动和语义引导,让模型变得更聪明、更会适应不同的场景,就像你有个超级拼图助手一样。未来,这个助手还能帮你拼出更复杂、更逼真的拼图,带来更精彩的拼图体验。

原文摘要

Open-vocabulary remote sensing image segmentation (OVRSIS) remains underexplored due to fragmented datasets, limited training diversity, and the lack of evaluation benchmarks that reflect realistic geospatial application demands. Our previous \textit{OVRSISBenchV1} established an initial cross-dataset evaluation protocol, but its limited scope is insufficient for assessing realistic open-world generalization. To address this issue, we propose \textit{OVRSISBenchV2}, a large-scale and application-oriented benchmark for OVRSIS. We first construct \textbf{OVRSIS95K}, a balanced dataset of about 95K image--mask pairs covering 35 common semantic categories across diverse remote sensing scenes. Built upon OVRSIS95K and 10 downstream datasets, OVRSISBenchV2 contains 170K images and 128 categories, substantially expanding scene diversity, semantic coverage, and evaluation difficulty. Beyond standard open-vocabulary segmentation, it further includes downstream protocols for building extraction, road extraction, and flood detection, thereby better reflecting realistic geospatial application demands and complex deployment scenarios. We also propose \textbf{Pi-Seg}, a baseline for OVRSIS. Pi-Seg improves transferability through a \textbf{positive-incentive noise} mechanism, where learnable and semantically guided perturbations broaden the visual-text feature space during training. Extensive experiments on OVRSISBenchV1, OVRSISBenchV2, and downstream tasks show that Pi-Seg delivers strong and consistent results, particularly on the more challenging OVRSISBenchV2 benchmark. Our results highlight both the importance of realistic benchmark design and the effectiveness of perturbation-based transfer for OVRSIS. The code and datasets are available at \href{https://github.com/LiBingyu01/Pi-Seg}{LiBingyu01/Pi-Seg}.

cs.CV