CitySeg: A 3D Open Vocabulary Semantic Segmentation Foundation Model in City-scale Scenarios

TL;DR

CitySeg通过局部-全局交叉注意力网络和层次分类策略,实现城市级点云的开放词汇语义分割和零样本推理。

cs.CV 🔴 高级 2025-08-13 43 次浏览
Jialei Xu Zizhuang Wei Weikang You Linyun Li Weijian Sun
点云分割 开放词汇 零样本推理 无人机感知 层次分类

核心发现

方法论

CitySeg采用局部-全局交叉注意力网络增强点云感知能力,并通过层次分类策略解决数据集标注不一致问题。模型结合文本模态实现开放词汇分割。

关键结果

  • CitySeg在9个基准数据集上实现了SOTA性能,mIoU最高提升至72.0%,显著优于KPConv和RandLA-Net等方法。
  • 首次在城市级点云场景中实现零样本推理,无需视觉信息即可对未见类别进行语义分割。
  • 通过消融实验验证局部-全局交叉注意力模块对模型性能的提升贡献达15%以上。

研究意义

该研究解决了城市级点云分割中多源数据分布差异和标注不一致的长期难题,为无人机感知系统提供了高鲁棒性和通用性的基础模型。

技术贡献

提出局部-全局交叉注意力网络,结合层次图编码器和两阶段训练策略,显著提升了点云分割的泛化能力和细粒度分类性能。

新颖性

CitySeg是首个将点云与文本模态对齐的城市级分割模型,突破了传统依赖视觉信息的限制,开创了零样本推理的新方向。

局限性

  • 模型对点云密度变化仍较为敏感,在极稀疏场景下性能下降显著。
  • 层次分类策略依赖于标注规则的质量,可能限制在非结构化数据上的应用。
  • 训练时间较长,对硬件资源需求较高。

未来方向

未来可探索更高效的训练方法,优化对稀疏点云的适应性,并扩展到动态场景的实时分割任务。

AI 总览摘要

CitySeg是一种针对城市级点云的开放词汇语义分割基础模型,旨在解决多源数据分布差异和标注不一致问题。通过局部-全局交叉注意力网络,模型能够结合局部细节和全局上下文信息,增强对稀疏点云的感知能力。此外,层次分类策略通过构建基于标注规则的图结构,统一了不同数据集的语义粒度。

实验结果表明,CitySeg在9个基准数据集上均实现了SOTA性能,mIoU最高达到72.0%,显著优于现有方法。同时,CitySeg首次实现了城市级点云的零样本推理,无需视觉信息即可对未见类别进行分割。这一能力使其在无人机感知系统中具有重要应用价值。

尽管如此,CitySeg仍存在对稀疏点云敏感、训练时间较长等局限性。未来研究可进一步优化模型效率,并探索其在动态场景中的应用潜力。

深度分析

研究背景

近年来,点云分割在自动驾驶和无人机感知中扮演着重要角色。然而,现有方法多依赖视觉信息,且在多源数据上泛化能力有限。随着城市级场景的复杂性增加,开发能够处理大规模点云的通用模型成为研究热点。

核心问题

城市级点云分割面临两大挑战:多源数据分布差异导致模型泛化能力不足;标注规则不一致使得语义对齐困难。这些问题限制了现有方法在跨域场景中的应用。

核心创新

CitySeg提出局部-全局交叉注意力网络,结合层次分类策略和两阶段训练方法,首次实现了点云与文本模态的对齐,突破了传统方法的局限。

方法详解

  • �� 数据预处理:统一多源点云密度,填补缺失属性。
  • �� 局部-全局交叉注意力:结合局部细节和全局上下文。
  • �� 层次分类策略:构建基于标注规则的图结构,统一语义粒度。
  • �� 两阶段训练:先学习粗粒度语义,再细化子类别。

实验设计

实验使用9个城市级数据集,包括SensatUrban和STPLS3D。模型与KPConv、RandLA-Net等方法对比,并进行消融实验验证模块贡献。

结果分析

CitySeg在SensatUrban上mIoU提升至72.0%,显著优于KPConv的57.6%。消融实验表明,局部-全局交叉注意力模块提升性能达15%。

应用场景

CitySeg可用于无人机城市感知、智慧城市建设和灾害评估等场景,尤其适合缺乏视觉信息的任务。

局限与展望

模型对稀疏点云敏感,训练时间较长,且对标注规则依赖较高。未来可优化效率并扩展动态场景应用。

通俗解读 非专业人士也能看懂

想象你在拼一个巨大的乐高城市模型。每块乐高代表一个点云数据点,但这些乐高来自不同的盒子,有的颜色不全,有的形状不一。CitySeg就像一个超级拼图助手,它先把这些乐高分类整理(局部-全局交叉注意力),再根据说明书(层次分类策略)把它们拼成一个完整的城市模型。

简单解释 像给14岁少年讲一样

想象你在玩Minecraft,建造一个超大的城市,但你的方块来自不同的材质包,颜色和形状都不一样!CitySeg就像一个超强的AI助手,它能帮你把这些方块分类整理,还能自动识别新材质包里的方块,帮你快速建造一个完美的城市!

术语表

点云 (Point Cloud)

由三维空间中的点组成的数据集合,每个点包含位置和属性信息。

用于表示城市级场景的三维结构。

局部-全局交叉注意力 (Local-Global Cross-Attention)

结合局部细节和全局上下文的注意力机制,用于增强点云感知能力。

用于CitySeg的点云网络中。

层次分类策略 (Hierarchical Classification Strategy)

通过构建基于标注规则的图结构,统一不同数据集的语义粒度。

解决多源数据标注不一致问题。

零样本推理 (Zero-shot Inference)

无需训练数据即可对新类别进行预测的能力。

CitySeg首次在城市级点云场景中实现。

mIoU (Mean Intersection over Union)

衡量语义分割性能的指标,表示预测区域与真实区域的重叠程度。

用于评估CitySeg在基准数据集上的表现。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提高模型对极稀疏点云的适应性?
  • 2 能否在动态场景中实现实时分割?
  • 3 如何降低模型对标注规则的依赖?

应用场景

近期应用

无人机城市感知

用于无人机在复杂城市环境中的导航和目标识别,提升任务效率。

智慧城市建设

支持城市级三维建模和基础设施管理,优化城市规划。

远期愿景

动态场景实时分割

未来可扩展到动态场景,实现实时点云分割和分析。

原文摘要

Semantic segmentation of city-scale point clouds is a critical technology for Unmanned Aerial Vehicle (UAV) perception systems, enabling the classification of 3D points without relying on any visual information to achieve comprehensive 3D understanding. However, existing models are frequently constrained by the limited scale of 3D data and the domain gap between datasets, which lead to reduced generalization capability. To address these challenges, we propose CitySeg, a foundation model for city-scale point cloud semantic segmentation that incorporates text modality to achieve open vocabulary segmentation and zero-shot inference. Specifically, in order to mitigate the issue of non-uniform data distribution across multiple domains, we customize the data preprocessing rules, and propose a local-global cross-attention network to enhance the perception capabilities of point networks in UAV scenarios. To resolve semantic label discrepancies across datasets, we introduce a hierarchical classification strategy. A hierarchical graph established according to the data annotation rules consolidates the data labels, and the graph encoder is used to model the hierarchical relationships between categories. In addition, we propose a two-stage training strategy and employ hinge loss to increase the feature separability of subcategories. Experimental results demonstrate that the proposed CitySeg achieves state-of-the-art (SOTA) performance on nine closed-set benchmarks, significantly outperforming existing approaches. Moreover, for the first time, CitySeg enables zero-shot generalization in city-scale point cloud scenarios without relying on visual information.

cs.CV