GeoSAM2: Unleashing the Power of SAM2 for 3D Part Segmentation

TL;DR

GeoSAM2通过多视图2D遮罩预测实现3D部件分割,在PartObjaverse-Tiny和PartNetE上取得84.06%和74.42%的mIoU。

cs.CV 🔴 高级 2025-08-20 38 次浏览
Ken Deng Yunhan Yang Jingxiang Sun Xihui Liu Yebin Liu Ding Liang Yan-Pei Cao
3D分割 多视图 交互式控制 几何编码 LoRA优化

核心发现

方法论

GeoSAM2将3D分割任务转化为多视图2D遮罩预测,通过渲染法线图和点图结合用户点击或框选提示,利用SAM2骨干网络增强几何结构处理能力,最终实现跨视图一致的3D分割。

关键结果

  • 在PartObjaverse-Tiny数据集上,GeoSAM2实现了84.06%的mIoU,比PartField高约5%。
  • 在PartNetE数据集上,GeoSAM2的mIoU为74.42%,显著优于SAMesh和SAMPart3D。
  • 消融实验表明,几何编码和LoRA优化对性能提升贡献显著,分别提高mIoU约8%和4%。

研究意义

该方法解决了现有3D分割方法中控制粒度粗糙、计算开销高的问题,提供了精细化的交互式控制能力,适用于机器人操作、3D建模等场景。

技术贡献

GeoSAM2通过几何感知编码和残差特征融合实现了从RGB到几何模态的高效迁移,并设计了全视图记忆机制以增强跨视图一致性。

新颖性

GeoSAM2首次将交互式2D提示与3D分割任务结合,提出了基于LoRA优化的几何感知编码器,显著提升了分割精度和控制性。

局限性

  • 对法线图和点图的依赖在处理复杂纹理对象时可能表现不佳。
  • 初始视图的分割质量依赖于记忆初始化策略,可能影响一致性。
  • 计算开销仍高于直接点云分割方法。

未来方向

未来可探索更高效的几何特征编码方法,优化跨视图记忆机制,并扩展至动态场景分割。

AI 总览摘要

GeoSAM2是一种创新的3D分割框架,通过将任务转化为多视图2D遮罩预测,显著提升了分割精度和交互控制能力。

现有方法在3D分割中存在控制粒度粗糙、计算开销高的问题。GeoSAM2通过渲染法线图和点图,结合用户提示(点击或框选),利用增强的SAM2骨干网络实现精细化分割。

实验表明,GeoSAM2在PartObjaverse-Tiny和PartNetE数据集上分别实现了84.06%和74.42%的mIoU,显著优于现有方法。同时,该方法支持用户对目标部件进行像素级控制,适用于机器人操作、3D建模等场景。

深度分析

研究背景

3D分割在机器人操作、3D建模等领域具有重要应用,但现有方法依赖大量标注数据且控制粒度有限。近年来,基于2D视觉模型的多视图方法逐渐兴起,但仍存在跨视图一致性差、控制性弱的问题。

核心问题

如何在无需完整3D标注的情况下实现精细化的3D分割,同时提供交互式控制能力,是当前领域的核心挑战。

核心创新

GeoSAM2提出了基于多视图2D遮罩预测的3D分割框架,通过几何感知编码器和全视图记忆机制解决了跨视图一致性问题,并通过LoRA优化实现了高效的模态迁移。

方法详解

  • �� 渲染法线图和点图以捕获几何信息
  • �� 使用LoRA优化的SAM2骨干网络处理用户提示
  • �� 通过残差特征融合结合法线图和点图特征
  • �� 设计全视图记忆机制以增强跨视图一致性
  • �� 后处理步骤包括小组件移除和k-NN投票平滑

实验设计

实验使用PartObjaverse-Tiny和PartNetE数据集,分别评估在多类别和动态场景中的表现。基线包括SAMesh、PartField等,采用mIoU作为主要指标。

结果分析

GeoSAM2在PartObjaverse-Tiny上实现了84.06%的mIoU,比PartField高约5%。在PartNetE上,GeoSAM2的mIoU为74.42%,显著优于SAMesh和SAMPart3D。

应用场景

适用于机器人操作中的精细部件识别、3D建模中的交互式分割,以及动态场景中的实时分割。

局限与展望

对法线图和点图的依赖可能限制其在复杂纹理对象上的表现;初始视图的分割质量受记忆初始化策略影响;计算开销仍高于直接点云分割方法。

通俗解读 非专业人士也能看懂

想象你在拼装一个复杂的模型,比如乐高积木。GeoSAM2就像一个智能助手,它能帮你通过简单的点击或框选,快速找到模型中的特定部件,并标记出来。它利用多角度拍摄的照片,结合你的提示,精准地识别每个部件的位置和形状。

简单解释 像给14岁少年讲一样

想象你在玩一个拼图游戏,但这个拼图是3D的!GeoSAM2就像一个超级助手,你只要点一下屏幕,它就能帮你找到拼图中的某个部件,并把它标记出来。它能从不同角度看拼图,确保每个部件都被正确标记。是不是很酷?

术语表

法线图 (Normal Map)

一种表示表面几何信息的图像,用于捕捉物体的形状细节。

用于渲染3D模型的几何特征。

点图 (Point Map)

通过深度图生成的3D坐标图,用于表示物体的空间结构。

帮助跨视图一致性处理。

LoRA优化 (Low-Rank Adaptation)

一种参数高效的模型微调方法,通过低秩矩阵实现快速迁移学习。

用于几何感知编码器的优化。

mIoU (Mean Intersection over Union)

一种评估分割精度的指标,表示预测遮罩与真实遮罩的重叠程度。

用于评估分割性能。

全视图记忆机制 (Full-View Memory Mechanism)

一种保留所有视图特征的记忆策略,用于增强跨视图一致性。

解决多视图分割中的信息丢失问题。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步降低对法线图和点图的依赖,以适应复杂纹理对象?
  • 2 能否扩展至动态场景中的实时分割?

应用场景

近期应用

机器人操作

帮助机器人精准识别和操作复杂部件,提高任务效率。

3D建模

支持设计师快速分割和编辑模型中的特定区域。

远期愿景

动态场景分割

扩展至实时动态场景中的分割任务,实现自动化环境理解。

原文摘要

We introduce GeoSAM2, a prompt-controllable framework for 3D part segmentation that casts the task as multi-view 2D mask prediction. Given a textureless object, we render normal and point maps from predefined viewpoints and accept simple 2D prompts - clicks or boxes - to guide part selection. These prompts are processed by a shared SAM2 backbone augmented with LoRA and residual geometry fusion, enabling view-specific reasoning while preserving pretrained priors. The predicted masks are back-projected to the object and aggregated across views. Our method enables fine-grained, part-specific control without requiring text prompts, per-shape optimization, or full 3D labels. In contrast to global clustering or scale-based methods, prompts are explicit, spatially grounded, and interpretable. We achieve state-of-the-art class-agnostic performance on PartObjaverse-Tiny and PartNetE, outperforming both slow optimization-based pipelines and fast but coarse feedforward approaches. Our results highlight a new paradigm: aligning the paradigm of 3D segmentation with SAM2, leveraging interactive 2D inputs to unlock controllability and precision in object-level part understanding.

cs.CV cs.AI