MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes

TL;DR

MV-GEL利用多视角排序和VLM推理实现网格几何实体的自然语言定位,IoU最高达1.7倍。

cs.CV 🔴 高级 2026-06-30 35 次浏览
Kartik Bali Roland Aydin
3D几何理解 多模态学习 CAD实体定位 视角排序 深度学习

核心发现

方法论

该方法结合GELviews视角排序模块和LISA-CAD语义分割骨架,通过多视角渲染、几何可见性评估和多模态融合,实现对CAD网格中细粒度几何实体的自然语言定位。GELviews利用CLIP编码对视角进行排序,优先选择最大化目标实体可观察性的视角。随后,基于LISA的图像空间分割在选定视角进行推理,利用几何感知的光线投射将2D掩码映射到网格实体。整个流程实现了完全CAD无关的端到端定位,显著提升了面级IoU和边级F1指标。

关键结果

  • 在面级IoU指标上,最高提升至1.7倍,平均性能优于基线方法;边级F1得分提升超过4.5倍,特别在细长和视角敏感结构上表现优异。
  • 在54k查询样本上,LISA-CAD结合GELviews的模型在IoU和F1指标上均优于CLIP基础模型和随机视角采样,验证了视角排序的有效性。
  • 消融实验显示,几何可见性排序优于全局语义匹配,且多视角融合比单视角显著提升定位准确率。

研究意义

该研究突破了3D几何实体的自然语言定位难题,填补了CAD模型中细粒度结构理解的空白。通过引入视角排序机制,显著改善了视点依赖性强的结构的识别能力,为机器人、CAD编辑和科学模拟提供了强大工具,推动了多模态3D理解的应用落地。其CAD无关的设计也增强了模型的通用性,适应不同几何数据格式。

技术贡献

提出GELviews视角排序模块,有效结合CLIP编码的语义信息与几何可见性评估,优化多视角采样策略。引入几何感知的光线投射机制,将2D分割掩码映射到网格实体,实现端到端的几何实体定位。该框架完全基于网格数据,避免依赖特定CAD格式,增强了模型的泛化能力。模型在多视角、多实体类别上均表现出优越性能,推动了基于深度学习的3D几何理解新方向。

新颖性

首次提出基于多视角排序的几何实体自然语言定位框架,结合CLIP多模态编码与几何可见性评估,有效应对视角敏感和细长结构的识别难题。区别于传统点云或体素方法,直接在多边形网格上操作,保持几何拓扑一致性,提升了定位精度。该方法在CAD无关性和多实体类别适应性方面具有明显优势,是该领域的创新突破。

局限性

  • 当前模型对极端视角或严重遮挡的几何实体仍存在识别困难,尤其在复杂拓扑或极细结构中表现有限。
  • 多视角排序计算成本较高,实时应用仍需优化算法效率。
  • 对某些极端几何特征的描述依赖于自然语言表达的准确性,存在表达歧义风险。

未来方向

未来将结合强化学习优化视角排序策略,提升效率与鲁棒性。探索多模态融合机制,增强模型对复杂几何描述的理解能力。计划扩展到点云和体素数据,增强模型的通用性和适应性。同时,结合交互式界面,实现实时几何实体定位与编辑,为工业设计和机器人操作提供更智能的解决方案。

AI 总览摘要

在工业设计、机器人操作和科学模拟中,精确识别和定位3D模型中的几何实体一直是核心难题。传统方法依赖于手工标注或全局特征,难以应对复杂拓扑和视角依赖性强的结构。近年来,视觉-语言模型(VLM)如CLIP在图像理解中取得突破,但在3D几何实体定位方面仍面临挑战,主要因3D结构的视角敏感性和细长结构的难以观察。为此,本文提出MV-GEL框架,结合多视角排序(GELviews)和基于LISA的语义分割,解决了在多视角、多实体类别下的几何实体自然语言定位问题。

MV-GEL的核心创新在于视角排序机制,利用CLIP编码的语义信息和几何可见性评估,优先选择最大化目标实体观察性的视角,从而显著提升定位准确率。通过几何感知的光线投射,将2D分割掩码映射到网格实体,实现端到端的几何实体定位。实验结果显示,在54k查询样本中,模型在面级IoU指标上提升至1.7倍,在边级F1指标上提升超过4.5倍,特别在细长和视角敏感结构中表现优异。这一突破极大推动了CAD模型中细粒度结构理解,为机器人、设计和科学模拟提供了强大工具。

该方法的最大优势在于完全CAD无关,基于多边形网格,具有良好的通用性和扩展性。未来,模型将结合强化学习优化视角排序,扩展到点云和体素数据,提升实时应用能力,并探索更复杂的几何描述和交互式定位,为工业界带来更智能的3D理解解决方案。

深度分析

研究背景

3D几何理解的发展经历了从点云、体素到网格的演变。代表性工作如PointNet、PointCNN解决了点云的结构化问题,但在细粒度实体定位方面仍有限。近年来,基于深度学习的CAD模型分析如UV-Net、BRepNet实现了边界表示(B-Rep)的特征识别,推动了工业设计自动化。视觉-语言模型(VLM)如CLIP、ALIGN在图像识别中表现卓越,但在3D几何理解中仍受限于视角依赖和结构复杂性。多视角融合和3D推理方法如MVCNN、PointCLIPV2逐步突破,但在细粒度几何实体的自然语言定位方面仍未成熟。本文在此基础上,结合多视角排序和几何感知,提出了全新的3D实体定位框架,填补了细粒度结构理解的空白。

核心问题

在复杂的CAD模型中,细粒度几何实体(如边、面、倒角)难以用自然语言准确描述和定位。现有方法多依赖全局特征或单一视角,忽略了实体的视角敏感性和遮挡问题。如何在多视角、多实体类别中,结合自然语言描述,准确识别目标几何结构,成为亟待解决的难题。尤其是在细长、视角依赖强的结构中,传统方法表现不佳,限制了其在工业自动化和机器人中的应用潜力。

核心创新

本文提出GELviews视角排序机制,结合CLIP编码的语义信息和几何可见性评估,有效筛选出最大化目标实体观察性的视角。引入几何感知的光线投射,将2D分割掩码映射到网格实体,确保端到端的几何定位。模型完全基于多边形网格,避免依赖特定CAD格式,增强通用性。采用多视角融合和Transformer机制,实现视角间的交互与优化,显著提升定位精度。这些创新突破了视角依赖和结构复杂性带来的限制,为3D几何理解提供新思路。

方法详解

  • �� 采样候选视角:在CAD模型上均匀采样多组视角。
  • �� 评估可见性:从每个视角发射光线,计算目标实体的可见点数。
  • �� 视角排序:利用CLIP编码的图像和文本特征,结合几何可见性得分,使用Transformer进行视角间交互,得到排序分数。
  • �� 选择最优视角:选取前K个视角进行后续推理。
  • �� 语义描述:根据几何属性(如曲率、位置)生成自然语言描述。
  • �� 图像空间分割:在选定视角上用LISA模型进行二值掩码预测。
  • �� 几何映射:利用光线投射将掩码映射到网格实体,实现端到端定位。

实验设计

在54k查询样本上,模型与多种基线(如CLIP、随机采样)比较,采用IoU和F1指标。设置不同视角数,验证排序机制的有效性。通过消融实验,分析GELviews对定位性能的贡献。模型在不同类别实体上均表现优异,尤其在细长和视角敏感结构中提升显著。

结果分析

模型在面级IoU最高达0.529,边级F1超过0.632,优于未排序和随机采样方法。多视角融合和排序机制显著提升了目标实体的识别率,验证了几何可见性排序的有效性。消融实验显示,结合几何信息的排序优于纯语义匹配,模型在复杂几何结构中的表现尤为突出。

应用场景

该技术可应用于工业CAD模型的自动标注、机器人路径规划、虚拟仿真等场景。只需提供网格和自然语言描述,即可实现高精度的几何实体定位,为设计优化和自动化制造提供支持。未来还可结合交互式界面,实现实时几何编辑和识别。

局限与展望

模型对极端遮挡或复杂拓扑结构仍存在识别困难,且多视角排序计算成本较高,限制了实时应用。此外,描述的准确性依赖于自然语言表达的清晰度,存在歧义风险。未来需优化算法效率和表达鲁棒性。

通俗解读 非专业人士也能看懂

想象你在一个工厂里,工人需要找到某个特殊的零件,比如一个带有特殊弯曲的金属片。工厂里有很多不同的零件,工人可以从不同角度观察它们,但有时候某个角度看不清楚,或者被其他零件遮挡。为了找到那个特殊的零件,工人会从多个角度观察,选择能让他看得最清楚的角度,然后用手指指着它。这个研究就像让电脑也能像工人一样,从多个角度观察3D模型,找到描述中的那个零件。它用一种聪明的方法,先判断哪个角度能让目标最清楚,然后用智能算法帮忙找到目标,最后把目标的具体位置告诉你。这样,无论模型多复杂,电脑都能准确找到你说的那个零件,就像工人一样聪明。

简单解释 像给14岁少年讲一样

你知道在学校里找某个特别的东西,比如一只藏在角落的橡皮吗?如果你站在不同的角度,有时候能看到它,有时候看不到。这个研究就像教电脑学会用不同的角度观察3D模型,找到你用语言描述的那个细节。它会先猜哪个角度能让目标最清楚,就像你用手指指着,然后用特别的视觉和语言结合的技术,帮你把目标的位置标出来。这样,不管模型多复杂,电脑都能像你一样聪明,准确找到你说的那个东西。是不是很酷?它让机器变得更懂3D世界,就像你在玩一个超级智能的寻宝游戏!

原文摘要

Identifying and grounding precise geometric entities, such as edges, planar regions, and curved surfaces within 3D objects, is foundational to computer-aided design (CAD), robotic manipulation, and scientific simulation. Although modern Vision Language Models (VLMs) have advanced referring segmentation (RIS) in the image domain, extending such language-driven localization to structured 3D geometry is substantially harder. The 3D object appearance is highly sensitive to viewpoints; a single perspective may render a target entity clearly observable, while another may suffer from severe occlusion or foreshortening. In this work, we attempt to solve these challenges with MV-GEL (Multi-View Geometric Entity Localization), a framework for localizing fine-grained geometric entities on polygon meshes from natural language queries. Our key insight is that reliable CAD entity (i.e., faces, edges or solids) localization depends on selecting views that make the queried entity maximally interpretable. We introduce GELviews, a prompt-conditioned ranking module that prioritizes viewpoints based on language prompted observability of geometric CAD entities. Selected views are processed by a VLM-based reasoning segmentation backbone, and predicted masks are lifted to the corresponding meshes via geometry-aware ray casting. Our framework is completely CAD agnostic and relies only on 3D meshes. Experiments show up to a 1.7X improvement in face-level IoU and over 4.5X gains in edge-level F1 compared to vanilla baselines, substantially outperforming CLIP-based and random view sampling, particularly for thin and view-sensitive structures. The dataset, code and trained checkpoints are available at https://github.com/kbali1297/MV-GEL.

cs.CV