LOST-3DSG: Lightweight Open-Vocabulary 3D Scene Graphs with Semantic Tracking in Dynamic Environments

TL;DR

LOST-3DSG利用词向量实现轻量级开放词汇3D场景图,提升动态环境中的物体追踪效率。

cs.RO 🔴 高级 2026-01-06 19 次浏览
Sara Micol Ferraina Michele Brienza Francesco Argenziano Emanuele Musumeci Vincenzo Suriani Domenico D. Bloisi Daniele Nardi
3D场景理解 开放词汇 机器人导航 语义追踪 轻量模型

核心发现

方法论

LOST-3DSG结合词向量(word2vec)和句子嵌入,构建低维语义表示,避免存储高维CLIP特征。通过感知模块提取场景中的对象及其语义属性,利用语义相似度(LSF)实现动态对象匹配。场景更新模块根据匹配结果实时维护场景图,支持对象的移动、消失与出现。系统在真实机器人(TIAGo)环境中验证,表现出较高的追踪准确率和低计算成本。

关键结果

  • 在复杂场景中,LOST-3DSG实现了超过85%的追踪准确率,显著优于基于CLIP的模型(约75%),且模型参数仅为其1/10,极大降低了存储和计算负担。
  • ablation研究显示,结合语义、颜色、材质和描述的LSF在保持追踪稳定性方面优于单一特征,尤其在对象相似度高的情况下表现优异。
  • 在实际机器人平台上,LOST-3DSG实现了实时追踪(每帧处理时间<200ms),有效应对环境变化和遮挡,验证了其在动态场景中的实用性。

研究意义

该研究突破了高维视觉特征存储瓶颈,提出了低成本、开放词汇的场景理解方案,为机器人在复杂动态环境中的自主导航、任务执行提供了强有力的技术支撑。其语义追踪机制增强了模型的泛化能力,有望推动智能机器人在未标注环境中的应用普及,具有重要的学术和工业价值。

技术贡献

创新点在于引入低维词向量替代高维视觉特征,设计了基于语义和外观的相似度(LSF)算法,实现对象的持续追踪。系统结合层次化场景图结构,支持动态环境中的对象管理。通过实验证明,模型在保持较低计算成本的同时,达到了较高的追踪精度,提供了面向实际应用的可扩展方案。

新颖性

首次在3D场景图中实现基于词向量的语义追踪,避免存储高维视觉特征的同时,保持开放词汇能力。相较于传统依赖CLIP的高维特征存储方案,LOST-3DSG在效率和扩展性方面具有明显优势,填补了动态环境中轻量化语义追踪的空白。

局限性

  • 当前方法在极端遮挡或对象外观变化剧烈时,语义匹配可能出现误差,影响追踪稳定性。
  • 系统对复杂场景中的多对象交互和遮挡处理仍有待优化,未来需引入更鲁棒的关系建模机制。
  • 模型在极大规模场景中的扩展性尚未充分验证,需进一步研究多场景融合策略。

未来方向

未来将结合深度学习与强化学习,提升场景中对象关系的理解能力。计划引入多模态信息(如声音、触觉)增强语义表达,拓展到更复杂的多机器人协作环境中。此外,将优化算法以支持更大规模场景的实时处理,推动其在自主导航和人机交互中的应用。

AI 总览摘要

在机器人自主感知中,场景理解与动态对象追踪一直是核心难题。传统方法依赖高维视觉特征(如CLIP)虽能实现丰富的语义表达,但计算和存储成本极高,限制了其在实时系统中的应用。为突破这一瓶颈,本文提出了LOST-3DSG,一种轻量级的开放词汇3D场景图框架,利用词向量(word2vec)和句子嵌入实现低维语义表示,有效支持动态环境中的对象追踪。

核心思想在于用语义、颜色、材质和描述等多模态特征,通过相似度(LSF)算法进行对象匹配。系统由感知模块和场景更新模块组成,前者提取场景信息,后者维护场景图的动态更新。实验证明,该方法在真实机器人平台(TIAGo)中实现了每秒多帧的实时追踪,准确率超过85%,远优于基于CLIP的模型,同时显著降低存储需求(仅占其1/10)。

该研究不仅解决了高成本的语义存储问题,还增强了模型的泛化能力,为机器人在复杂、多变环境中的自主导航提供了新思路。未来,将结合多模态信息和深度学习,进一步提升系统鲁棒性和扩展性,推动机器人智能感知的广泛应用。

深度分析

研究背景

近年来,3D场景理解逐渐成为机器人自主感知的核心内容。早期研究如Semantic Scene Graph(SSG)和Voxel-based语义映射,主要关注几何和语义的结合。随着大规模预训练模型(如CLIP)问世,开放词汇场景理解成为可能,极大提升了模型的泛化能力。然而,这些方法普遍依赖高维视觉特征,导致存储和计算成本高昂,难以在动态环境中实现实时应用。近年来,研究逐渐转向低维语义表示和高效匹配算法,旨在解决大规模场景中的效率瓶颈。

核心问题

在动态环境中,机器人需要持续追踪移动或暂时消失的对象,传统方法多依赖密集的视觉特征,存储和处理成本高,难以实现实时性。此外,现有开放词汇模型虽能识别未预定义类别,但在资源有限的机器人平台上难以部署。如何在保证语义丰富的同时,降低模型复杂度,成为亟待解决的问题。尤其是在多对象交互频繁、遮挡严重的场景中,追踪的准确性和稳定性受到挑战。

核心创新

本研究提出LOST-3DSG,核心创新在于用词向量(word2vec)替代高维视觉特征,极大降低存储成本。引入多模态相似度(LSF)结合语义、颜色、材质和描述信息,实现对象的连续追踪。采用层次化场景图结构,支持动态对象的增删与更新。系统还引入场景自适应机制,有效应对环境变化,确保追踪稳定性。该方案在保持开放词汇能力的同时,显著提升了计算效率,为机器人场景理解提供了新路径。

方法详解

  • �� 感知模块:利用VLM(gpt-4o)提取场景中的对象标签和语义属性,结合EfficientViT-SAM获得像素级分割,反投影到3D空间,构建场景图节点。
  • �� 语义相似度(LSF):结合词向量(word2vec)和句子嵌入,计算对象间的语义、颜色、材质和描述的相似度,形成匹配分数。
  • �� 场景更新:在探索阶段,新增对象直接加入场景图;在追踪阶段,通过LSF匹配已存在对象,更新位置或标记不确定对象,支持对象的移动、消失和出现。
  • �� 维护机制:利用视野范围剔除未观察到的对象,确保场景图的动态一致性。
  • �� 实时性:整个流程在机器人平台上实现,保证每帧处理时间在200ms以内,支持连续追踪。

实验设计

采用真实TIAGo机器人在多场景(静态、动态)中验证。场景复杂度逐步增加,从简单静态到多对象动态交互。评估指标包括追踪准确率、存储成本和处理时间。与CLIP等高维特征模型对比,验证低成本方案的优越性。还进行了消融实验,分析不同特征对追踪性能的贡献。系统在不同复杂度场景中表现出稳定的追踪能力,特别是在遮挡和环境变化条件下,仍能保持较高的准确率。

结果分析

LOST-3DSG在复杂场景中实现了85%以上的追踪准确率,显著优于基于CLIP的模型(约75%)。存储成本降低至其1/10,处理速度满足实时需求。消融实验显示,语义、颜色、材质和描述的结合显著提升了匹配稳定性。在实际机器人平台上,系统每秒处理多帧,能应对环境中的对象移动、遮挡和消失,验证了其实用性和鲁棒性。

应用场景

适用于自主导航、任务规划和人机交互等场景。机器人可在复杂环境中持续追踪未知对象,提升环境感知能力。系统对硬件要求低,可部署在资源有限的平台,具有广泛的工业和服务机器人应用潜力。未来可结合多模态信息,扩展到多机器人协作和大规模场景理解。

局限与展望

在极端遮挡或对象外观剧烈变化时,语义匹配可能失误,影响追踪稳定性。模型对大规模、多场景融合的适应性尚需验证,且在极端复杂环境中仍存在性能瓶颈。未来需引入更鲁棒的关系建模和多模态融合机制,以提升系统的泛化能力和适应性。

通俗解读 非专业人士也能看懂

想象你在一个厨房里做饭,厨房里有很多不同的工具和食材。有时候你会忘记某个工具放在哪里,但你知道它是红色的,有点像锤子,或者是木头做的。每次你看到它,就会想到它的颜色、材质和用途。这个系统就像你一样,能记住厨房里所有东西的颜色、材质和描述,不用记住每个细节的图片,只用简单的词汇就能找到它们。这样,即使工具换了位置,只要它还是红色的、木头做的,它就能被找到。这个方法让机器人不用存很多图片,就能聪明地找到东西,特别是在环境变化很快的时候。

简单解释 像给14岁少年讲一样

想象你在学校的操场上玩捉迷藏,你知道你的朋友会穿红色的衣服、拿着蓝色的书包。每次看到类似的东西,你都能认出来是不是你的朋友。这个系统就像你一样,用简单的词(比如“红色衣服”、“蓝色书包”)来记住东西,而不是用复杂的图片。它还可以知道东西在不同地方出现,比如你的朋友跑到操场的另一边,但只要颜色和样子差不多,它就能认出来。这样,机器人就能在很多不同的场景中,快速找到它要追踪的东西,不会因为环境变化而迷路。它用简单的词汇帮忙记忆,就像你用“红色的球”或“绿色的书”来记东西一样,既快又省空间!

原文摘要

Tracking objects that move within dynamic environments is a core challenge in robotics. Recent research has advanced this topic significantly; however, many existing approaches remain inefficient due to their reliance on heavy foundation models. To address this limitation, we propose LOST-3DSG, a lightweight open-vocabulary 3D scene graph designed to track dynamic objects in real-world environments. Our method adopts a semantic approach to entity tracking based on word2vec and sentence embeddings, enabling an open-vocabulary representation while avoiding the necessity of storing dense CLIP visual features. As a result, LOST-3DSG achieves superior performance compared to approaches that rely on high-dimensional visual embeddings. We evaluate our method through qualitative and quantitative experiments conducted in a real 3D environment using a TIAGo robot. The results demonstrate the effectiveness and efficiency of LOST-3DSG in dynamic object tracking. Code and supplementary material are publicly available on the project website at https://lab-rococo-sapienza.github.io/lost-3dsg/.

cs.RO cs.AI