RAG-3DSG: Enhancing 3D Scene Graphs with Re-Shot Guided Retrieval-Augmented Generation

TL;DR

RAG-3DSG通过重新拍摄和检索增强生成方法,提升了3D场景图的语义一致性和精度,在多个基准测试中表现优异。

cs.CV 🔴 高级 2026-01-15 28 次浏览
Yue Chang Rufeng Chen Zhaofan Zhang Yi Chen Yifan Tian Sihong Xie
3D场景图 不确定性估计 视觉语言模型 机器人 语义表示

核心发现

方法论

RAG-3DSG通过重新拍摄指导的不确定性估计,量化语义模糊性,并利用低不确定性对象作为语义锚点,通过检索增强生成(RAG)模块优化高不确定性对象的预测,最终生成高精度的3D场景图。

关键结果

  • 在SceneFun3D数据集上,RAG-3DSG的R@10达到90.2%,相比OpenFunGraph提升了2.4%。
  • 在FunGraph3D数据集中,RAG-3DSG的R@3和R@10分别达到75.0%和83.0%,相比SOTA方法分别提升了4.3%和3.9%。
  • 在注入噪声的实验中,RAG-3DSG依然保持了较高的鲁棒性,证明其在真实场景中的适用性。

研究意义

RAG-3DSG显著提升了3D场景图的语义一致性和精度,解决了由于视角受限和遮挡导致的语义噪声问题。这一方法在机器人导航、操作等任务中具有重要意义,尤其是在安全关键场景中。

技术贡献

提出了重新拍摄指导的不确定性估计方法,首次将主动验证引入开放词汇3D场景图生成。同时,检索增强生成模块通过上下文信息优化了高不确定性对象的语义预测。

新颖性

RAG-3DSG是首个结合主动重新拍摄和检索增强生成的3D场景图方法,突破了传统被动聚合的局限,显著提升了语义一致性。

局限性

  • 依赖于高质量的点云重建,若点云质量较差可能影响重新拍摄效果。
  • 计算成本较高,尤其是在处理大规模场景时。
  • 需要进一步验证在更多复杂场景中的泛化能力。

未来方向

未来可探索更高效的重新拍摄策略,优化计算资源利用。同时,可将方法扩展到动态场景和多模态数据的场景图生成中。

AI 总览摘要

RAG-3DSG通过重新拍摄指导的不确定性估计和检索增强生成方法,解决了3D场景图生成中的语义噪声问题。传统方法受限于被动的视角采集,容易因遮挡和视角限制导致语义不一致,而RAG-3DSG通过主动重新拍摄,从最佳视角获取对象语义信息,并量化语义模糊性。

在此基础上,RAG-3DSG利用低不确定性对象作为锚点,通过检索上下文信息优化高不确定性对象的预测,最终生成语义一致性更高的3D场景图。实验结果显示,RAG-3DSG在SceneFun3D和FunGraph3D数据集上的表现均超越现有方法,R@10分别达到90.2%和83.0%。

这一方法在机器人导航、操作等任务中具有重要应用价值,尤其是在安全关键场景中。然而,该方法对点云重建质量和计算资源有较高要求,未来可探索更高效的实现方式并扩展至动态场景。

深度分析

研究背景

3D场景图是一种将场景表示为对象和关系图的结构化方法,在机器人导航、操作等任务中具有重要作用。传统方法多基于封闭词汇,限制了其在复杂场景中的泛化能力。近年来,开放词汇场景图生成方法通过引入视觉语言模型(VLM)显著扩展了可识别的对象和关系类别。

核心问题

现有开放词汇3D场景图方法通常采用逐图像信息提取和跨图像聚合的流水线。然而,受限视角和遮挡会引入语义噪声,导致对象描述不一致。这种不一致性对下游任务,尤其是安全关键场景中的机器人任务,带来了显著挑战。

核心创新

RAG-3DSG提出了两阶段“诊断-修正”框架:

1) 重新拍摄指导的不确定性估计:通过从最佳视角重新拍摄对象,量化语义模糊性。

2) 检索增强生成(RAG):利用低不确定性对象作为语义锚点,优化高不确定性对象的预测。

这一方法突破了传统被动聚合的局限,显著提升了语义一致性。

方法详解

  • �� 使用SAM和CLIP从多视角RGB-D图像中提取对象实例和语义嵌入。
  • �� 通过动态下采样策略融合局部对象到全局对象列表,确保小对象的细节保留。
  • �� 通过重新拍摄指导的不确定性估计,量化对象语义模糊性。
  • �� 利用检索增强生成模块,通过上下文信息优化高不确定性对象的语义预测。
  • �� 使用LLM生成对象间的空间和语义关系,构建最终的3D场景图。

实验设计

在SceneFun3D和FunGraph3D数据集上进行实验,评估对象分类(R@3、R@10)和关系预测(R@5、R@10)性能。基线方法包括Open3DSG、ConceptGraphs和OpenFunGraph。此外,在Replica数据集上进行人工评估,并通过注入相机位姿噪声验证方法的鲁棒性。

结果分析

RAG-3DSG在SceneFun3D数据集上的R@10达到90.2%,在FunGraph3D数据集上的R@3和R@10分别达到75.0%和83.0%。在注入噪声的实验中,方法依然表现出较高的鲁棒性,证明其在真实场景中的适用性。

应用场景

RAG-3DSG可用于机器人导航、操作和场景理解等任务,尤其在需要高语义一致性的安全关键场景中具有重要价值。

局限与展望

方法依赖于高质量的点云重建,计算成本较高,且在动态场景中的泛化能力有待进一步验证。

通俗解读 非专业人士也能看懂

想象你在拍照,但拍摄的角度不好,照片中的物体被遮挡了,结果你误以为桌子上的花瓶是桌子的一部分。RAG-3DSG就像一个聪明的摄影师,它会重新调整角度拍摄,找到最清晰的视角,确保照片中的每个物体都被正确识别。然后,它会将这些清晰的照片与之前的照片进行对比,找出可能有错误的地方,并通过参考其他清晰的照片来修正错误。最终,它会生成一张包含所有物体及其关系的完美场景图。

简单解释 像给14岁少年讲一样

想象你在玩一个3D游戏,游戏里有很多物体,比如桌子、椅子、花瓶。但有时候视角不太好,你可能会误以为桌子上的花瓶是桌子的一部分。RAG-3DSG就像游戏里的一个超级智能助手,它会帮你找到最佳视角重新观察这些物体,确保每个物体都被正确识别。然后,它会用聪明的算法修正错误,最终生成一个超清晰的场景图,让你知道每个物体是什么,它们之间有什么关系。是不是很酷?

术语表

3D Scene Graph (3D场景图)

一种将场景表示为对象和关系图的结构化方法,用于场景理解和机器人任务。

用于表示场景中的对象及其语义关系。

Uncertainty Estimation (不确定性估计)

量化模型预测中不确定性的过程,用于区分可靠和不可靠的预测。

用于评估对象语义描述的一致性。

Retrieval-Augmented Generation (检索增强生成)

通过检索上下文信息优化生成结果的方法。

用于修正高不确定性对象的语义预测。

Vision-Language Model (视觉语言模型)

结合视觉和语言信息的深度学习模型,用于多模态任务。

用于生成对象和关系的语义描述。

Re-shot (重新拍摄)

从最佳视角重新生成对象图像以提高语义一致性的方法。

用于量化对象语义模糊性。

开放问题 这项研究留下的未解疑问

  • 1 如何在动态场景中实现实时的重新拍摄和场景图生成?
  • 2 如何降低方法的计算成本以适应资源受限的设备?

应用场景

近期应用

机器人导航

通过生成高精度的3D场景图,提升机器人在复杂环境中的导航能力。

工业自动化

在工业场景中,帮助机器人准确识别和操作物体,减少误操作。

远期愿景

智能城市

支持城市级别的3D场景理解和管理,实现高效的资源分配和规划。

原文摘要

Open-vocabulary 3D Scene Graph (3DSG) can enhance various downstream tasks in robotics by leveraging structured semantic representations, yet current 3DSG construction methods suffer from semantic inconsistencies caused by noisy cross-image aggregation under occlusions and constrained viewpoints. To mitigate the impact of such inconsistency, we propose RAG-3DSG, which introduces re-shot guided uncertainty estimation. By measuring the semantic consistency between original limited viewpoints and re-shot optimal viewpoints, this method quantifies the underlying semantic ambiguity of each graph object. Based on this quantification, we devise an Object-level Retrieval-Augmented Generation (RAG) that leverages low-uncertainty objects as semantic anchors to retrieve more reliable contextual knowledge, enabling a Vision-Language Model to rectify the predictions of uncertain objects and optimize the final 3DSG. Extensive evaluations across three challenging benchmarks and real-world robot trials demonstrate that RAG-3DSG achieves superior recall and precision, effectively mitigating semantic noise to provide highly reliable scene representations for robotics tasks.

cs.CV cs.AI cs.RO