DeWorldSG: Depth-Aware 3D Semantic Scene Graph Generation via World-Model Priors

TL;DR

DeWorldSG通过深度引导过滤生成稳健的3D语义场景图,提升了77.4%的三元组召回率。

cs.CV 🔴 高级 2026-07-01 3 次浏览
Seok-Young Kim Abdelrahman Elskhawy Taewook Ha Dooyoung Kim Eunjae Shin Benjamin Busam Woontack Woo
3D场景图 深度学习 语义理解 机器人 增强现实

核心发现

方法论

DeWorldSG框架结合深度引导过滤和世界模型先验,生成稳健的3D语义场景图。通过估计实例级几何3D高斯分布,每个对象被表示为概率3D节点。框架通过跨对象对的时空证据聚合和使用世界模型V-JEPA 2的上下文先验来优化关系。

关键结果

  • 在3DSSG和ReplicaSSG数据集上,DeWorldSG在对象和谓词预测方面实现了最先进的性能,三元组召回率提高了77.4%,谓词召回率提高了23.2%。
  • 实验表明,该方法在机器人操作和增强现实应用中表现出色。
  • 消融研究验证了每个组件的贡献,并展示了即使没有真实摄像机姿态也能生成稳健的图。

研究意义

DeWorldSG通过生成时空一致的场景结构,解决了现有方法在不稳定的3D对象表示和缺失关系上的挑战。该方法在机器人操作和增强现实应用中具有重要意义,提供了高保真度的结构表示。

技术贡献

DeWorldSG通过实例级概率3D高斯分布和时空关系推理,提供了与现有最先进方法的根本性区别。它引入了新的理论保证和工程可能性,支持稳定的对象节点和上下文感知的关系边。

新颖性

DeWorldSG首次结合深度引导概率对象建模与时空关系推理,显著提升了3D场景图的稳定性和关系完整性。与最相关的工作相比,它提供了更可靠的图推理。

局限性

  • DeWorldSG在对象边界附近的深度估计不稳定,可能导致对象几何失真。
  • 由于依赖于RGB-D序列,低分辨率输入可能导致关系缺失。
  • 需要进一步研究如何在动态环境中应用。

未来方向

未来工作可以探索如何在动态环境中应用DeWorldSG,并研究如何进一步提高关系推理的准确性。

AI 总览摘要

DeWorldSG是一种创新框架,通过深度引导过滤生成稳健的3D语义场景图。现有方法在不稳定的3D对象表示和缺失关系上存在挑战,DeWorldSG通过估计实例级几何3D高斯分布解决这些问题。实验表明,该方法在3DSSG和ReplicaSSG数据集上实现了最先进的性能,三元组召回率提高了77.4%,谓词召回率提高了23.2%。这一突破对于机器人操作和增强现实应用具有重要意义,提供了高保真度的结构表示。尽管如此,DeWorldSG在对象边界附近的深度估计不稳定,可能导致对象几何失真。未来工作可以探索如何在动态环境中应用DeWorldSG,并研究如何进一步提高关系推理的准确性。

深度分析

研究背景

随着机器人智能和增强现实系统的发展,理解复杂的3D空间及其对象间的关系变得至关重要。3D语义场景图通过将复杂的3D环境转化为紧凑的图结构,提供了高层次认知任务的基础。然而,现有方法在不稳定的3D几何和视频帧间关系推理不一致上存在挑战。

核心问题

现有的3D场景图生成方法由于依赖于帧级推理,导致关系稀疏和对象表示不稳定。对象边界附近的深度估计不稳定可能导致对象几何失真,从而影响场景图的质量。

核心创新

DeWorldSG通过估计实例级几何3D高斯分布和使用世界模型V-JEPA 2的上下文先验来优化关系,显著提升了3D场景图的稳定性和关系完整性。它结合深度引导过滤和时空证据聚合,提供了更可靠的图推理。

方法详解

  • �� 通过深度引导过滤估计实例级几何3D高斯分布
  • �� 使用世界模型V-JEPA 2的上下文先验优化关系
  • �� 跨对象对的时空证据聚合
  • �� 生成稳健的3D语义场景图

实验设计

在3DSSG和ReplicaSSG数据集上进行实验,评估对象分类和关系预测的性能。使用消融研究验证每个组件的贡献,并展示了即使没有真实摄像机姿态也能生成稳健的图。

结果分析

DeWorldSG在对象和谓词预测方面实现了最先进的性能,三元组召回率提高了77.4%,谓词召回率提高了23.2%。消融研究验证了每个组件的贡献,并展示了即使没有真实摄像机姿态也能生成稳健的图。

应用场景

DeWorldSG适用于机器人操作和增强现实应用,提供了高保真度的结构表示。它在复杂的3D环境中提供了稳定的对象节点和上下文感知的关系边。

局限与展望

DeWorldSG在对象边界附近的深度估计不稳定,可能导致对象几何失真。由于依赖于RGB-D序列,低分辨率输入可能导致关系缺失。需要进一步研究如何在动态环境中应用。

通俗解读 非专业人士也能看懂

想象你在一个大型超市购物。每个货架上的商品就是我们的对象,而货架之间的通道就是对象之间的关系。DeWorldSG就像一个聪明的购物助手,它不仅能识别每个商品,还能理解商品之间的复杂关系,比如哪个商品在另一个商品旁边,哪个商品在货架的顶层。通过这种方式,它帮助我们更好地理解整个超市的布局。

简单解释 像给14岁少年讲一样

嘿,想象一下你在玩一个超级酷的3D游戏。游戏里的每个角色和物品都是一个对象,而它们之间的互动就是关系。DeWorldSG就像一个聪明的游戏助手,它能帮你更好地理解游戏世界里的复杂关系,比如哪个角色和哪个物品有互动,哪个物品在地图的哪个位置。这样你就能更好地掌握游戏策略,赢得比赛!

术语表

3D语义场景图 (3D Semantic Scene Graph)

一种将3D环境抽象为对象节点和关系边的结构化图。

用于表示场景中的对象及其相互关系。

深度引导过滤 (Depth-guided Filtering)

通过深度信息优化对象的几何表示。

用于估计实例级几何3D高斯分布。

世界模型 (World Model)

一种预测模型,用于推断和完成环境的潜在状态。

用于优化关系的上下文先验。

V-JEPA 2

一种视频世界模型,用于捕捉结构规律和物理一致性。

用于优化关系的上下文先验。

消融研究 (Ablation Study)

一种评估每个组件贡献的实验方法。

用于验证DeWorldSG的性能。

开放问题 这项研究留下的未解疑问

  • 1 如何在动态环境中应用DeWorldSG仍需进一步研究。
  • 2 低分辨率输入可能导致关系缺失,需探索解决方案。
  • 3 对象边界附近的深度估计不稳定,需优化算法。

应用场景

近期应用

机器人操作

DeWorldSG可用于提高机器人在复杂环境中的操作能力,提供稳定的对象节点和上下文感知的关系边。

远期愿景

增强现实

通过生成稳健的3D语义场景图,DeWorldSG可用于增强现实应用,提供高保真度的结构表示。

原文摘要

We present DeWorldSG, a novel framework that generates spatio-temporally robust 3D Semantic Scene Graphs from RGB-D sequences. Existing methods often struggle to construct reliable 3D scene graphs due to unstable 3D object representations and missing relations caused by frame-wise inference. DeWorldSG addresses these issues by estimating instance-level geometric 3D Gaussian distributions through depth-guided filtering and representing each object as a probabilistic 3D node rather than a single projected point. To mitigate relational sparsity from frame-wise inference, our framework further aggregates spatiotemporal evidence across object pairs and refines relations using contextual priors derived from a world model (V-JEPA 2). Experiments on the 3DSSG and ReplicaSSG datasets demonstrate state-of-the-art (SoTA) performance in both object and predicate prediction, while producing temporally consistent scene structures. In particular, our method improves triplet recall by 77.4% and predicate recall by 23.2% over prior SoTA approaches, making it suitable for robotic manipulation and AR applications. Our code and models are open-sourced.

cs.CV cs.AI