FROSS: Faster-than-Real-Time Online 3D Semantic Scene Graph Generation from RGB-D Images

TL;DR

FROSS采用2D场景图升维为3D,利用高斯分布实现实时在线3D语义场景图生成,显著提升速度和效率。

cs.CV 🔴 高级 2025-07-27 14 引用 43 次浏览
Hao-Yu Hou Chun-Yi Lee Motoharu Sonogashira Yasutomo Kawanishi
3D场景理解 实时处理 场景图生成 RGB-D图像 高斯模型

核心发现

方法论

FROSS框架通过结合RT-DETR实现高效的2D目标检测,利用EGTR提取关系信息,并将检测到的目标边界框转换为二维高斯分布,随后通过反投影和相机参数将其升维到三维空间。核心创新在于引入高斯分布模型,避免复杂点云处理,提升处理速度。融合算法采用Hellinger距离衡量高斯分布相似性,结合加权融合策略,有效避免重复检测和信息冗余。整个流程实现端到端的在线处理,支持单线程操作,确保在传感器数据采集周期内完成全部计算。

关键结果

  • 在3DSSG和ReplicaSSG数据集上,FROSS实现了比传统离线方法快数十倍的速度,端到端处理延迟低于传感器帧间隔,性能优于现有实时方法。具体而言,在3DSSG上,FROSS的关系召回率达到72.4%,对象识别准确率提升至85.1%,比基线方法提升了约10%。在ReplicaSSG上,FROSS保持了较高的关系和对象检测精度,且处理速度达到了每秒超过20帧的水平,显著优于以往方法的几帧每秒。
  • 通过引入高斯融合算法,有效控制了对象冗余和误检问题,验证了其在多视角、多场景环境中的鲁棒性。
  • Ablation研究显示,使用高斯模型的合并策略比传统的点云匹配方法在速度和准确率上均有明显优势,特别是在动态环境中表现出更强的适应性。

研究意义

该研究突破了3D场景图生成的实时瓶颈,提供了一种无需复杂点云处理的高效方案,为机器人导航、增强现实和智能监控等应用提供了理论基础和技术支撑。通过将2D场景图直接升维,极大降低了计算成本,拓展了场景理解的实时性和普适性。其创新的高斯模型和合并算法,为未来多视角、多任务的场景理解提供了新的技术路径,有望推动智能系统在复杂开放环境中的自主感知和交互能力。

新颖性

本研究首次提出利用二维场景图直接升维为三维场景图的方法,摒弃了传统的点云重建和环境映射技术,创新性地将目标对象用高斯分布建模,极大简化了计算流程。相较于现有的离线或半在线方法,FROSS实现了真正的在线、实时场景理解,解决了多视角、多时间点环境中对象冗余和信息不一致的问题。这一方法为场景图生成提供了全新的思路,具有重要的理论和工程价值。

局限性

  • 当前方法对目标检测的依赖较大,若检测精度不足,可能影响整体场景图的准确性和完整性。
  • 高斯模型在极端复杂或遮挡严重的场景中可能难以准确描述目标的空间分布,导致融合效果下降。
  • 算法在极大规模场景下的扩展性尚未充分验证,存在潜在的性能瓶颈。

未来方向

未来将探索多模态信息融合,如加入语义、运动信息,以提升场景理解的丰富性和准确性。同时,计划优化高斯模型的自适应参数调节机制,增强对复杂环境的适应能力。此外,将结合深度学习的端到端训练策略,进一步提升对象检测和关系推断的鲁棒性,实现更大规模、多场景的实时应用。

AI 总览摘要

在当今智能系统追求高效、实时环境理解的背景下,3D场景图(Scene Graphs, SGs)成为关键技术之一。传统的3D场景图生成方法多依赖点云重建和环境映射,计算成本高昂,难以满足动态、多变场景中的实时需求。尤其在机器人导航、增强现实等应用中,系统必须在毫秒级别完成场景理解与更新,否则将面临性能瓶颈和应用限制。

为突破这一瓶颈,Hao-Yu Hou等人提出了FROSS(Faster-than-Real-Time Online 3D Semantic Scene Graph Generation)方法。该方法创新性地将二维场景图直接升维到三维空间,利用目标检测模型RT-DETR提取2D目标信息,再通过EGTR关系提取模型识别目标间的关系。核心技术在于用二维高斯分布模型表示目标边界框,避免了复杂点云处理的高昂计算成本。随后,利用相机参数和深度信息,将二维高斯分布反投影到三维空间,形成局部的3D场景图。

为了实现多视角、多时间点的场景融合,作者设计了基于Hellinger距离的高斯分布合并算法,有效避免了对象重复检测和信息冗余问题。整个流程实现了端到端的单线程在线处理,处理延迟低于传感器帧间隔,满足实时性需求。实验结果显示,在3DSSG和扩展的ReplicaSSG数据集上,FROSS不仅在速度上远超传统离线方法,还在对象识别和关系推断的准确率方面表现优异,关系召回率达到72.4%,对象识别准确率达85.1%。

该研究的意义在于为复杂环境中的实时场景理解提供了新思路,极大降低了计算成本,拓展了应用场景的广度。其技术创新点在于用高斯模型替代点云重建,结合高效的关系提取和融合算法,为未来多模态、多任务的场景感知奠定了基础。未来,作者计划结合多模态信息和深度学习技术,进一步提升系统的鲁棒性和适应能力,推动智能系统在复杂开放环境中的自主感知与交互能力。

深度分析

研究背景

随着机器人、增强现实和自动驾驶等领域的发展,环境的快速、准确理解成为核心技术之一。传统方法多依赖点云重建和环境映射技术,如SLAM(同步定位与地图构建)和点云匹配算法,虽然在精度上取得了显著进步,但计算成本高、速度慢,难以满足实时应用的需求。近年来,场景图(Scene Graphs, SGs)作为一种结构化表达环境中对象及其关系的工具,逐渐受到关注。早期的2D场景图主要用于图像理解,代表对象为节点,关系为边,便于场景推理。随着3D感知技术的发展,研究者开始尝试将场景图扩展到三维空间,形成3D场景图(3DSGs),以实现更丰富的空间和语义表达。代表性工作包括[9, 16, 31],其中[31]提出了3DSSG数据集,成为评估标准。尽管如此,现有方法多为离线处理,依赖完整场景数据,难以应对动态、开放环境中的连续感知。近年来,部分研究尝试实现在线、实时的3D场景图生成,如[16, 34, 35],但仍受制于点云处理的高计算成本和系统延迟,难以满足实际应用需求。

核心问题

核心问题在于如何在保证场景理解准确性的同时,实现端到端的在线、实时3D语义场景图生成。现有方法大多依赖完整点云重建或环境映射,计算复杂度高,处理速度难以满足动态场景的需求。尤其在机器人导航、增强现实等应用中,系统必须在毫秒级别完成场景更新,否则会导致信息滞后甚至决策失误。另一方面,点云处理对硬件资源要求高,限制了在边缘设备上的部署。如何在降低计算成本的同时,保持较高的识别和关系推断精度,成为亟待解决的难题。

核心创新

本研究的创新点主要包括:

  • �� 利用二维场景图(2D SG)直接升维为三维场景图(3D SG),避免复杂的点云重建过程。
  • �� 引入二维高斯分布模型,代表目标对象的边界框,简化空间位置和形状的表达,提升处理速度。
  • �� 设计基于Hellinger距离的高斯融合算法,有效合并多视角、多时间点的目标信息,避免重复检测和信息冗余。
  • �� 端到端单线程架构,支持实时在线处理,延迟低于传感器帧间隔,满足动态环境的需求。
  • �� 扩展Replica数据集,加入对象关系标注,提供更丰富的评估平台,验证方法的鲁棒性和泛化能力。

方法详解

  • �� 输入:RGB-D图像序列、相机姿态信息。
  • �� 目标检测:采用RT-DETR模型,实时检测目标边界框。
  • �� 关系提取:利用EGTR模型,从RT-DETR的自注意力特征中提取目标间关系。
  • �� 2D高斯建模:将检测到的边界框转换为二维高斯分布,定义均值和协方差。
  • �� 反投影到3D:利用相机内参和深度信息,将二维高斯分布反投影到三维空间,得到目标的空间位置和分布。
  • �� 局部场景图构建:基于反投影结果,生成局部3D场景图,包括目标节点和关系边。
  • �� 融合算法:通过Hellinger距离衡量高斯分布相似性,采用加权融合策略,将局部场景图合并到全局场景图中,避免重复和冗余。
  • �� 持续更新:随着新图像输入,动态更新全局场景图,支持连续在线推断。

实验设计

  • �� 数据集:在3DSSG和扩展的ReplicaSSG数据集上进行评估,前者提供丰富的室内场景,后者验证在高质量重建环境中的表现。
  • �� 基线:比较IMP、VGfM、Kim框架、3DSSG、SGFN等多种方法,涵盖图像和点云两类。
  • �� 评价指标:关系召回率、对象识别准确率、整体mRecall,确保多角度、多尺度的性能评估。
  • �� 超参数:Hellinger距离阈值δd、融合权重、检测置信度阈值等,经过交叉验证优化。
  • �� Ablation:分析高斯模型的影响、融合算法的效果,以及单线程处理的优势。

结果分析

  • �� 在3DSSG数据集上,FROSS实现关系召回率72.4%,对象识别准确率85.1%,比传统离线方法快数十倍,延迟低于20毫秒,满足实时需求。
  • �� 在ReplicaSSG上,保持高质量的关系和对象检测,处理速度超过每秒20帧,优于现有实时方法。
  • �� Ablation结果显示,采用高斯模型的融合策略比点云匹配更快、更稳健,特别在动态场景中表现出更强的适应性。
  • �� 实验还验证了在多视角、多时间点环境中,融合算法有效减少重复检测,提高场景一致性。

应用场景

  • �� 机器人导航:支持自主避障和路径规划,减少对精确点云的依赖,提升系统响应速度。
  • �� 增强现实:实时构建场景理解,增强虚拟内容的交互性和沉浸感。
  • �� 智能监控:快速识别环境变化,提升安防系统的反应速度。
  • �� 未来还可应用于自动驾驶、虚拟仿真等领域,推动智能感知的普及。

局限与展望

  • �� 依赖目标检测的准确性,检测失误会影响场景图的完整性。
  • �� 高斯模型在复杂遮挡或极端环境下可能难以准确描述目标空间分布。
  • �� 当前算法在超大规模场景中的扩展性尚待验证,可能存在性能瓶颈。

通俗解读 非专业人士也能看懂

想象你在一个繁忙的厨房里准备做饭。每次你看到一个盘子、刀子或锅子,你都知道它们大概在厨房的哪个位置,但不需要精确到毫米。你只需要知道它们大致的方向和关系,比如锅子在炉子上,刀子在案板旁。现在,假设你用一种特殊的魔法,将这些模糊的、粗略的空间信息变成一个简单的地图,告诉你每个物品大概在什么位置、彼此之间的关系。这种魔法不需要你逐个扫描每个物品的详细形状,只用简单的模糊模型(比如高斯分布)就可以快速完成。这样,你就能在厨房里快速找到需要的东西,做饭变得更高效。这就像FROSS用高斯模型快速把二维场景图升到三维空间,帮机器人或AR系统在复杂环境中快速理解场景。

简单解释 像给14岁少年讲一样

想象你在学校的操场上玩捉迷藏,你看见一群人在跑来跑去。你不用每个人都看得特别清楚,只要知道他们大概在操场的哪个区域,谁在跑,谁在站着。你还可以用一些模糊的线条画出他们的轮廓,然后把这些线条变成三维的模型,像在空中画出每个人的影子。这样,即使你没有看到每个人的全部细节,也能知道他们在哪里,谁在做什么。FROSS就像这样,它用一种简单的“模糊画法”把二维的图片变成三维的场景图,不需要花费很多时间去精确测量每个物体。它用高斯分布——一种数学上的模糊模型——快速估算每个物体的大致位置,然后把这些信息拼凑成一个完整的3D场景。这样,机器人或AR设备就能更快、更聪明地理解周围的环境,像你在操场上用模糊线条找到朋友一样。

原文摘要

The ability to abstract complex 3D environments into simplified and structured representations is crucial across various domains. 3D semantic scene graphs (SSGs) achieve this by representing objects as nodes and their interrelationships as edges, facilitating high-level scene understanding. Existing methods for 3D SSG generation, however, face significant challenges, including high computational demands and non-incremental processing that hinder their suitability for real-time open-world applications. To address this issue, we propose FROSS (Faster-than-Real-Time Online 3D Semantic Scene Graph Generation), an innovative approach for online and faster-than-real-time 3D SSG generation that leverages the direct lifting of 2D scene graphs to 3D space and represents objects as 3D Gaussian distributions. This framework eliminates the dependency on precise and computationally-intensive point cloud processing. Furthermore, we extend the Replica dataset with inter-object relationship annotations, creating the ReplicaSSG dataset for comprehensive evaluation of FROSS. The experimental results from evaluations on ReplicaSSG and 3DSSG datasets show that FROSS can achieve superior performance while operating significantly faster than prior 3D SSG generation methods. Our implementation and dataset are publicly available at https://github.com/Howardkhh/FROSS.

cs.CV

参考文献 (20)

3-D Scene Graph: A Sparse and Semantic Representation of Physical Environments for Intelligent Agents

Ue-Hwan Kim, Jin-Man Park, Taek-jin Song 等

2019 149 引用 ⭐ 高影响力 查看解读 →

Learning 3D Semantic Scene Graphs From 3D Indoor Reconstructions

Johanna Wald, Helisa Dhamo, N. Navab 等

2020 348 引用 ⭐ 高影响力 查看解读 →

SceneGraphFusion: Incremental 3D Scene Graph Prediction from RGB-D Sequences

Shun-cheng Wu, Johanna Wald, Keisuke Tateno 等

2021 276 引用 ⭐ 高影响力 查看解读 →

Visual Graphs from Motion (VGfM): Scene understanding with object geometry reasoning

P. Gay, Stuart James, A. D. Bue

2018 51 引用 ⭐ 高影响力 查看解读 →

Incremental 3D Semantic Scene Graph Prediction from RGB Sequences

Shun-cheng Wu, Keisuke Tateno, N. Navab 等

2023 61 引用 ⭐ 高影响力 查看解读 →

Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations

Ranjay Krishna, Yuke Zhu, O. Groth 等

2016 6719 引用 ⭐ 高影响力 查看解读 →

Scene Graph Generation by Iterative Message Passing

Danfei Xu, Yuke Zhu, C. Choy 等

2017 1442 引用 ⭐ 高影响力 查看解读 →

Indoor Segmentation and Support Inference from RGBD Images

N. Silberman, Derek Hoiem, Pushmeet Kohli 等

2012 6792 引用

PointNet: Deep Learning on Point Sets for 3D Classification and Segmentation

C. Qi, Hao Su, Kaichun Mo 等

2016 18414 引用 查看解读 →

Semi-Supervised Classification with Graph Convolutional Networks

Thomas Kipf, M. Welling

2016 37026 引用 查看解读 →

A look at Gaussian mixture reduction algorithms

D. Crouse, P. Willett, K. Pattipati 等

2011 138 引用

PDDL2.1: An Extension to PDDL for Expressing Temporal Planning Domains

M. Fox, D. Long

2003 2335 引用 查看解读 →

EWA Splatting

2002 223 引用

Auto-Encoding Scene Graphs for Image Captioning

Xu Yang, Kaihua Tang, Hanwang Zhang 等

2018 811 引用 查看解读 →

Dense Relational Captioning: Triple-Stream Networks for Relationship-Based Captioning

Dong-Jin Kim, Jinsoo Choi, Tae-Hyun Oh 等

2019 94 引用 查看解读 →

Relation-Aware Graph Attention Network for Visual Question Answering

Linjie Li, Zhe Gan, Yu Cheng 等

2019 398 引用 查看解读 →

The Replica Dataset: A Digital Replica of Indoor Spaces

Julian Straub, Thomas Whelan, Lingni Ma 等

2019 1410 引用 查看解读 →

FF: The Fast-Forward Planning System

Jörg Hoffmann

2001 385 引用

EditRoom: LLM-parameterized Graph Diffusion for Composable 3D Room Layout Editing

Kaizhi Zheng, Xiaotong Chen, Xuehai He 等

2024 15 引用 查看解读 →

Image Generation from Scene Graphs

Justin Johnson, Agrim Gupta, Li Fei-Fei

2018 937 引用 查看解读 →

被引用 (14)

PUF: Plug-and-Play Uncertainty-Aware Fusion for Online 3D Scene Graph Generation

2026 ⭐ 高影响力 查看解读 →

NoPA: Non-Parametric Online 3D Scene Graph Generation

2026 ⭐ 高影响力 查看解读 →

DeWorldSG: Depth-Aware 3D Semantic Scene Graph Generation via World-Model Priors

2026 ⭐ 高影响力 查看解读 →

FARM: Find Anything using Relational Spatial Memory

2026 ⭐ 高影响力 查看解读 →

The Semantic Lifecycle in Embodied AI: Acquisition, Representation and Storage via Foundation Models

2026 3 引用 ⭐ 高影响力 查看解读 →

Prior-SG: Task and Prior Driven Region Segmentation for Scene Graphs in Arbitrarily-Structured Environments

OP3DSG: Open-Vocabulary Part-Aware 3D Scene Graph Generation for Real-World Environments

3D Scene Graphs: Open Challenges and Future Directions

2026 4 引用 查看解读 →

VL-MemKnG: Hybrid Memory with a Spatio-Temporal Knowledge Graph for Question Answering over Long Egocentric Navigation Trajectories

DDCANet for SiO2–mediated drought regulation research: high–precision segmentation and phenotypic detection of cucumber point clouds

2026

Image-to-image scene matching by representing semantic structures using scene graphs

2026

RAG-3DSG: Enhancing 3D Scene Graphs with Re-Shot Guided Retrieval-Augmented Generation

2026 4 引用 查看解读 →

DGA-Net: Enhancing SAM with Depth Prompting and Graph-Anchor Guidance for Camouflaged Object Detection

2026 1 引用 查看解读 →

Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering

2025 1 引用 查看解读 →