EmbodimentSemantic: A Spatial Scene-Graph Dataset and Benchmark for Vision-Language Models on Embodied Manipulation Trajectories

TL;DR

EmbodimentSemantic引入空间场景图数据集,提升机器人视觉语言模型的空间理解。

cs.RO 🔴 高级 2026-06-07 3 次浏览
Hassan Jaber Refinath S N Luca Cagliero Christopher E. Mower Haitham Bou-Ammar
机器人 视觉语言模型 空间场景图 操控轨迹 数据集

核心发现

方法论

该研究提出了EmbodimentSemantic,一个用于评估机器人操控中关系定位的空间场景图数据集。它通过有向的对象-关系-对象三元组来表示场景,并使用固定的关系集来指定对象之间的空间关系。数据集包括使用低成本SO101机器人手臂收集的真实操控观察数据,以及用于研究空间定位的生成场景图。

关键结果

  • 实验表明,现有模型能够预测合理的关系,但在深度感知和视点依赖的空间结构上存在困难。
  • 在LIBERO基准测试中,超过60K的操控帧和120K的相机特定场景图用于评估。
  • 通过将场景图注入现有VLA策略提示中,测试其对下游控制的改进效果。

研究意义

该研究为视觉语言模型在机器人操控中的空间定位提供了一个统一的评估框架。通过引入EmbodimentSemantic,研究人员可以更好地诊断视觉语言模型在空间感知中的不足,并测试其在VLA操控中的实用性。

技术贡献

该研究的技术贡献在于提供了一个新的空间场景图数据集和基准,用于评估视觉语言模型在机器人操控中的空间理解能力。通过使用真实世界和模拟数据,研究展示了如何生成和评估场景图,并测试其在下游任务中的有效性。

新颖性

EmbodimentSemantic是首个专注于机器人操控轨迹的空间场景图数据集。与以往的多模态基准不同,它直接评估模型生成有序场景图三元组的能力。

局限性

  • 现有模型在深度感知和视点依赖的空间结构上仍然存在困难。
  • 数据集可能受限于特定的机器人和场景设置。

未来方向

未来的研究方向包括扩展数据集以涵盖更多的机器人和场景,以及开发更强大的模型来处理复杂的空间关系。

AI 总览摘要

空间定位是机器人视觉语言模型在操控任务中的关键挑战。现有模型虽然能够识别对象并遵循语言指令,但在对象空间排列的明确表示上存在不足。EmbodimentSemantic通过引入一个新的空间场景图数据集和基准,旨在解决这一问题。

该数据集使用有向的对象-关系-对象三元组来表示场景,并包括使用低成本SO101机器人手臂收集的真实操控观察数据。为了提供控制验证,还引入了一个基于模拟器的LIBERO基准,包含超过60K的操控帧和120K的相机特定场景图。

实验表明,现有模型在预测合理关系方面表现良好,但在深度感知和视点依赖的空间结构上存在困难。EmbodimentSemantic为诊断视觉语言模型在空间感知中的不足提供了一个统一框架,并测试其在VLA操控中的实用性。

深度分析

研究背景

近年来,机器人学习领域取得了重大进展,尤其是在视觉语言模型的开发上。然而,这些模型在场景几何的明确表示上仍然较弱,导致在操控任务中难以可靠地表示空间关系。

核心问题

视觉语言模型在机器人操控中的核心问题是缺乏对对象空间排列的明确表示。这导致模型在处理支持、包含、排序、遮挡和深度敏感关系时存在困难。

核心创新

EmbodimentSemantic通过引入一个新的空间场景图数据集来解决这一问题。该数据集使用有向的对象-关系-对象三元组来表示场景,并提供了一个基于模拟器的LIBERO基准,用于控制验证。

方法详解

  • �� 使用SO101机器人手臂收集真实操控观察数据。
  • �� 生成用于研究空间定位的场景图。
  • �� 引入基于模拟器的LIBERO基准,包含超过60K的操控帧和120K的相机特定场景图。
  • �� 测试场景图在下游控制中的改进效果。

实验设计

实验设计包括使用真实世界和模拟数据来生成和评估场景图。通过将场景图注入现有VLA策略提示中,测试其对下游控制的改进效果。

结果分析

实验表明,现有模型能够预测合理的关系,但在深度感知和视点依赖的空间结构上存在困难。通过将场景图注入现有VLA策略提示中,测试其对下游控制的改进效果。

应用场景

该研究的应用场景包括机器人操控任务中的空间定位和关系预测。通过使用EmbodimentSemantic,研究人员可以更好地诊断视觉语言模型在空间感知中的不足。

局限与展望

现有模型在深度感知和视点依赖的空间结构上仍然存在困难。数据集可能受限于特定的机器人和场景设置。未来的研究方向包括扩展数据集以涵盖更多的机器人和场景。

通俗解读 非专业人士也能看懂

想象你在厨房里,试图按照食谱做一道菜。你需要知道每种食材的位置,比如盐在柜子里,锅在炉子上。EmbodimentSemantic就像是一个帮助机器人理解这些位置关系的指南。它告诉机器人,盐和锅之间有什么关系,比如盐在锅的左边。这样,机器人就能更好地按照指令完成任务。

简单解释 像给14岁少年讲一样

想象一下你在玩一个游戏,机器人需要在房间里找到一个藏起来的物品。EmbodimentSemantic就像是游戏中的地图,帮助机器人知道物品之间的关系,比如哪个物品在另一个物品的上面或旁边。这样,机器人就能更快地找到目标物品!

术语表

视觉语言模型 (Vision-Language Model)

结合视觉和语言信息进行任务的模型。

用于机器人操控中的空间理解。

场景图 (Scene Graph)

表示对象及其关系的结构化图。

用于评估空间关系的准确性。

操控轨迹 (Manipulation Trajectory)

机器人执行任务时的运动路径。

用于收集数据集的基础。

SO101机器人手臂 (SO101 Robot Arm)

一种低成本的机器人手臂,用于收集操控数据。

用于真实世界数据的收集。

LIBERO基准 (LIBERO Benchmark)

用于验证场景图生成的模拟器基准。

提供控制验证的基准测试。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂的场景中扩展EmbodimentSemantic?
  • 2 现有模型如何改进深度感知能力?

应用场景

近期应用

机器人操控

通过使用EmbodimentSemantic,机器人可以更好地理解和执行复杂的操控任务。

远期愿景

智能家居

未来,EmbodimentSemantic可以帮助开发更智能的家居机器人,提升其在复杂环境中的导航和操控能力。

原文摘要

Spatial grounding remains a key limitation of vision-language-action (VLA) systems for robotic manipulation. While current models can recognize objects and follow language instructions, they often lack an explicit representation of how objects are arranged in space, including support, containment, ordering, occlusion, and depth-sensitive relations. We introduce EmbodimentSemantic, a spatial scene-graph dataset and benchmark for evaluating relational grounding in embodied manipulation. EmbodimentSemantic represents scenes as directed object-relation-object triplets, where each triplet specifies a spatial relation between an ordered pair of objects using a fixed set of relations. This representation enables direct evaluation of object binding, relation prediction, and spatial consistency. The dataset includes real-world manipulation observations collected with the low-cost SO101 robot arm, together with generated scene graphs for studying spatial grounding in practical robotic settings. To provide controlled validation, we also introduce a simulator-grounded LIBERO benchmark with over 60K manipulation frames and more than 120K camera-specific scene graphs across paired third-person and wrist views, where ground-truth relations are derived automatically from MuJoCo geometry, world coordinates, camera projections, and visibility constraints. We further test whether scene graphs improve downstream control by injecting them into existing VLA policy prompts. Experiments across open-source and commercial VLMs show that current models often predict plausible relations but struggle with exact depth-aware and viewpoint-dependent spatial structure. EmbodimentSemantic provides a unified framework for diagnosing spatial grounding in VLM perception and testing its utility for VLA manipulation.

cs.RO