RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?

TL;DR

RoboSPA通过527K轨迹评估VLA模型在复杂场景和长时间任务中的表现。

cs.RO 🔴 高级 2026-09-05 72 次浏览
Zhenxuan Fan Bo Zhang Yutong Lin Yuqian Yuan Juekai Lin Liang Liang Zhuoyi Huang Wenqiao Zhang Juncheng Li Siliang Tang Jun Xiao Yueting Zhuang
机器人 视觉语言 动作生成 数据集 空间推理

核心发现

方法论

RoboSPA通过SAPIEN模拟器和RoboTwin 2.0框架构建,评估VLA模型在细粒度空间推理和长时间程序规划中的表现。数据集包含10个任务类别和56个基础任务,每个任务有5个难度等级,共280个变体。使用专家代码在模拟中收集轨迹。

关键结果

  • 结果1:在最困难的任务上,所有模型的平均成功率低于25%,某些任务甚至为0%。
  • 结果2:X-VLA在细粒度空间推理中表现最佳,但成功率从L1的41.9%下降到L5的23.9%。
  • 结果3:长时间程序规划中,π0.5表现最佳,但从L1的71.2%下降到L5的23.1%。

研究意义

RoboSPA为VLA模型提供了一个挑战性基准,推动更强大、可靠和通用的具身智能体的发展。它填补了现有数据集在评估复杂空间关系和长时间任务执行方面的空白。

技术贡献

RoboSPA通过引入细粒度空间推理和长时间程序规划的评估维度,提供了新的诊断指标,如目标归一化准确率和进度评分,超越了现有基准的二元成功率。

新颖性

RoboSPA是第一个将细粒度空间推理作为核心评估维度的VLA数据集,提供了多层次的任务难度和详细的步骤级评估。

局限性

  • 局限1:当前VLA模型在复杂空间关系和记忆密集型任务中表现不佳。
  • 局限2:数据集的场景多样性可能不足以涵盖所有真实世界的复杂性。

未来方向

未来工作可以探索增强VLA模型的空间推理能力和记忆机制,开发更具鲁棒性的模型以应对复杂的真实场景。

AI 总览摘要

RoboSPA是一个大规模的机器人操作数据集和基准,专为评估视觉-语言-动作(VLA)模型在复杂场景和长时间任务中的表现而设计。现有数据集主要在预定义设置下评估任务完成,缺乏对模型在增加的空间和程序复杂性下的推理能力的深入洞察。

RoboSPA涵盖10个任务类别和56个基础任务,每个任务在五个难度等级中实例化,产生280个变体,增加了空间模糊性和程序复杂性。我们收集了527K轨迹,跨多个具身和多样场景。除了二元成功率,RoboSPA引入了诊断指标以进行更详细的评估。

实验表明,当前系统在复杂空间关系、精确的低级执行和记忆密集型规划方面仍然存在困难。这些结果确立了RoboSPA作为开发更强大、可靠和通用的具身智能体的挑战性诊断基准。

深度分析

研究背景

视觉-语言-动作(VLA)模型结合视觉感知、语言理解和动作生成,已成为通用具身智能体的有前途的范式。然而,现有数据集和基准主要在结构化、短期任务中评估这些模型的表现,缺乏对复杂空间关系和长时间任务执行的深入评估。

核心问题

现有VLA模型在真实世界场景中的部署需要超越简单场景和短期指令的能力。日常操作任务提出了三个关键挑战:细粒度目标消歧、时间延长的任务执行和复杂性可扩展的具身推理。

核心创新

RoboSPA通过引入细粒度空间推理和长时间程序规划的评估维度,填补了现有数据集在评估复杂空间关系和长时间任务执行方面的空白。它提供了多层次的任务难度和详细的步骤级评估。

方法详解

  • �� 使用SAPIEN模拟器和RoboTwin 2.0框架构建数据集
  • �� 设计10个任务类别和56个基础任务
  • �� 每个任务在五个难度等级中实例化,产生280个变体
  • �� 收集527K轨迹,跨多个具身和多样场景
  • �� 引入目标归一化准确率和进度评分作为诊断指标

实验设计

实验在Aloha-AgileX具身上进行,使用干净场景数据进行训练和评估。每个基础任务训练一个独立模型,使用来自所有五个难度等级的数据,并在每个等级独立评估。

结果分析

实验表明,当前VLA模型在复杂空间关系、精确的低级执行和记忆密集型规划方面仍然存在困难。在最困难的任务上,所有模型的平均成功率低于25%。

应用场景

RoboSPA为VLA模型提供了一个挑战性基准,推动更强大、可靠和通用的具身智能体的发展。它可以用于评估和改进VLA模型在复杂场景和长时间任务中的表现。

局限与展望

当前VLA模型在复杂空间关系和记忆密集型任务中表现不佳。数据集的场景多样性可能不足以涵盖所有真实世界的复杂性。未来工作可以探索增强VLA模型的空间推理能力和记忆机制。

通俗解读 非专业人士也能看懂

想象一个机器人在厨房里工作。它需要根据视觉和语言指令来完成任务,比如找到特定的调料瓶并放到正确的位置。RoboSPA就像一个大型厨房模拟器,测试机器人在复杂环境中的表现。它不仅要找到调料瓶,还要记住它们的位置,并按照特定顺序完成任务。这就像一个厨师在忙碌的厨房中,需要同时处理多个任务,并确保每个步骤都正确无误。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的电子游戏,游戏里有很多任务,比如找到隐藏的宝藏或解开谜题。RoboSPA就像这个游戏,但它是为机器人设计的。机器人需要根据视觉和语言提示来完成任务,比如在一堆相似的物品中找到正确的一个。这就像在游戏中,你需要根据线索找到正确的路径。机器人还需要记住之前的步骤,就像你在游戏中需要记住之前的线索一样。

术语表

视觉-语言-动作模型 (Vision-Language-Action Model)

结合视觉感知、语言理解和动作生成的模型,用于机器人操作任务。

在论文中用于评估机器人在复杂任务中的表现。

细粒度空间推理 (Fine-Grained Spatial Reasoning)

评估模型在复杂空间结构中定位目标的能力。

RoboSPA的核心评估维度之一。

长时间程序规划 (Long-Horizon Procedural Planning)

评估模型在多步骤决策下执行任务的能力。

RoboSPA的核心评估维度之一。

目标归一化准确率 (Object-Normalized Target Accuracy)

衡量模型在不同场景复杂性下的空间推理能力。

用于细粒度空间推理任务的诊断指标。

进度评分 (Progress Score)

用于捕捉长时间程序规划任务的部分完成情况。

用于长时间程序规划任务的诊断指标。

开放问题 这项研究留下的未解疑问

  • 1 当前VLA模型在复杂空间关系和记忆密集型任务中表现不佳,需要增强其空间推理能力和记忆机制。
  • 2 数据集的场景多样性可能不足以涵盖所有真实世界的复杂性,需要更广泛的场景覆盖。

应用场景

近期应用

机器人操作评估

RoboSPA可用于评估和改进VLA模型在复杂场景和长时间任务中的表现,帮助开发更强大的机器人系统。

远期愿景

通用具身智能体

通过增强VLA模型的空间推理能力和记忆机制,RoboSPA有助于开发能够在复杂真实场景中自主操作的通用具身智能体。

原文摘要

Vision-Language-Action (VLA) models have shown promising progress in language-conditioned robotic manipulation. However, existing datasets and benchmarks mainly evaluate task completion under predefined settings, offering limited insight into model reasoning under increasing spatial and procedural complexity. We introduce \textbf{RoboSPA} (\textbf{Robo}t \textbf{S}patial-\textbf{P}rocedural \textbf{A}ssessment), a large-scale robotic manipulation dataset and benchmark for diagnosing embodied reasoning in VLA models. \texttt{RoboSPA} focuses on two core dimensions, Fine-Grained Spatial Reasoning and Long-Horizon Procedural Planning, covering 10 task categories and 56 base tasks. Each task is instantiated across five difficulty levels, yielding 280 variants with increasing spatial ambiguity and procedural complexity. We collect 527K trajectories across multiple embodiments and diverse scenes. Beyond binary success rate, \texttt{RoboSPA} introduces diagnostic metrics for more detailed evaluation. Experiments on representative VLA models show that current systems still struggle with complex spatial relations, precise low-level execution, and memory-intensive planning. These results establish \texttt{RoboSPA} as a challenging diagnostic benchmark for developing more capable, reliable, and generalizable embodied agents. Our data and code are available at https://github.com/fanzhenxuan/RoboSPA.

cs.RO cs.AI cs.CV