EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control

TL;DR

EvoScene-VLA通过动作更新场景状态,将RoboTwin任务成功率提高至88.8%。

cs.RO 🔴 高级 2026-05-21 27 次浏览
Chushan Zhang Ruihan Lu Jinguang Tong Xuesong Li Yikai Wang Hongdong Li
机器人控制 视觉语言模型 场景表示 动作预测 深度学习

核心发现

方法论

EvoScene-VLA提出一种递归场景前缀方法,将动作更新的场景状态与视觉语言模型结合。其核心包括几何锚点、场景预测器和动作-场景联合去噪机制。

关键结果

  • 在31个RoboTwin任务中,成功率从86.4%提高到88.8%(固定评估),从85.7%提高到87.9%(随机评估)。
  • 在Galaxea R1-Lite真实机器人上,EvoScene-VLA显著优于所有基线方法。
  • 消融实验显示,几何锚点和场景预测器对性能提升有累积贡献。

研究意义

该方法解决了机器人控制中场景状态无法跨动作块更新的问题,为复杂任务的连续控制提供了更精确的场景表示,具有重要学术和工业意义。

技术贡献

提出了递归场景前缀和动作-场景联合去噪,显著改进了视觉语言模型的场景表示能力,并首次实现跨动作块的场景状态更新。

新颖性

首次将动作更新场景状态引入机器人控制,并通过几何锚点和场景预测器实现了场景状态的高效递归更新。

局限性

  • 场景预测器仅在训练阶段使用,可能限制模型的泛化能力。
  • 对复杂场景的几何表示仍有改进空间。

未来方向

未来可探索更高效的场景预测机制,以及在多机器人协作任务中的应用。

AI 总览摘要

EvoScene-VLA是一种新型机器人控制框架,通过递归场景前缀实现跨动作块的场景状态更新。

现有方法无法有效处理动作对场景的动态影响,导致机器人在复杂任务中表现受限。EvoScene-VLA通过几何锚点和场景预测器在训练阶段提供监督,并在推理阶段通过动作-场景联合去噪机制实现场景状态更新。

在31个RoboTwin任务中,EvoScene-VLA成功率显著提高,并在真实机器人实验中表现优异。该方法为机器人控制领域提供了新的技术路径,同时也为未来研究指明了方向。

深度分析

研究背景

机器人控制领域近年来取得了显著进展,尤其是基于视觉语言模型的控制策略。然而,这些方法通常无法有效处理动作对场景的动态影响,导致场景状态更新滞后。

核心问题

现有方法无法维护动作更新的场景状态,导致机器人在复杂任务中需要重新推断场景变化,增加了计算负担并降低了任务成功率。

核心创新

EvoScene-VLA通过递归场景前缀和动作-场景联合去噪机制实现场景状态的动态更新。几何锚点提供了场景的3D结构监督,而场景预测器则为未来场景状态提供目标。

方法详解

  • �� 递归场景前缀:跨动作块维护场景状态。
  • �� 几何锚点:结合深度监督和3D模型特征。
  • �� 场景预测器:训练阶段生成未来场景目标。
  • �� 动作-场景联合去噪:推理阶段同时更新动作和场景状态。

实验设计

在RoboTwin和LIBERO基准测试中评估模型性能,并在Galaxea R1-Lite真实机器人上验证其实际应用效果。实验包括消融研究以分析各组件的贡献。

结果分析

EvoScene-VLA在固定评估中将成功率提高至88.8%,在随机评估中提高至87.9%。消融实验显示,几何锚点和场景预测器对性能提升有显著贡献。

应用场景

适用于复杂机器人任务,如物体操作、动态场景交互等。特别适合需要跨动作块场景状态更新的任务。

局限与展望

模型对复杂场景的几何表示仍有改进空间,且场景预测器仅在训练阶段使用,可能限制泛化能力。

通俗解读 非专业人士也能看懂

想象一个厨师在厨房工作。每次他完成一个动作,比如切菜或开柜门,厨房的状态都会发生变化。如果厨师不能记住这些变化,他就需要不断重新观察整个厨房。EvoScene-VLA就像一个智能助手,能帮厨师记录这些变化,并在每次新动作前更新厨房状态,从而让工作更高效。

简单解释 像给14岁少年讲一样

想象你在玩一个需要操作机器人完成任务的游戏。每次机器人做动作,比如打开门或拿东西,场景都会改变。如果游戏不能记住这些变化,你就得重新观察整个场景,很麻烦!EvoScene-VLA就像一个超级记忆芯片,能帮机器人记住场景变化,让任务完成得更快、更顺利!

术语表

递归场景前缀 (Recurrent Scene Prefix)

一种跨动作块维护场景状态的方法。

用于记录并更新机器人动作对场景的影响。

几何锚点 (Geometric Anchor)

通过深度和3D特征监督场景表示。

训练阶段用于提供场景结构信息。

场景预测器 (Scene Predictor)

预测未来场景状态的模块。

训练阶段生成目标场景表示。

动作-场景联合去噪 (Action-Scene Co-denoising)

同时更新动作和场景状态的机制。

推理阶段用于生成动作和场景更新。

RoboTwin基准测试 (RoboTwin Benchmark)

一个机器人任务集合,用于评估模型性能。

包含31个任务,涵盖多种场景。

开放问题 这项研究留下的未解疑问

  • 1 如何在推理阶段实现更高效的场景预测?
  • 2 如何扩展到多机器人协作任务?

应用场景

近期应用

动态场景交互

适用于需要实时更新场景状态的机器人任务,如物体操作。

复杂任务规划

帮助机器人在长时间任务中保持场景状态一致性。

远期愿景

多机器人协作

探索多个机器人共享场景状态的可能性,以实现更复杂的协作任务。

原文摘要

Chunked vision-language-action (VLA) policies predict multi-step robot controls, conditioning each update on the current visual observation alone. Yet robot actions cause contact, occlusion, and object motion, and the geometry that later decisions depend on can change before the next visual update arrives. Spatial VLAs improve current-frame geometry. Temporal VLAs aggregate past frames. Neither maintains an action-updated scene prior across chunks. We argue for a persistent action-updated scene state across control calls, and introduce EvoScene-VLA. Its recurrent scene prefix carries a geometry-aware scene state across chunks. At each vision-language model (VLM) call, the VLM combines scene information from the current observation with the action-updated prior from the previous chunk; the action decoder outputs both the next action chunk and a compact scene update. This update becomes the next prior, which the VLM corrects against the new observation when the next call arrives. Each control call therefore starts from a scene prior that reflects both recent actions and fresh visual evidence. During training, \textbf{Scene Predictor} supplies future scene-token targets, and Geometric Anchor aligns scene slots with frozen depth and 3D teachers. We discard both modules at deployment. On 31 RoboTwin tasks, EvoScene-VLA raises average success from 87.2% to 89.1% in fixed evaluation and from 86.1% to 88.5% in randomized evaluation. On the Galaxea R1-Lite real robot, EvoScene-VLA outperforms all baselines.

cs.RO cs.AI