Recursive Belief Vision Language Action Models

TL;DR

RB-VLA模型在长时任务中表现优异,成功率提高52.5%。

cs.AI 🔴 高级 2026-02-24 30 次浏览
Vaidehi Bagaria Bijo Sebastian Nirav Kumar Patel
视觉 语言 动作 长时任务 信念模型

核心发现

方法论

RB-VLA是一种信念中心的架构,通过自监督世界模型目标进行训练,保持紧凑的潜在状态编码任务相关历史、动态和对象交互。VLM每任务查询一次,提供高层意图,而信念跟踪任务进展,在部分可观察性下实现阶段感知、因果控制。

关键结果

  • RB-VLA在多阶段抓取和堆叠任务中分别比π0高出52.5%和37.5%的成功率,显著减少推理延迟,消除现有VLA中观察到的时间步长内存增长。
  • 在长时基准测试中,RB-VLA在多阶段抓取和堆叠任务中表现优异,成功率分别提高52.5%和37.5%。
  • 消融实验显示信念模块是性能的主要驱动因素,成功率从没有信念的32.5%提高到有信念的77.5%。

研究意义

RB-VLA通过引入信念状态表示,解决了现有视觉-语言-动作模型在长时任务中面临的推理延迟和任务进展丢失问题。该模型在多阶段控制任务中表现出色,具有重要的学术和工业意义。

技术贡献

RB-VLA通过将信念状态与扩散策略结合,实现了在部分可观察性下的稳健闭环执行。与现有方法相比,RB-VLA在长时任务中表现出更高的成功率和更低的推理延迟。

新颖性

RB-VLA首次将信念状态与视觉-语言模型结合,提供了长时任务中稳健的因果控制。与现有方法相比,RB-VLA在任务进展跟踪和阶段感知控制方面具有显著创新。

局限性

  • RB-VLA在处理极端遮挡或感知噪声时可能表现不佳,因为信念状态依赖于历史信息的准确性。
  • 模型在训练时需要大量的模拟数据,这可能限制其在数据稀缺环境中的应用。

未来方向

未来工作可以集中在提高RB-VLA在极端遮挡条件下的鲁棒性,以及减少训练数据需求以提高其在真实世界中的适用性。

AI 总览摘要

RB-VLA模型旨在解决长时任务中现有视觉-语言-动作模型的局限性,如推理延迟和任务进展丢失。通过引入信念状态,RB-VLA能够在部分可观察性下实现稳健的因果控制。实验结果显示,RB-VLA在多阶段抓取和堆叠任务中表现优异,成功率显著提高,推理延迟大幅减少。

RB-VLA的关键创新在于其信念中心架构,该架构通过自监督世界模型目标进行训练,保持紧凑的潜在状态编码任务相关历史、动态和对象交互。该模型在长时任务中表现出色,具有重要的学术和工业意义。

尽管RB-VLA在长时任务中表现优异,但在极端遮挡或感知噪声条件下可能表现不佳。未来工作可以集中在提高模型的鲁棒性和减少训练数据需求,以提高其在真实世界中的适用性。

深度分析

研究背景

视觉-语言-动作模型在结合语言理解和视觉感知以直接生成机器人动作方面表现出色。然而,大多数现有方法隐含地采用马尔可夫假设,仅依赖当前观察或短历史窗口进行动作决策。这种反应性推理无法在噪声观察、感知混淆、遮挡和时间静态短观察历史下捕捉长期上下文。

核心问题

现有视觉-语言-动作模型在长时任务中面临推理延迟和任务进展丢失的问题。由于缺乏持久的、动作条件的状态表示,这些模型在多阶段控制任务中表现不佳。

核心创新

RB-VLA通过引入信念状态表示,解决了现有视觉-语言-动作模型在长时任务中面临的推理延迟和任务进展丢失问题。该模型通过自监督世界模型目标进行训练,保持紧凑的潜在状态编码任务相关历史、动态和对象交互。

方法详解

  • �� 信念中心架构:通过自监督世界模型目标进行训练,保持紧凑的潜在状态编码任务相关历史、动态和对象交互。
  • �� 阶段感知控制:信念状态提供短期和长期预测上下文,支持隐式阶段估计和因果控制。
  • �� 语义基础与控制分离:通过一次性查询视觉-语言模型提取任务意图,消除密集语义再推理。

实验设计

实验在RoboSuite和LIBERO-Long环境中进行,评估RB-VLA在长时、多阶段操控任务中的表现。使用40,000个模拟操控轨迹进行训练,评估任务成功率、推理延迟和内存增长。

结果分析

RB-VLA在多阶段抓取和堆叠任务中分别比π0高出52.5%和37.5%的成功率,显著减少推理延迟,消除现有VLA中观察到的时间步长内存增长。

应用场景

RB-VLA适用于需要长时任务执行的机器人应用,如工业自动化和家庭服务机器人。其稳健的因果控制能力使其在复杂环境中表现出色。

局限与展望

RB-VLA在处理极端遮挡或感知噪声时可能表现不佳,因为信念状态依赖于历史信息的准确性。模型在训练时需要大量的模拟数据,这可能限制其在数据稀缺环境中的应用。

通俗解读 非专业人士也能看懂

想象一个机器人在厨房中工作。它需要在不同的柜子中找到并拿出特定的餐具。传统模型就像一个只记得眼前任务的机器人,每次都要重新查看说明书。而RB-VLA就像一个有记忆的机器人,它记得之前的任务进展,不需要每次都重新查看说明书。即使某个餐具被其他物品挡住,它也能根据之前的记忆继续完成任务。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你的任务是找到并收集房间里的所有宝藏。传统的机器人就像一个每次都要重新查看地图的玩家,而RB-VLA就像一个记得之前探索过哪些房间的玩家。即使宝藏被家具挡住,它也能根据之前的记忆继续寻找,而不需要每次都重新查看地图。是不是很酷?

术语表

信念状态 (Belief State)

一种表示任务进展和动态的潜在状态,帮助机器人在部分可观察性下进行因果控制。

在RB-VLA中用于跟踪任务进展和实现稳健控制。

视觉-语言模型 (Vision-Language Model)

结合视觉和语言信息进行任务推理的模型。

在RB-VLA中用于提取任务意图。

自监督学习 (Self-Supervised Learning)

一种无需人工标注的数据驱动学习方法。

用于训练RB-VLA的信念中心架构。

扩散策略 (Diffusion Policy)

一种用于生成连续动作的策略,结合信念状态和任务意图。

在RB-VLA中用于实现闭环控制。

多阶段任务 (Multi-Stage Task)

需要多个步骤和阶段完成的复杂任务。

RB-VLA在多阶段任务中表现优异。

开放问题 这项研究留下的未解疑问

  • 1 如何提高RB-VLA在极端遮挡条件下的鲁棒性?现有方法在处理极端遮挡时可能表现不佳,需要改进信念状态的准确性。
  • 2 如何减少RB-VLA的训练数据需求?现有模型需要大量模拟数据,限制了其在数据稀缺环境中的应用。

应用场景

近期应用

工业自动化

RB-VLA可用于工业机器人在复杂环境中的长时任务执行,提高生产效率。

远期愿景

家庭服务机器人

RB-VLA可用于家庭服务机器人,帮助其在复杂家庭环境中执行多阶段任务,如整理房间或准备食物。

原文摘要

Vision-language-action models must enable agents to execute long-horizon tasks under partial observability. However, most existing approaches remain observation-driven, relying on short context windows or repeated queries to vision-language models (VLMs). This leads to loss of task progress, action repetition under perceptual aliasing, and high inference latency. While semantic grounding is important, long-horizon manipulation fundamentally requires persistent, action-conditioned state representations. Current VLAs lack such representations and exhibit limited temporal and physical reasoning, making them ill-suited for multi-stage control. This paper introduces RB-VLA, a belief-centric architecture trained with self-supervised world-model objectives that maintains a compact latent state encoding task-relevant history, dynamics, and object interactions. Queried once per task, the VLM provides high-level intent, while the belief tracks task progress and enables phase-aware, causally grounded control under partial observability without storing raw observations or scaling memory with time. The belief and intent jointly condition a diffusion policy for robust closed-loop execution. RB-VLA outperforms prior VLAs on long-horizon benchmarks, achieving 52.5 percent and 37.5 percent higher success rates on multi-stage pick-and-place and stacking tasks, respectively, compared to pi_0. It also reduces inference latency by up to five times relative to baselines and eliminates memory growth across timesteps observed in existing VLAs. Ablations show the belief module is the primary driver of performance, increasing success rates from 32.5 percent without belief to 77.5 percent with belief.

cs.AI