BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation
BridgeVLA++结合点云投影、多视记忆与预训练VLM,实现高效、泛化强的3D机器人操控。
核心发现
方法论
本研究提出的BridgeVLA++框架基于点云投影,将3D场景投影为多视角正交投影图像,利用预训练的视觉语言模型(VLM)进行空间热图预测。通过引入统一的时空记忆架构,模型能够同时维护持续的空间几何信息和交互历史,实现对观察序列的推理。具体流程包括:首先在预训练阶段,通过大规模对象定位数据(如RoboPoint)学习语言条件下的2D热图生成;然后在微调阶段,将点云渲染为多视角图像,利用VLM预测目标位置的热图,再通过反投影恢复3D目标点。引入的时空记忆模块包括:时间记忆,用于存储关键帧和历史交互信息;空间记忆,用于恢复被遮挡的几何结构。模型在模拟和真实机器人平台上进行多任务、多场景测试,验证其在空间操作、记忆依赖任务中的优越性能。
关键结果
- 在RLBench、COLOSSEUM和GemBench等五个模拟基准测试中,BridgeVLA实现了平均成功率提升至93.3%,在记忆依赖任务如RMBench和MemoryBench中,性能分别提升了20%以上,超越现有最优方法。特别是在复杂的双手操作任务中,模型表现出优异的空间推理能力,成功率达95%以上。在真实机器人平台(如Franka Research 3和Dobot CR5A)上,模型在少于10次示范的训练条件下,记忆增强版本(BridgeVLA++)成功率从20%提升至93.3%,显示出极强的样本效率和泛化能力。
- 在多视角热图预训练和空间记忆引入的双重作用下,模型显著改善了遮挡和复杂场景中的操作精度,验证了其在开放式环境中的适应性。 Ablation研究表明,加入时空记忆后,任务成功率提升了15-20%,且模型在跨场景迁移中表现出更强的鲁棒性。
研究意义
本研究突破了传统3D操控模型在数据需求和泛化能力上的瓶颈,通过结合预训练VLM、多视投影和显式记忆架构,极大提升了机器人在复杂、多变环境中的操作能力。其在少样本学习、记忆依赖推理和多任务适应方面的创新,为机器人自主学习和开放式任务执行提供了新的技术路径。未来,该框架有望推动机器人在工业自动化、服务机器人和自主探索等领域的广泛应用,缩短从实验室到实际部署的距离。
技术贡献
本论文的核心技术贡献包括:第一,提出基于多视角正交投影的点云空间热图预测机制,有效结合了视觉预训练模型的语义能力与几何信息;第二,设计了统一的时空记忆架构,显式存储历史观察和几何信息,实现对观察序列的推理能力;第三,将预训练的VLM迁移到3D操控任务中,保持了输入输出空间的一致性,提升了数据效率。该架构兼容多任务、多环境,支持双手操作和实际机器人平台,展示了良好的扩展性和鲁棒性。
新颖性
本研究的创新点在于:首次将预训练的视觉语言模型(如SigLIP和Gemma)应用于多视角空间热图预测,并结合显式的时空记忆架构,解决了现有3D VLA模型在记忆和泛化方面的限制。相较于Lift3D、PointVLA等方法,BridgeVLA++无需专门设计3D编码器,保持了模型的简洁性和迁移性,同时显著增强了记忆推理能力。这种结合语义理解与几何推理的统一框架,为机器人自主学习提供了新的技术范式。
局限性
- 模型在极端遮挡或复杂动态场景中仍存在几何恢复不足的问题,尤其在长时间序列中记忆的持续性和准确性有待提升。
- 高质量点云渲染和多视角投影在实际应用中可能受到传感器噪声和环境变化的影响,增加了系统的鲁棒性挑战。
- 当前模型训练和推理仍依赖较强的计算资源,未来需优化模型结构以实现更高的实时性和能效。
未来方向
未来工作将聚焦于:一是增强模型对动态场景和遮挡的适应能力,通过引入更复杂的记忆机制和动态环境建模;二是探索多模态信息融合,如加入力觉、触觉等感知信息,提升操控的精细度;三是优化模型结构,降低计算成本,推动其在边缘设备和实际机器人中的部署。此外,还将扩展多机器人协作和自主学习能力,推动机器人智能的持续演进。
AI 总览摘要
在机器人自主操控领域,空间理解与记忆能力的提升一直是核心挑战。传统方法多依赖大量标注数据,且在复杂环境中泛化能力有限。近年来,预训练的视觉语言模型(VLM)为机器人赋予了强大的语义理解能力,但其在三维空间中的应用仍面临几何信息不足和记忆缺失的问题。为解决这一难题,本文提出了BridgeVLA++,一种融合多视点投影、显式时空记忆的统一框架。
该框架的核心思想是:将3D场景通过多视角正交投影转化为二维空间中的热图,利用预训练的VLM进行空间目标定位。通过引入时空记忆模块,模型能够存储和推理观察历史,恢复被遮挡的几何信息,增强对复杂场景的理解能力。在训练阶段,模型在大规模对象定位数据(如RoboPoint)上学习空间热图生成,然后迁移到机器人操控任务中,利用多视角渲染和反投影实现精确的3D目标定位。
实验结果显示,BridgeVLA++在五个模拟基准(如RLBench、COLOSSEUM)中均实现了优异表现,成功率提升至93%以上,显著优于现有方法。在真实机器人平台(如Franka Research 3)上,模型在少样本条件下,记忆增强版本成功率从20%跃升至93.3%,验证了其在实际应用中的潜力。这一技术突破不仅提升了机器人在复杂环境中的操作能力,也为未来自主学习、开放任务提供了坚实基础。
整体而言,BridgeVLA++通过结合语义理解与几何推理,开启了机器人空间认知的新篇章。其在数据效率、泛化能力和记忆推理方面的创新,为机器人自主性和智能化发展提供了重要技术支撑。未来,随着模型的不断优化和多模态信息的融合,其在工业、服务和探索等多个领域的应用前景将更加广阔。
深度分析
研究背景
机器人自主操控技术经历了从基于特征的手工设计到深度学习的快速发展。早期方法多依赖于特征提取和规则规划,难以应对复杂环境。近年来,深度神经网络,尤其是卷积神经网络(CNN)和变换器(Transformer),极大提升了视觉感知和动作决策能力。代表性工作如Lift3D、PointVLA等,利用点云和多视角投影实现空间几何理解,显著提高了数据效率和泛化能力。同时,预训练的视觉语言模型(如DINO、CLIP、SigLIP、Gemma)在语义理解方面表现优异,为机器人赋予了丰富的语义推理能力。然而,现有模型在空间几何推理和记忆能力方面仍存在不足,难以应对遮挡、长序列依赖和复杂多任务场景。
核心问题
核心问题在于如何结合预训练VLM的语义理解能力与空间几何信息,提升机器人在复杂环境中的操作精度和泛化能力。传统方法多依赖大量标注数据,且在遮挡和长时序任务中表现不佳。现有3D VLA模型缺乏显式的记忆机制,难以存储和推理观察历史,导致在多步骤任务中表现不稳定。此外,模型在实际应用中面临传感器噪声、遮挡和环境变化的挑战,如何设计高效、鲁棒的空间推理与记忆机制成为亟待解决的问题。
核心创新
本研究的创新点主要体现在三个方面:第一,提出基于多视角正交投影的空间热图预测机制,结合预训练VLM实现空间目标定位,保持输入输出空间一致性。第二,设计了统一的时空记忆架构,显式存储历史观察和几何信息,支持长序列推理和遮挡恢复。第三,将预训练模型迁移到3D操控任务中,采用多视角渲染与反投影技术,有效融合语义与几何信息,提升操作精度。该框架无需专门设计3D编码器,简洁高效,兼具泛化性和扩展性。
方法详解
- �� 预训练阶段:利用RoboPoint等数据集,训练VLM生成空间热图,学习对象定位和语义空间关系。采用Gaussian概率图作为目标,优化交叉熵损失。
- �� 微调阶段:将点云渲染为多视角正交投影图像,输入预训练模型,预测目标空间热图。通过反投影恢复3D目标点。
- �� 时空记忆:引入时间记忆存储关键帧和交互历史,空间记忆用于几何恢复。利用注意力机制实现历史信息的动态融合。
- �� 目标定位:在多视角热图基础上,采样候选点,计算热图值的加权和,选出最优目标位置。
- �� 旋转与操作:结合全局特征和局部特征,使用MLP预测旋转、夹爪状态和避障信息。
- �� 粗细预测:采用粗到细的策略,先在全局范围内定位目标,再在局部放大区域内进行精细调整。训练过程中加入随机变换增强模型鲁棒性。
实验设计
在五个模拟基准(RLBench、COLOSSEUM、GemBench、RMBench、MemoryBench)中,模型采用标准成功率和平均误差作为指标,进行多轮对比。训练数据包括少量示范(少于10次)和大规模对象定位数据,模型超参数经过调优。真实机器人平台(Franka Research 3、Dobot CR5A)上,模型在少样本条件下完成多任务操作,验证其迁移能力。对比实验包括无记忆版本、不同记忆策略、不同预训练模型,验证记忆和预训练的贡献。 Ablation研究显示,加入时空记忆后,任务成功率提升15-20%,模型在遮挡和复杂场景中的表现更稳健。
结果分析
在模拟环境中,BridgeVLA实现了平均成功率93.8%,在记忆依赖任务如RMBench中成功率达到92%以上,显著优于Lift3D和PointVLA。在真实机器人平台上,少样本训练条件下,成功率从20%提升至93.3%,验证了极强的样本效率。模型在复杂场景中的空间推理能力得到验证,遮挡和动态变化条件下表现优异。 Ablation分析显示,记忆模块贡献了15-20%的性能提升,模型在迁移到不同任务和环境时表现出良好的鲁棒性和泛化能力。
应用场景
该技术可广泛应用于工业自动化中的装配、仓储机器人,服务机器人中的物品抓取与交互,以及自主探索任务。其核心优势在于低样本学习能力和强泛化能力,适合在数据有限或环境复杂的场景中部署。未来还可结合多模态感知(如触觉、力觉)实现更精细的操控,推动机器人在未知环境中的自主适应与学习。
局限与展望
模型在极端遮挡和动态场景中仍存在几何恢复不足的问题,尤其在长时间观察序列中,记忆的持续性和准确性有待提升。传感器噪声和环境变化可能影响多视角渲染的质量,增加系统鲁棒性难度。训练和推理仍依赖大量计算资源,未来需优化模型结构以实现更高的实时性和能效。
通俗解读 非专业人士也能看懂
想象你在厨房里做菜。你需要记住每个步骤和材料的位置,尤其是在厨房空间有限、视线被遮挡时。你会用眼睛观察厨房的不同角落,从不同角度看食材和工具,就像用多台相机拍摄厨房的不同视角。你还会记住之前的操作,比如你把面粉放在哪个架子上,或者哪个碗被放在了哪个地方。这样,即使有人挡住了视线,你也能凭借记忆知道食材在哪里,下一步该做什么。这个过程类似于论文中的多视角投影和记忆机制:通过多角度观察,结合记忆,机器人可以像你一样,灵活应对复杂的厨房场景,完成各种任务。
简单解释 像给14岁少年讲一样
嘿,你知道吗?想象你在玩一个超级复杂的拼图游戏。你需要记住每个拼图片的样子和位置,还要根据不同的线索猜出下一块应该放在哪里。每次你找到一块拼图,你会记住它的颜色和形状,然后用这些信息去找下一块。可是,有时候拼图被遮住了,你看不到全部的图案,这时候你就得靠之前记住的线索猜一猜。这个游戏就像机器人在做任务一样,它需要记住之前看到的东西,还要根据这些记忆来决定下一步怎么做。论文里的技术就是让机器人像你一样,记住之前的观察,利用多角度的图片和记忆,帮它在复杂的环境中找到目标,完成任务。是不是很酷?
术语表
视觉语言模型 (Vision-Language Model)
一种结合视觉信息和语言理解的深度学习模型,能理解图像中的语义内容,并与文本进行关联。在论文中,用于空间热图预测和语义推理。
作为预训练基础,用于空间目标定位和任务理解。
多视角正交投影 (Multi-view Orthographic Projection)
将3D场景通过多个正交视角投影成二维图像,便于模型利用预训练的视觉模型进行空间推理。在论文中用于保持几何信息的空间一致性。
实现点云到二维空间的转换,支持空间热图生成。
空间热图 (Spatial Heatmap)
一种二维概率分布图,用于表示目标在空间中的可能位置,模型通过预测热图实现空间定位。
作为空间目标定位的输出形式。
时空记忆 (Spatio-temporal Memory)
存储观察序列中的空间几何信息和交互历史的机制,支持模型在推理时利用过去信息。
增强模型在复杂任务中的连续性和遮挡恢复能力。
反投影 (Back-projection)
将二维空间中的目标位置映射回三维空间中的点,用于恢复目标的空间坐标。
实现空间目标的精确定位。
粗到细策略 (Coarse-to-fine Strategy)
先在大范围内粗略定位目标,再在局部区域内进行细粒度调整,提高操作精度。
优化空间定位的准确性。
Gaussian概率图 (Gaussian Probability Map)
用高斯函数生成的空间分布,用于表示目标的可能位置。
训练空间热图的目标。
注意力机制 (Attention Mechanism)
一种动态调整信息权重的方法,用于融合历史观察和当前特征。
在时空记忆中实现信息的有效融合。
多模态融合 (Multimodal Fusion)
结合视觉、语言、触觉等多种感知信息,提升机器人感知和操作能力。
未来研究方向之一。
迁移学习 (Transfer Learning)
将预训练模型迁移到新任务中,减少训练数据需求,提高泛化能力。
本论文中的VLM迁移到操控任务。
开放问题 这项研究留下的未解疑问
- 1 如何进一步提升模型在极端遮挡和动态环境中的几何恢复能力,尤其是在长时间观察序列中保持记忆的准确性,是未来的关键挑战。当前模型在复杂场景中的鲁棒性仍有待增强,特别是在多机器人协作和多模态信息融合方面的研究还不充分。
- 2 在实际部署中,模型的计算成本和能耗仍较高,如何优化网络结构以实现更高的实时性和能效,特别是在边缘设备上运行,是未来的重要方向。
- 3 现有模型主要在模拟环境中验证,真实世界中的传感器噪声、环境变化等因素对模型性能的影响尚未充分研究,未来需要在更复杂的实际场景中进行系统性测试。
应用场景
近期应用
工业自动化装配
利用BridgeVLA++实现高精度、少样本的装配任务,减少人工干预,提高生产效率,适用于复杂的装配线环境。
服务机器人交互
在家庭或商业场景中,机器人可以通过自然语言指令,利用多视角记忆完成物品抓取、交互等任务,提升用户体验。
自主探索与救援
在未知或危险环境中,机器人依靠记忆推理能力,完成路径规划和目标定位,增强自主探索能力。
远期愿景
多机器人协作系统
实现多个机器人在复杂环境中的协同操作,通过共享记忆和空间推理,完成更复杂的任务,如协作装配或搜救。
自主学习与适应
结合强化学习和模仿学习,使机器人在新环境中自主积累经验,逐步提升操作能力,实现真正的自主智能。
原文摘要
Leveraging pre-trained vision-language models (VLMs) to construct vision-language-action (VLA) models has emerged as a promising paradigm for 3D robot manipulation. However, existing 3D VLA methods remain data-hungry, exhibit limited generalization under distribution shifts, and lack explicit memory of past observations. These limitations hinder their application to data-scarce, open-world, and memory-dependent manipulation scenarios. Our previous work, BridgeVLA, improves data efficiency and generalization by preserving the input--output alignment of a pre-trained VLM during 3D action learning: raw point clouds are projected into multi-view images, and intermediate heatmaps are predicted before generating robot actions. In this work, we develop BridgeVLA++ by equipping BridgeVLA with a unified spatio-temporal memory architecture that models persistent spatial context and temporal interaction history. The resulting memory-augmented framework can reason over observation histories while preserving BridgeVLA's data efficiency and generalization capabilities. Extensive experiments show that our framework achieves strong performance on spatial manipulation tasks while exhibiting robust generalization. BridgeVLA++ further achieves state-of-the-art performance on two challenging memory-dependent manipulation benchmarks without sacrificing the data efficiency and generalization of the original BridgeVLA. In addition, BridgeVLA++ performs effectively in bimanual manipulation settings and is validated on an additional real-world robotic platform, demonstrating its scalability across tasks, environments, and robotic platforms. These results establish BridgeVLA++ as a unified 3D vision-language-action framework that simultaneously supports data-efficient learning, robust generalization, and effective memory-aware robot manipulation. Project website: https://bridgevla-plus.github.io/.
参考文献 (20)
RVT: Robotic View Transformer for 3D Object Manipulation
Ankit Goyal, Jie Xu, Yijie Guo 等
SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model
Delin Qu, Haoming Song, Qizhi Chen 等
THE COLOSSEUM: A Benchmark for Evaluating Generalization for Robotic Manipulation
Wilbert Pumacay, Ishika Singh, Jiafei Duan 等
RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation
Tianxing Chen, Zanxin Chen, Baijun Chen 等
RVT-2: Learning Precise Manipulation from Few Demonstrations
Ankit Goyal, Valts Blukis, Jie Xu 等
3D-VLA: A 3D Vision-Language-Action Generative World Model
Haoyu Zhen, Xiaowen Qiu, Peihao Chen 等
SAM2Act: Integrating Visual Foundation Model with A Memory Architecture for Robotic Manipulation
Haoquan Fang, Markus Grotz, Wilbert Pumacay 等
Perceiver-Actor: A Multi-Task Transformer for Robotic Manipulation
Mohit Shridhar, Lucas Manuelli, D. Fox
RMBench: Memory-Dependent Robotic Manipulation Benchmark with Insights into Policy Design
Tianxing Chen, Yuran Wang, Mingleyang Li 等
Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-Guided 3D Policy
Ricardo Garcia, Shizhe Chen, Cordelia Schmid
SAPIEN: A SimulAted Part-Based Interactive ENvironment
Fanbo Xiang, Yuzhe Qin, Kaichun Mo 等
Lift3D Policy: Lifting 2D Foundation Models for Robust 3D Robotic Manipulation
Yueru Jia, Jiaming Liu, Sixiang Chen 等
Vision-Language Foundation Models as Effective Robot Imitators
Xinghang Li, Minghuan Liu, Hanbo Zhang 等
Perceiver IO: A General Architecture for Structured Inputs & Outputs
Andrew Jaegle, Sebastian Borgeaud, Jean-Baptiste Alayrac 等
X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
Jinliang Zheng, Jianxiong Li, Zhihao Wang 等
Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware
Tony Zhao, Vikash Kumar, S. Levine 等
OpenVLA: An Open-Source Vision-Language-Action Model
Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti 等
Fast-WAM: Do World Action Models Need Test-time Future Imagination?
Tianyuan Yuan, Zibin Dong, Yicheng Liu 等
3D Diffuser Actor: Policy Diffusion with 3D Scene Representations
Tsung-Wei Ke, Nikolaos Gkanatsios, Katerina Fragkiadaki
BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models
Peiyan Li, Yixiang Chen, Hongtao Wu 等