CoRE-VLA: Towards Scalable and Robust Vision-Language-Action Modeling via Conditional Routing of Experts
CoRE-VLA模型通过条件专家路由实现了视觉-语言-动作的可扩展和鲁棒建模,在多任务和长时间任务中表现优异。
核心发现
方法论
CoRE-VLA通过条件专家路由实现动作生成的上下文条件稀疏计算。该框架使用传感器可用性来控制模式专用专家,并通过任务意图路由动作侧表示到任务相关专家。实验中,使用深度作为辅助模式,展示了在LIBERO和RoboCasa GR1 Tabletop等基准上的优异表现。
关键结果
- 在LIBERO基准上,CoRE-VLA在长时间任务中达到97.6%的成功率,远超其他基线方法。
- 在RoboCasa GR1 Tabletop基准上,CoRE-VLA的平均成功率为56.5%,优于其他方法。
- 在真实世界的双臂操作中,CoRE-VLA在无辅助深度的情况下依然表现出色,显示出其对传感器缺失的鲁棒性。
研究意义
该研究为机器人操控领域提供了一种新的方法,能够在多任务和长时间任务中保持高效和鲁棒的性能。通过条件专家路由,CoRE-VLA能够在不同传感器配置下自适应地调整计算路径,解决了现有方法在传感器缺失时性能下降的问题。
技术贡献
CoRE-VLA引入了条件专家路由,允许在不同任务和传感器配置下进行自适应计算。这种方法不仅提高了模型的鲁棒性,还增强了其在多任务学习中的扩展性。
新颖性
CoRE-VLA首次将条件专家路由应用于视觉-语言-动作模型中,实现了在传感器缺失情况下的鲁棒性和任务自适应性,与现有方法相比具有显著创新。
局限性
- 在某些复杂任务中,模型仍可能对特定传感器的缺失表现出一定的敏感性。
- 需要大量的训练数据来充分发挥其潜力。
未来方向
未来工作将扩展CoRE-VLA以支持更多的物理传感器,如触觉传感和力反馈,并在更大规模的跨机器人数据上进行训练。
AI 总览摘要
在机器人操控领域,现有的视觉-语言-动作模型在面对多样化的传感器配置时常常表现不佳。CoRE-VLA通过引入条件专家路由,解决了这一问题。该方法允许模型在传感器缺失时仍能保持高效的动作生成。
CoRE-VLA的核心在于将动作生成视为上下文条件的稀疏计算。通过传感器可用性控制模式专用专家,任务意图则用于路由动作侧表示到任务相关专家。这种设计使得模型能够在不同任务和传感器配置下自适应地调整计算路径。
实验结果显示,CoRE-VLA在LIBERO和RoboCasa GR1 Tabletop等基准上表现优异,尤其是在长时间任务中。即使在真实世界的双臂操作中,模型也能在无辅助深度的情况下保持鲁棒性。这表明CoRE-VLA在多任务和长时间任务中具有显著的应用潜力。
深度分析
研究背景
视觉-语言-动作模型近年来在机器人操控中取得了显著进展。然而,现有方法通常依赖于固定的传感器配置,导致在传感器缺失时性能下降。为了应对这一挑战,研究者们提出了多种方法,但大多未能解决传感器多样性和任务复杂性的问题。
核心问题
机器人在实际应用中常常面临传感器配置的多样性和传感器故障问题。现有的VLA模型在固定传感器配置下训练,难以适应这种变化,导致在传感器缺失时性能大幅下降。
核心创新
CoRE-VLA通过条件专家路由实现了动作生成的上下文条件稀疏计算。• 传感器可用性控制模式专用专家,允许在传感器缺失时优雅退化。• 任务意图路由动作侧表示到任务相关专家,增强了任务自适应性。
方法详解
- �� 预训练的视觉-语言模型用于编码RGB和语言指令。• 模态编码器用于处理辅助传感器输入。• 动作扩散变换器通过条件专家路由生成动作,结合模态丢弃和专家屏蔽策略。
实验设计
在LIBERO和RoboCasa GR1 Tabletop基准上进行实验,使用深度作为辅助模式。模型在多任务和长时间任务中表现优异,尤其是在传感器缺失情况下的鲁棒性。
结果分析
在LIBERO基准上,CoRE-VLA在长时间任务中达到97.6%的成功率,显示出其在任务自适应性上的优势。在RoboCasa GR1 Tabletop基准上,平均成功率为56.5%,优于其他方法。
应用场景
CoRE-VLA可用于需要多任务和长时间任务的机器人操控场景,如工业自动化和服务机器人。其对传感器缺失的鲁棒性使其在实际应用中具有广泛的潜力。
局限与展望
尽管CoRE-VLA在传感器缺失情况下表现优异,但在某些复杂任务中仍可能对特定传感器的缺失表现出一定的敏感性。此外,模型需要大量的训练数据来充分发挥其潜力。
通俗解读 非专业人士也能看懂
想象一个工厂,工人们根据不同的任务和工具进行工作。如果某个工具坏了,他们会找到替代方案继续工作。CoRE-VLA就像这些工人一样,它能在传感器缺失时找到替代方案,继续高效地完成任务。
简单解释 像给14岁少年讲一样
想象你在玩一个机器人游戏,你的机器人需要完成各种任务。有时候,你的机器人会失去某些工具,但它仍然能找到其他方法来完成任务。CoRE-VLA就像这个聪明的机器人,它能在传感器缺失时找到替代方案,继续完成任务。
术语表
条件专家路由 (Conditional Routing of Experts)
一种根据任务和传感器状态选择性激活计算路径的方法。
用于在CoRE-VLA中实现动作生成的上下文条件稀疏计算。
视觉-语言模型 (Vision-Language Model)
结合视觉和语言信息进行任务处理的模型。
用于编码RGB和语言指令。
模态丢弃 (Modality Dropout)
一种在训练中随机禁用辅助模态的方法,以增强模型的鲁棒性。
用于防止模型过度依赖辅助传感器输入。
专家屏蔽 (Expert Masking)
根据传感器可用性禁用特定专家的机制。
用于在传感器缺失时保持模型的鲁棒性。
动作扩散变换器 (Action Diffusion Transformer)
一种用于生成动作的变换器模型,结合了条件专家路由。
用于在CoRE-VLA中实现动作生成。
开放问题 这项研究留下的未解疑问
- 1 如何在更大规模的跨机器人数据上有效训练CoRE-VLA?
- 2 在更复杂的物理环境中,CoRE-VLA的性能如何?
应用场景
近期应用
工业自动化
在工业环境中应用CoRE-VLA进行多任务操控,提高生产效率。
远期愿景
服务机器人
在家庭和公共场所中应用CoRE-VLA进行复杂任务的自动化服务。
原文摘要
Vision-language-action (VLA) models have advanced generalist robotic manipulation, yet real-world deployment reveals a fundamental challenge: robots are equipped with diverse and heterogeneous sensor configurations, auxiliary sensors can fail unexpectedly during operation, and different robot embodiments often lack certain sensors by design. A unified policy that can exploit auxiliary perceptual inputs when available while remaining reliable under sensor absence, whether incidental or by design, is therefore essential for practical deployment. However, existing VLA policies couple action generation to a fixed sensor set through shared dense computation, making them brittle when sensors are missing and limiting their ability to specialize across diverse tasks and long-horizon behaviors. We propose CoRE-VLA, a scalable and robust VLA framework that formulates action generation as context-conditioned sparse computation. Sensor availability gates modality-specialized experts, enabling graceful degradation under missing sensors without retraining. Task intent further routes action-side representations to task-relevant experts, improving specialization across diverse tasks and long-horizon subgoals. While the framework is designed to accommodate different auxiliary sensors, we focus on depth as a representative and practically important auxiliary modality in our experiments. Experiments on LIBERO, RoboCasa GR1 Tabletop, and real-world dual-arm manipulation show that CoRE-VLA achieves strong results on long-horizon and multi-task benchmarks, and outperforms both a dense-action-generator ablation and a strong pretrained VLA baseline, including in zero-shot generalization to unseen scenarios. Modality analysis shows that CoRE-VLA can exploit auxiliary depth when available while remaining robust when depth is unavailable during deployment.