VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment

TL;DR

VLAFlow通过联合训练和未来潜在对齐实现视觉-语言-动作模型的稳定迁移。

cs.CV 🔴 高级 2026-07-02 3 次浏览
Guoyang Xia Fengfa Li Hongjin Ji Lei Ren Fangxiang Feng Kun Zhan Yan Xie
视觉 语言 机器人 迁移学习 潜在对齐

核心发现

方法论

VLAFlow采用统一的流匹配框架,通过OXEMix数据集进行四种训练范式的对比:仅动作建模(MindPI)、语言监督联合训练(MindLPI)、未来潜在对齐(MindWPI)及其结合(MindLWPI)。

关键结果

  • MindLWPI在LIBERO和LIBERO-Plus上实现了最稳定的迁移性能,表明语言和未来潜在表示提供互补的中间约束。
  • MindPI对异构数据敏感,可能导致负迁移。
  • 语言监督和未来潜在对齐分别改善了视觉-语言泛化和状态转换建模。

研究意义

该研究为视觉-语言-动作模型提供了一个统一的评估框架,使得不同训练范式的迁移性能可以在相同架构下进行直接比较,推动了机器人操控领域的进步。

技术贡献

VLAFlow通过引入语言和未来潜在监督信号,改善了异构数据上的动作监督平滑性,提供了新的工程可能性。

新颖性

首次将语言描述和未来潜在对齐结合用于视觉-语言-动作模型的训练,提供了对异构数据更稳定的迁移性能。

局限性

  • MindPI在异构数据上可能导致负迁移,因为它完全依赖低维动作标签。
  • 语言生成可能降低控制频率。

未来方向

未来工作可以探索如何进一步优化语言和潜在表示的结合,以提高模型的泛化能力。

AI 总览摘要

视觉-语言-动作模型在机器人操控中取得了快速进展,但不同的训练范式效果难以比较。VLAFlow通过统一的流匹配框架对四种训练范式进行评估,使用OXEMix数据集进行实验。结果显示,语言监督和未来潜在对齐提供了互补的中间约束,使得MindLWPI在多个基准测试中实现了最稳定的迁移性能。这项研究为视觉-语言-动作模型提供了一个统一的评估框架,推动了机器人操控领域的进步。

VLAFlow采用统一的流匹配框架,通过OXEMix数据集进行四种训练范式的对比:仅动作建模(MindPI)、语言监督联合训练(MindLPI)、未来潜在对齐(MindWPI)及其结合(MindLWPI)。实验结果表明,MindLWPI在LIBERO和LIBERO-Plus上实现了最稳定的迁移性能,表明语言和未来潜在表示提供互补的中间约束。

该研究为视觉-语言-动作模型提供了一个统一的评估框架,使得不同训练范式的迁移性能可以在相同架构下进行直接比较,推动了机器人操控领域的进步。

深度分析

研究背景

视觉-语言-动作模型在机器人操控中取得了快速进展。早期的研究如RT-1和RT-2展示了大规模Transformer在机器人策略学习中的有效性。后续研究如OpenVLA和Octo进一步推进了VLA架构和训练范式。

核心问题

不同训练范式的效果难以比较,因为现有模型在架构、数据、动作空间和评估协议上存在差异。这使得设计有效的训练范式以充分利用异构机器人数据并稳定迁移到下游任务变得困难。

核心创新

VLAFlow通过统一的流匹配框架对四种训练范式进行评估,使用OXEMix数据集进行实验。它首次将语言描述和未来潜在对齐结合用于视觉-语言-动作模型的训练。

方法详解

  • �� 使用OXEMix数据集进行实验
  • �� 采用统一的流匹配框架
  • �� 比较四种训练范式:MindPI、MindLPI、MindWPI、MindLWPI
  • �� 使用LIBERO和LIBERO-Plus进行评估

实验设计

实验使用OXEMix数据集,包含约5000小时的数据。使用LIBERO和LIBERO-Plus进行评估,测试模型在异构数据上的迁移性能。

结果分析

MindLWPI在LIBERO和LIBERO-Plus上实现了最稳定的迁移性能。语言监督和未来潜在对齐分别改善了视觉-语言泛化和状态转换建模。

应用场景

该方法可用于机器人操控任务,特别是在异构数据环境下。它改善了动作监督的平滑性,使得模型更具泛化能力。

局限与展望

MindPI在异构数据上可能导致负迁移,因为它完全依赖低维动作标签。语言生成可能降低控制频率。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。VLAFlow就像一个聪明的助手,它不仅能听懂你的指令,还能预测你下一步需要的工具和材料。比如,你说“切洋葱”,它不仅知道要拿刀,还能预测你可能需要一个砧板。这样即使你换了厨房,它也能快速适应,因为它不仅依赖于你的指令,还能根据环境变化进行预测。

简单解释 像给14岁少年讲一样

想象一下你在玩一个超级酷的机器人游戏。VLAFlow就像游戏里的超级助手,它不仅能听懂你说的话,还能预测你下一步的动作。比如,你说“去拿那个红色的杯子”,它不仅知道要伸手,还能预测你可能需要转身。这样即使你换了游戏场景,它也能快速适应,因为它不仅依赖于你的指令,还能根据环境变化进行预测。

术语表

视觉-语言-动作模型

一种结合视觉感知、语言理解和机器人控制的模型。

用于机器人操控任务的模型框架。

流匹配

一种用于连续动作生成的损失计算方法。

用于VLAFlow的动作专家模块。

未来潜在对齐

预测或对齐未来帧的潜在表示。

用于改善状态转换建模。

OXEMix

一个包含约5000小时数据的异构机器人数据集。

用于VLAFlow的实验数据集。

LIBERO

一个用于评估机器人操控任务的基准测试。

用于评估VLAFlow的迁移性能。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化语言和潜在表示的结合,以提高模型的泛化能力。
  • 2 如何在更大规模的数据集上测试VLAFlow的性能。

应用场景

近期应用

机器人操控

VLAFlow可用于复杂的机器人操控任务,提高异构数据环境下的迁移性能。

远期愿景

智能助手

VLAFlow可用于开发更智能的家庭助手,能够理解语言指令并预测用户需求。

原文摘要

Vision-language-action models (VLAs) have recently advanced robotic manipulation, yet the effects of different robot-data pre-training paradigms remain difficult to compare because existing models often differ in architecture, data, action space, and evaluation protocol. We present VLAFlow (Vision-Language-Action Flow), a unified flow-matching framework for controlled comparison of VLA training objectives. Using a heterogeneous robot corpus, OXEMix, containing approximately 5,000 hours of data from DROID, OpenX-Embodiment, OpenX-Augmented, and RoboCOIN, we evaluate four paradigms under the same pi0-style architecture, shared VLM backbone, action expert, and 14-dimensional action space: action-only modeling (MindPI), language-supervised co-training (MindLPI), future latent alignment (MindWPI), and their combination (MindLWPI). Experiments on LIBERO, LIBERO-Plus, and SimplerEnv show that action-only pre-training is sensitive to heterogeneous data. In contrast, language supervision helps preserve vision-language generalization, while future latent alignment improves state-transition and action-outcome modeling. By combining both signals, MindLWPI achieves the most stable overall transfer performance across benchmarks. These results suggest a meta-action space view: language and future latent representations provide complementary intermediate constraints that make heterogeneous action supervision smoother and more transferable.

cs.CV cs.AI cs.RO