ForgeVLA: Federated Vision-Language-Action Learning without Language Annotations

TL;DR

ForgeVLA通过联邦学习从分布式视觉-动作对中学习VLA模型,无需语言标注,显著提升性能。

cs.CV 🔴 高级 2026-05-08 37 次浏览
Yuhao Zhou Yunpeng Zhu Yang Zhou Jindi Lyu Jian Lan Zhangyuan Wang Dan Si Thomas Seidl Qing Ye Jiancheng Lyu
联邦学习 视觉语言动作 机器人 无监督学习 数据隐私

核心发现

方法论

ForgeVLA是一种联邦学习框架,能够从分布式的视觉-动作对中学习VLA模型,而无需集中原始数据或手动标注。每个客户端配备一个内嵌指令分类器,将视觉-动作对映射到预定义的指令集,恢复缺失的语言模态。为解决视觉-语言特征崩溃问题,ForgeVLA结合了客户端对比规划损失和服务器端自适应聚合策略。

关键结果

  • 在多个基准测试中,ForgeVLA的成功率显著高于其他基线方法,Libero-Goal数据集上的成功率达到55.2%,比FedAvg提升26.4%。
  • 在LIBERO-Object数据集上,ForgeVLA的成功率为98.6%,几乎与集中式上限相当。
  • 在Pass@50指标上,ForgeVLA在所有数据集上均达到100%,远超其他联邦基线。

研究意义

ForgeVLA在学术界和工业界具有重要意义,尤其是在数据隐私和异构性挑战下。它利用现有的视觉-动作日志进行大规模VLA训练,避免了高昂的标注成本,并在不依赖合成生成的情况下实现了高质量的数据扩展。

技术贡献

ForgeVLA在技术上突破了现有方法的局限,提出了新的对比规划损失和自适应聚合策略,解决了跨域分布迁移下的特征崩溃问题。这些创新为联邦VLA学习提供了新的理论保证和工程可能性。

新颖性

ForgeVLA首次在无需语言标注的情况下,通过联邦学习实现了VLA模型的训练。与现有方法相比,其创新之处在于利用内嵌指令分类器恢复语言模态,并通过对比损失和自适应聚合策略解决特征崩溃问题。

局限性

  • 在高度异构的客户端环境下,特征崩溃问题仍可能出现,影响模型的泛化能力。
  • 需要一定量的预训练数据来微调内嵌指令分类器。

未来方向

未来工作可以探索更复杂的任务指令集和更广泛的应用场景,进一步优化对比损失和聚合策略,以提高模型的鲁棒性和适应性。

AI 总览摘要

ForgeVLA是一种创新的联邦学习框架,旨在解决视觉-语言-动作(VLA)模型训练中的数据标注瓶颈。现有方法依赖高成本的手动标注,而ForgeVLA利用分布式的视觉-动作对,通过内嵌指令分类器恢复语言模态,形成完整的VLA三元组。

该方法通过对比规划损失和自适应聚合策略解决了视觉-语言特征崩溃问题。实验结果表明,ForgeVLA在多个基准测试中显著优于其他方法,尤其是在数据隐私和异构性挑战下,表现出色。

这项研究为大规模VLA训练提供了新的思路,避免了高昂的标注成本,并在不依赖合成生成的情况下实现了高质量的数据扩展。未来工作将探索更复杂的任务指令集和更广泛的应用场景。

深度分析

研究背景

视觉-语言-动作(VLA)模型在机器人智能中具有巨大潜力,但其扩展受限于高昂的数据标注成本。现有方法如数据增强和模拟生成存在现实差距,而生成模型难以产生物理上合理的动作标签。联邦学习提供了一种在数据隐私和异构性约束下的自然框架。

核心问题

VLA模型的核心问题在于缺乏大规模、高质量的标注数据。机器人数据由于隐私和异构性问题,难以集中处理。现有联邦方法假设每个客户端都有完整的VLA三元组,未能有效利用未标注的视觉-动作日志。

核心创新

ForgeVLA通过联邦学习框架,从分布式的视觉-动作对中学习VLA模型,无需集中原始数据或手动标注。其创新在于利用内嵌指令分类器恢复语言模态,并通过对比损失和自适应聚合策略解决特征崩溃问题。

方法详解

  • �� 每个客户端配备内嵌指令分类器,将视觉-动作对映射到预定义指令集。
  • �� 使用对比规划损失,提升任务区分能力。
  • �� 服务器端采用自适应聚合策略,保留客户端更新方向。
  • �� 广泛实验验证了每个组件的贡献。

实验设计

实验在四个LIBERO基准测试上进行,模拟非独立同分布的异构性。使用InternVLA-M1作为骨干网络,应用LoRA技术对VLM编码器进行微调。对比基线包括FedAvg、FedProx等,评估指标为任务成功率和Pass@K。

结果分析

ForgeVLA在LIBERO-Goal数据集上成功率达到55.2%,比FedAvg提升26.4%。在LIBERO-Object数据集上,成功率为98.6%,几乎与集中式上限相当。Pass@50指标上,ForgeVLA在所有数据集上均达到100%。

应用场景

ForgeVLA适用于需要保护数据隐私的机器人领域,如制造、仓储和医疗。其无需集中数据的特性使其在数据敏感行业中具有广泛应用潜力。

局限与展望

在高度异构的客户端环境下,特征崩溃问题仍可能出现,影响模型的泛化能力。此外,内嵌指令分类器需要一定量的预训练数据来微调。未来工作将探索更复杂的任务指令集和更广泛的应用场景。

通俗解读 非专业人士也能看懂

想象你在一个大型工厂里,工人们需要根据视觉和动作来完成任务,但没有明确的语言指令。ForgeVLA就像一个智能助手,它能从工人们的动作中推断出他们的任务指令,并帮助他们更好地完成工作。通过这种方式,工厂不需要花费大量时间和金钱去标注每个任务,而是利用现有的工作记录来提高效率。这个助手还能在不同的工厂之间共享经验,帮助每个工厂更快地适应新的任务需求。

简单解释 像给14岁少年讲一样

想象你在玩一个超级酷的机器人游戏。游戏里的机器人需要完成各种任务,但没有明确的指令。ForgeVLA就像游戏里的超级助手,它能从机器人的动作中猜出它们的任务,并帮助它们更好地完成挑战。这样,你就不用花时间去告诉每个机器人该做什么,而是让它们自己学会如何完成任务。是不是很神奇?

术语表

联邦学习 (Federated Learning)

一种分布式学习方法,允许多个客户端在不共享原始数据的情况下协作训练模型。

在ForgeVLA中用于从分布式视觉-动作对中学习VLA模型。

视觉-语言-动作模型 (Vision-Language-Action Model)

集成视觉感知、语言理解和动作控制的模型,用于机器人智能。

ForgeVLA通过联邦学习训练的目标模型。

内嵌指令分类器 (Embodied Instruction Classifier)

一种将视觉-动作对映射到预定义指令集的分类器,恢复缺失的语言模态。

在每个客户端用于生成完整的VLA三元组。

对比规划损失 (Contrastive Planning Loss)

一种损失函数,通过在训练目标中引入任务区分边界来缓解视觉-语言特征崩溃。

用于提升ForgeVLA模型的任务区分能力。

自适应聚合策略 (Adaptive Aggregation Strategy)

一种服务器端策略,通过优化客户端更新的投影系数来保留每个客户端的更新方向。

用于解决ForgeVLA中的异构性挑战。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂的任务指令集中应用ForgeVLA以提高其适应性和鲁棒性。
  • 2 如何在不增加计算成本的情况下进一步优化对比损失和聚合策略。

应用场景

近期应用

制造业

ForgeVLA可用于制造业中的机器人控制,利用现有的视觉-动作日志进行训练,提升生产效率。

远期愿景

智能城市

在智能城市中,ForgeVLA可以用于交通管理和公共安全,利用分布式传感器数据进行实时决策。

原文摘要

Vision-Language-Action (VLA) models hold great promise for general-purpose robotic intelligence, yet scaling up such models is severely bottlenecked by the high cost of acquiring annotated training data. Fortunately, vision-equipped robots deployed across various domains already produce abundant vision-action pairs that can be leveraged to scale up VLA training more efficiently. However, these raw data cannot be centrally aggregated due to various constraints and also exhibit severe heterogeneity. To address these challenges, in this paper, we propose ForgeVLA, a federated VLA training framework that learns VLA models from distributed vision-action pairs without centralizing raw data or requiring manual annotations. Specifically, each client in ForgeVLA is equipped with an embodied instruction classifier that maps vision-action pairs to a predefined instruction set, recovering the missing language modality and forming complete vision-language-action triplets. Beyond triplet construction, we also identify vision-language feature collapse as a critical challenge that has been largely overlooked in prior federated VLA research. To mitigate this issue, ForgeVLA combines a client-side contrastive planning loss with a server-side adaptive aggregation strategy to learn task-discriminative representations efficiently. Extensive experiments across multiple benchmarks show that ForgeVLA significantly outperforms other baselines, and ablation studies further validate the contribution of each component.

cs.CV cs.AI