GALA: Geometry-Aware Latent Action Modeling for Vision-Language-Action Model Pretraining across Embodiments

TL;DR

GALA通过几何感知潜在动作建模实现跨化身视觉-语言-动作模型预训练,达到68.3% RoboCasa-GR1成功率。

cs.RO 🔴 高级 2026-09-19 13 次浏览
Yichen Liu Puzhen Yuan Xiang Zhu Yanjiang Guo Jianyu Chen
潜在动作模型 视觉语言动作 几何感知 跨化身 预训练

核心发现

方法论

GALA是一种几何感知潜在动作建模框架,通过3D末端执行器几何运动增强基于图像的潜在动作。引入统一末端执行器运动表示(UEMR),结合视觉潜在动作和几何潜在动作,提供多化身数据的有效监督。

关键结果

  • GALA在RoboCasa-GR1上实现了68.3%的成功率,在真实环境中达到了75.5%的成功率,证明其在跨化身细粒度动作建模中的有效性。
  • 在细粒度运动探测和跨化身检索中表现出色,显著优于现有方法。
  • 通过消融实验验证了UEMR设计对模型性能的提升作用。

研究意义

GALA通过引入几何感知潜在动作建模,解决了现有图像基础潜在动作模型在捕捉细粒度末端执行器运动方面的不足。这一方法不仅提高了跨化身预训练的泛化能力,还为人类和机器人数据的联合学习提供了新的思路。

技术贡献

GALA的技术贡献在于其创新性地结合了视觉和几何潜在动作,提供了统一的末端执行器运动表示。相比于现有方法,GALA能够在不依赖化身特定对齐的情况下,捕捉细粒度的几何变化。

新颖性

GALA首次将3D几何运动引入潜在动作建模,解决了图像基础模型无法捕捉细粒度末端执行器运动的问题。其创新之处在于UEMR的引入,增强了跨化身的泛化能力。

局限性

  • GALA在处理复杂环境中的多化身数据时,计算成本较高,可能影响实时性。
  • 模型在某些特定化身上的表现可能不如预期,需要进一步优化。

未来方向

未来工作可以探索如何进一步降低计算成本,提高模型的实时性和适应性。此外,可以研究如何将GALA应用于更多样化的机器人平台和任务场景。

AI 总览摘要

GALA是一种几何感知潜在动作建模框架,旨在解决多化身数据中异构动作空间带来的挑战。现有的图像基础潜在动作模型难以捕捉细粒度的末端执行器运动,尤其是手指级别的几何变化。GALA通过引入3D末端执行器几何运动,增强了潜在动作的表示能力。

GALA的核心创新在于引入了统一末端执行器运动表示(UEMR),该表示保留了细粒度的运动信息,同时提高了跨化身的泛化能力。通过结合视觉潜在动作和几何潜在动作,GALA能够在多化身数据上进行有效的视觉-语言-动作预训练。

实验结果表明,GALA在细粒度运动探测、跨化身检索和下游视觉-语言-动作评估中表现出色。在RoboCasa-GR1上实现了68.3%的成功率,在真实环境中达到了75.5%的成功率,证明了其在跨化身细粒度动作建模中的有效性。未来工作将探索如何进一步降低计算成本,提高模型的实时性和适应性。

深度分析

研究背景

多化身数据中异构动作空间的挑战使得大规模视觉-语言-动作模型的学习变得困难。现有的潜在动作模型虽然可以从多样化的视频数据中学习化身无关的动作表示,但在捕捉细粒度末端执行器运动方面存在不足。尤其是在人类和灵巧机器人手的手指级别几何变化上,现有模型难以有效捕捉。

核心问题

核心问题在于如何在多化身数据中实现视觉-语言-动作模型的有效预训练。由于不同化身的运动空间异构,现有的潜在动作模型难以捕捉细粒度的末端执行器运动,尤其是手指级别的几何变化。

核心创新

GALA通过引入3D末端执行器几何运动,增强了潜在动作的表示能力。其核心创新在于引入了统一末端执行器运动表示(UEMR),该表示保留了细粒度的运动信息,同时提高了跨化身的泛化能力。

方法详解

  • �� GALA结合视觉潜在动作和几何潜在动作,提供多化身数据的有效监督。
  • �� 引入统一末端执行器运动表示(UEMR),保留细粒度的运动信息。
  • �� 通过3D末端执行器几何运动增强基于图像的潜在动作。

实验设计

实验设计包括细粒度运动探测、跨化身检索和下游视觉-语言-动作评估。在RoboCasa-GR1和真实环境中进行测试,验证了GALA在跨化身细粒度动作建模中的有效性。

结果分析

GALA在RoboCasa-GR1上实现了68.3%的成功率,在真实环境中达到了75.5%的成功率。实验结果表明,GALA在细粒度运动探测和跨化身检索中表现出色,显著优于现有方法。

应用场景

GALA可以应用于多化身机器人系统中的视觉-语言-动作模型预训练,尤其是在需要捕捉细粒度末端执行器运动的场景中。

局限与展望

GALA在处理复杂环境中的多化身数据时,计算成本较高,可能影响实时性。此外,模型在某些特定化身上的表现可能不如预期,需要进一步优化。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,你需要同时关注多个锅里的食物。GALA就像一个聪明的助手,它不仅能帮你看锅里的情况,还能根据食物的状态调整火候。它通过观察锅里的变化,学习如何在不同的锅具上做出美味的菜肴。即使锅具不同,它也能找到共通的烹饪技巧,让每道菜都能达到最佳状态。

简单解释 像给14岁少年讲一样

想象你在玩一个超级酷的机器人游戏!GALA就像你的秘密武器,它能帮助你控制各种不同的机器人,不管是人形机器人还是机械手。它能看懂每个机器人的动作,并帮你在游戏中做出最精准的操作。就像你在游戏中有一个无敌的助手,帮你赢得每一场比赛!

术语表

潜在动作模型 (Latent Action Model)

一种从视频中推断动作表示的模型,能够在不需要显式控制标签的情况下进行学习。

用于从多化身数据中学习化身无关的动作表示。

统一末端执行器运动表示 (Unified End-effector Motion Representation)

保留细粒度运动信息的表示,能够提高跨化身的泛化能力。

用于增强GALA的潜在动作表示能力。

细粒度运动探测 (Fine-grained Motion Probing)

评估模型在捕捉细微末端执行器运动方面的能力。

用于验证GALA在细粒度动作建模中的有效性。

跨化身检索 (Cross-embodiment Retrieval)

评估模型在不同化身之间共享运动语义的能力。

用于验证GALA在跨化身动作表示中的泛化能力。

视觉-语言-动作模型 (Vision-Language-Action Model)

结合视觉、语言和动作信息的模型,用于复杂任务的多模态学习。

GALA用于增强该模型的预训练能力。

开放问题 这项研究留下的未解疑问

  • 1 如何在不增加计算成本的情况下提高GALA的实时性和适应性?
  • 2 GALA在某些特定化身上的表现不如预期,如何进一步优化?

应用场景

近期应用

机器人系统

GALA可用于提高多化身机器人系统的视觉-语言-动作模型预训练能力,尤其是在需要捕捉细粒度末端执行器运动的场景中。

远期愿景

多模态学习

GALA的成功可能推动多模态学习的发展,使机器人能够更好地理解和执行复杂任务。

原文摘要

Learning large-scale vision-language-action (VLA) models from multi-embodiment datasets remains challenging due to heterogeneous action spaces across end effectors. Although latent action models (LAMs) can learn embodiment-agnostic action representations from diverse video data, existing image-based LAMs often fail to capture fine-grained end-effector articulation, particularly finger-level geometric changes in human and dexterous robot hands. To address this limitation, we propose GALA, a Geometry-Aware Latent-Action modeling framework that augments image-based latent actions with 3D end-effector geometric motion. However, naively incorporating point clouds yields fine-grained action representations with limited shared semantics, hindering cross-embodiment pretraining. To address this issue, we introduce the Unified End-effector Motion Representation (UEMR), which preserves fine-grained motion information while improving the cross-embodiment generalizability of latent actions. Building upon UEMR, GALA combines visual latent actions that capture scene-level dynamics with geometric latent actions that capture shared fine-grained end-effector articulation, providing effective supervision for VLA pretraining from multi-embodiment data, including action-free ego-centric human videos. Experiments on fine-grained motion probing, cross-embodiment retrieval, and downstream VLA evaluation demonstrate GALA's effectiveness in modeling generalizable fine-grained motions across embodiments, achieving 68.3% RoboCasa-GR1 success rate and 75.5% real-world success rate. Code, appendix, and demos are available at https://puzhenyuan.github.io/GALA-website/.

cs.RO cs.CV