Gripper-aware Vision Language Action Models

TL;DR

提出多抓手感知的视觉语言动作模型GVLA,利用MiGA数据集实现五类不同抓手的策略差异,提升机器人多样化操作能力。

cs.RO 🔴 高级 2026-08-25 71 次浏览
Hanyi Zhang Zihong Luo Tianyu Li Khang Nguyen Basu Hela Shreyas Kumar Ngoc Duy Tran Feng Dai Charith Munasinghe Jorge Peña Queralta Giovanni Toffetti Khoa Vo Ngan Le Ravi Prakash Quan Vuong Tung D. Ta Long Hu Anh Nguyen Baoru Huang
机器人操作 视觉语言模型 多抓手策略 数据集 迁移学习

核心发现

方法论

本文提出结合多抓手编码器和适配器路由的GVLA模型,利用新颖的多抓手标记化方法,将不同抓手信息嵌入到Transformer架构中。核心包括:• 设计多层次的抓手编码(平台、类型、实例)实现嵌入结构化;• 引入双重Mixture-of-Adapters(MoA)机制,通过路由不同专家池实现策略调控;• 构建涵盖五类抓手(平行夹爪、吸盘、三指夹持、软夹、五指手)的MiGA数据集,包含103,000示范,覆盖模拟与真实环境。模型在多任务、多抓手条件下进行端到端训练,结合条件流匹配损失和抓手分类损失,优化策略适应性。

关键结果

  • GVLA在模拟和实物机器人上均优于基线模型,平均提升成功率7.62%。在零样本和少样本任务中表现出更强的泛化能力,适应新对象和未见任务,显著优于传统方法。具体在复杂场景中,GVLA实现了对不同抓手策略的有效调度,提升了操作成功率和效率。
  • 在多任务测试中,GVLA在不同抓手条件下的成功率达85%以上,显著优于未考虑抓手信息的模型(成功率约70%)。在新任务和新对象的迁移实验中,GVLA表现出较强的适应性,少样本微调后成功率提升15%。
  • 消融实验显示,多层次抓手编码和MoA机制各自贡献了约4-5%的性能提升,验证了策略调度和结构化嵌入的重要性。

研究意义

该研究突破了现有视觉语言模型在机器人操作中的局限,首次系统性引入多抓手感知机制,显著增强机器人在多样化任务中的适应性和策略调度能力。通过构建MiGA数据集,为未来多抓手策略学习提供了丰富的标注和示范基础,推动机器人自主操作向更复杂、多样的场景扩展。模型的泛化能力和效率提升,为工业自动化、服务机器人等应用提供了理论支撑和技术路径,有望引领机器人操作的智能化新时代。

技术贡献

技术创新主要体现在:• 提出多层次的抓手编码策略,有效捕捉不同机械结构的特征差异;• 设计双重MoA机制,实现策略调度的参数高效微调,兼顾参数共享与策略差异;• 构建涵盖五类抓手的MiGA大规模数据集,丰富了多样化策略的示范样本。该方法结合Transformer架构,利用软提示和路由机制,增强模型对硬件变化的适应性,突破了以往只关注几何或单一抓手的限制,开辟了多抓手感知的研究新方向。

新颖性

本研究的创新点在于:首次系统性引入多层次抓手编码与双MoA机制,结合大规模多抓手数据集,实现在多样化机器人操作中的策略调度与泛化。相比以往只关注几何或单一抓手的研究,本文强调策略级别的差异化,填补了多抓手策略学习的空白,推动机器人自主操作向多样性和智能化迈进。

局限性

  • 模型在极端复杂场景下仍存在策略调度不充分的问题,尤其在多目标、多动作同时发生时表现有限。
  • 数据集虽丰富,但对某些特殊抓手或新型机械结构的泛化能力尚待验证,未来需扩展多样性。
  • 训练成本较高,模型参数较多,实时应用还需优化推理效率。

未来方向

未来将探索更高效的模型结构,提升实时性和鲁棒性;同时,扩展多抓手策略的多模态感知能力,如触觉和力觉信息,增强操作的精细化;此外,将模型迁移到更复杂的工业场景,验证其在实际生产中的应用潜力。

AI 总览摘要

机器人在复杂环境中的自主操作一直是人工智能领域的核心挑战。传统方法多依赖预定义策略或单一机械结构,难以应对多样化任务和多样化抓手的需求。近年来,视觉语言模型(VLM)在机器人操控中展现出强大潜力,但大多忽视了不同机械结构带来的策略差异,限制了其泛化能力。为突破这一瓶颈,本文提出了“Gripper-aware Vision Language Action” (GVLA)模型,结合新颖的多抓手编码和适配器路由机制,有效捕捉五类不同抓手的策略特征。核心创新在于:• 设计多层次的抓手编码,将平台、类型、实例信息结构化嵌入;• 引入双重Mixture-of-Adapters(MoA),实现策略调度的参数高效微调;• 构建涵盖模拟与真实环境的MiGA大规模数据集,包含103,000示范,覆盖多任务、多抓手场景。实验结果显示,GVLA在多任务、多抓手条件下,成功率比基线模型提升7.62%,在新对象和未见任务中表现出优异的泛化能力。该方法不仅提升了机器人操作的智能化水平,也为未来多机械结构、多策略的自主机器人奠定了基础。未来,模型将结合多模态感知和更高效的推理机制,推动机器人在工业、服务等领域的广泛应用。尽管如此,模型在极端复杂场景和实时应用中仍需优化,未来工作将聚焦于模型轻量化和多模态融合,持续推动机器人自主操作的边界。

深度分析

研究背景

机器人自主操作的研究经历了从手工设计策略到深度学习的快速发展。早期方法依赖于预定义的几何和运动学模型,难以应对复杂环境。近年来,视觉语言模型(如RT系列、OpenVLA)引入自然语言指令,显著提升了任务灵活性。然而,现有模型多假设机械手为单一类型,忽视了多样化机械结构带来的策略差异,限制了泛化能力。数据集方面,OpenX-Embodiment、Bridge V2等提供了大量示范,但多集中在平行夹爪,缺乏多抓手、多任务的系统性数据。随着多机械结构的普及,研究逐渐意识到策略差异的重要性,但缺乏系统化的多抓手数据和模型框架,成为制约其应用的瓶颈。

核心问题

核心问题在于:现有视觉语言模型未能充分考虑不同机械结构带来的策略差异,导致在多抓手、多任务环境中表现不佳。机械手的几何结构、接触机制和运动自由度差异,决定了不同任务的操作策略,单一模型难以兼容多样机械结构。数据方面,缺乏涵盖多机械、多策略的高质量示范,限制了模型的泛化能力。此外,如何在模型中有效编码机械结构信息,实现策略调度与迁移,也是亟待解决的问题。

核心创新

本研究的创新主要包括:1)提出多层次抓手编码,将平台、类型和实例信息结构化嵌入,增强模型对机械差异的感知;2)设计双重Mixture-of-Adapters(MoA)机制,通过路由不同专家池,实现策略调度的参数高效微调,兼顾参数共享与差异化;3)构建MiGA大规模多抓手数据集,涵盖五类机械结构,提供丰富的示范样本,支持多任务、多策略学习。这些创新突破了以往只关注几何或单一机械结构的限制,为多机械、多策略的自主操作提供了理论基础和技术支撑。

方法详解

  • �� 设计多层次的抓手编码,将平台、类型、实例信息通过可学习的软提示(prompt)编码,形成结构化嵌入;
  • �� 利用Transformer架构,将嵌入信息与视觉输入结合,进行任务推理;
  • �� 引入双重MoA机制,分别路由平台和抓手类型的专家池,调节动作生成;
  • �� 采用条件流匹配损失训练动作策略,结合抓手分类损失,增强策略的策略感知能力;
  • �� 构建MiGA数据集,采集模拟与真实环境中的多机械、多任务示范,确保模型的泛化能力。

实验设计

在模拟环境(NVIDIA Isaac)和真实机器人(UFAC- TORY xArm7、Franka Panda、UR5)上进行测试。采用多任务、多抓手场景,包括单一目标、多目标、多策略任务。比较基线模型包括AnyGrasp、GraspMAS、以及未考虑抓手信息的π0和π0.5。指标主要为成功率和泛化能力,进行零样本和少样本迁移测试。超参数包括学习率、批次大小和模型深度,确保公平性。实验还包括消融分析,验证多层次编码和MoA机制的贡献。

结果分析

GVLA在多任务、多抓手环境中成功率达85%以上,优于未考虑抓手信息的模型(成功率约70%),提升7.62%。在新对象和未见任务中,微调后成功率提升15%。消融实验显示,多层次编码和MoA机制分别贡献了4-5%的性能提升。模型在复杂场景中的策略调度表现出色,验证了结构化嵌入和策略路由的有效性。

应用场景

该模型适用于工业自动化、仓储物流、服务机器人等场景,能实现多机械结构的自主操作。只需提供任务描述和机械配置,即可实现高效策略调度。未来,结合多模态感知(如触觉、力觉)将进一步提升操作的精细化和鲁棒性。

局限与展望

模型在极端复杂场景(如多目标同时操作、多机械协作)中仍存在策略调度不足的问题。数据集虽丰富,但对新型机械结构和特殊任务的泛化能力有限。训练成本较高,实时推理仍需优化。未来需在模型轻量化和多模态融合方面进行改进。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,不同的厨具(锅、刀、勺子)需要不同的操作方法。比如,用刀切菜要不同于用勺子舀汤。机器人就像厨师,拥有不同的“厨具”——各种机械手。每种“厨具”有自己的操作策略,不能用一种万能的方式完成所有任务。之前的机器人就像只会用一把刀做所有菜,但现在我们教它认识各种厨具,学会用不同的方法做不同菜。我们还准备了一个大菜谱(数据集),里面有很多示范,告诉它怎样用不同厨具完成任务。通过这些创新,机器人变得更聪明、更灵活,可以应对厨房里各种复杂的菜肴,甚至在新菜谱面前也能快速学会。未来,它还能像厨师一样根据不同的食材和工具,灵活调整做菜策略,变得更像人类厨师一样聪明。

简单解释 像给14岁少年讲一样

想象你在学校的科学实验室里做实验,不同的实验工具(比如烧杯、显微镜、火焰)需要不同的操作方法。以前的机器人就像只会用一种工具,做所有实验都一样,但这样很有限。现在,我们教它认识各种工具,知道用不同的方法完成不同的任务。比如,用烧杯倒水,用显微镜观察细胞,用火焰加热。我们还准备了很多示范视频,告诉它每种工具怎么用,怎么操作。这样,机器人就能根据不同的工具,灵活地完成各种实验任务。它变得更聪明了,也更像一个真正的科学家助手。未来,它还能学习新工具,快速适应新任务,就像我们在学校学新技能一样,变得越来越厉害!

原文摘要

Vision language action models (VLAs) have advanced general purpose robotic grasping and manipulation by enabling robots to interpret visual observations and natural language instructions to generate executable action sequences. However, existing VLAs often implicitly assume gripper invariance, despite grasping strategies being inherently embodiment-dependent. Different gripper types, such as parallel-jaw and suction, usually require distinct interaction strategies to achieve the same grasping objective. Moreover, current datasets for VLAs predominantly rely on parallel-jaw grippers, limiting gripper-aware learning. To address this gap, we introduce MiGA, a multi-gripper-aware dataset spanning five distinct gripper types across multiple robots with 103,000 demonstrations, explicitly capturing strategy divergence under shared task objectives. We further propose GVLA, which combines a new multi-gripper tokenizer with adapter-based policy routing. Our new gripper encoding induces structured embedding information that balances parameter sharing and strategy differentiation, while layer-wise probing confirms meaningful gripper-conditioned representations for VLAs. Intensive experiments in both simulation and real-world robots show that our GVLA outperforms the current baselines across evaluated settings. Our method also improves zero-shot generalization or few-shot adaptation to new objects or unseen tasks, and enable more efficient gripper adaptation.

cs.RO