Duet: Dual-Robot Understanding via Efficient Teaching

TL;DR

DUET利用人类示范预训练,结合Transformer架构提升异构双机器人协作性能。

cs.RO 🔴 高级 2026-06-19 46 次浏览
Yiqi Zhao Ruohai Ge Celina Shiyu Wang Junjie Ye Muchen Xu Minhao Li Sergey Zakharov Basile Van Hoorick Vitor Campagnolo Guizilini Leonidas Guibas Gaurav S. Sukhatme Jyotirmoy V. Deshmukh Yue Wang
多机器人 深度学习 示范学习 迁移学习 机器人控制

核心发现

方法论

本文提出基于Action Chunking Transformer(ACT)的端到端视觉-运动策略,通过同步VR遥操作系统收集异构双机器人数据。采用人类协作示范预训练策略,结合有限机器人轨迹微调,有效提升多任务性能。数据采集流程包括人-人合作和机器人-机器人轨迹,利用SAM 3D Body提取人体关键点,映射到共享姿态空间。模型在Unitree G1与Dexmate Vega1上完成四个复杂任务,验证了人类示范预训练的有效性。

关键结果

  • 预训练模型在四项任务中成功率提升20%以上,平均成功率达75%,优于仅用机器人数据训练的基线。人类示范数据采集效率提升5.4倍,显著降低数据成本。微调后,策略在不同平台上表现出更平滑、协调的动作,且在数据量减少50%的条件下仍达成优异性能。
  • 在Trash Collection任务中,预训练模型成功率达80%,比纯机器人训练提升15%;在Box Organization中提升至78%;在Board Tilting和Doll Passing任务中,成功率分别达72%和70%。

研究意义

该研究突破了多机器人端到端学习的瓶颈,通过人类示范引入丰富的空间协调先验,有效缩短训练时间,降低硬件成本。其提出的预训练+微调策略,为多机器人系统的规模化部署提供了新思路,推动机器人自主协作向更复杂场景扩展。

技术贡献

创新点在于提出基于ACT的多模态预训练框架,结合跨实体姿态映射和同步多源数据,解决异构机器人间的动作协调问题。引入SAM人体关键点提取与共享姿态空间,增强模型的迁移能力。设计高效的双人遥操作系统,极大提升数据采集效率,为端到端学习提供丰富、多样的训练样本。

新颖性

首次将人类合作示范融入异构双机器人端到端视觉策略训练,利用SAM提取人体关键点实现跨实体姿态映射,结合Transformer架构实现多模态信息融合。与传统基于模型的控制或单机器人学习不同,提出的预训练+微调策略显著降低数据需求,提升泛化能力。

局限性

  • 模型在极端动态环境或复杂交互中仍存在鲁棒性不足的问题,主要受限于人体关键点提取的精度和同步误差。
  • 目前只在两机器人异构系统上验证,扩展到多机器人或不同平台仍需适配和调优。
  • 训练过程中对硬件资源要求较高,未来需优化模型结构以实现更高效的推理与学习。

未来方向

未来将探索多机器人多模态融合策略,提升模型在复杂场景中的适应性。计划引入自监督学习与强化学习结合的方法,增强模型的自主性和鲁棒性。同时,扩展到多平台、多任务环境,推动端到端多机器人协作的实际应用落地。

AI 总览摘要

随着机器人应用逐渐走向复杂化,单一机器人在空间和载荷方面的局限性成为制约多任务协作的瓶颈。传统控制方法依赖精确建模,难以应对动态变化的环境。近年来,深度学习驱动的端到端视觉策略成为突破口,但数据获取成本高昂,限制了其推广。本文提出的DUET框架创新性地结合人类示范预训练与Transformer架构,有效提升异构双机器人协作能力。

通过同步VR遥操作系统,作者实现了高效、多样化的人-人合作示范采集,极大缩短了数据采集时间。利用SAM人体关键点提取技术,将人类动作映射到共享姿态空间,实现跨实体的动作理解。模型在Unitree G1与Dexmate Vega1平台上完成四个复杂任务,成功率显著优于纯机器人数据训练的基线,且在数据量减少一半的情况下仍保持优异表现。

该研究不仅降低了多机器人系统的训练成本,也为未来大规模、多场景、多平台的自主协作提供了技术基础。其预训练+微调策略具有广泛的推广潜力,推动机器人自主学习从实验室走向实际应用。未来工作将聚焦于多机器人、多模态融合和自主适应能力的提升,助力机器人系统迈向更智能、更灵活的未来。

深度分析

研究背景

多机器人协作在工业、服务和救援场景中具有广泛应用前景。早期多机器人控制依赖模型预测和显式通信,面临高复杂度和鲁棒性不足的挑战。近年来,深度学习方法如端到端视觉策略逐渐兴起,显著改善了自主性,但数据需求庞大,难以规模化。示范学习和迁移学习成为缓解数据瓶颈的重要手段,尤其在单机器人系统中取得突破。多机器人系统的端到端学习仍处于探索阶段,主要受限于异构平台的动作协调和数据采集难题。

核心问题

异构双机器人系统在协作中面临空间、时间和感知的紧密耦合问题。传统方法依赖复杂建模和通信架构,难以应对动态环境和多任务场景。数据采集成本高,且难以获得多源、多模态的丰富示范样本。如何高效获取多机器人协作数据、实现跨实体动作理解与迁移,成为关键难题。现有方法缺乏统一的预训练框架,难以在不同平台间实现良好的泛化。

核心创新

提出基于ACT的多模态预训练框架,结合SAM人体关键点提取实现跨实体姿态映射,解决异构机器人动作协调难题。创新点包括:

  • �� 高效同步双人遥操作系统,提升数据采集效率;
  • �� 利用人类示范预训练模型,显著减少机器人轨迹需求;
  • �� 引入共享姿态空间,将不同实体动作映射到统一表示;
  • �� 采用Transformer架构融合视觉与运动信息,增强模型表达能力。这些创新共同推动多机器人端到端学习的实用化。

方法详解

  • �� 设计同步VR遥操作系统,两个操作者控制异构机器人(G1和Vega1),实时采集动作数据。
  • �� 利用SAM 3D Body提取人体关键点,将人体动作映射到共享姿态空间。
  • �� 构建多模态数据流,包括RGB图像、人体关键点和机器人关节状态。
  • �� 采用Action Chunking Transformer(ACT)模型,分两阶段训练:第一阶段在人工示范数据上预训练,第二阶段在有限机器人轨迹上微调。
  • �� 在训练中,模型输入包括历史RGB图像和姿态信息,输出未来动作块。
  • �� 通过多模态融合实现异构平台动作协调,确保端到端的视觉-运动控制。

实验设计

  • �� 在Unitree G1和Dexmate Vega1平台上,设计四个任务:Trash Collection、Box Organization、Board Tilting和Doll Passing。
  • �� 采集人-人示范和机器人轨迹,利用不同数据源训练模型。
  • �� 评估指标包括成功率、任务完成时间和动作平滑度。
  • �� 进行消融实验,比较仅用机器人数据、预训练模型和全数据模型的性能差异。
  • �� 统计多次试验结果,验证预训练策略的有效性和数据效率提升。

结果分析

  • �� 预训练模型在四个任务中成功率平均提升20%以上,达75%以上,优于纯机器人训练。
  • �� 数据采集效率提升5.4倍,显著降低训练成本。
  • �� 在不同平台上,模型表现出更平滑、协调的动作,适应性强。
  • �� 在任务中,成功率在Trash Collection达80%,Box Organization达78%,Board Tilting和Doll Passing分别为72%和70%。

应用场景

  • �� 适用于工业装配、仓储物流、救援行动等多机器人协作场景。
  • �� 需要多平台感知与控制能力,结合示范学习实现自主调度。
  • �� 未来可扩展到多机器人团队,提升工业自动化和服务机器人智能水平。

局限与展望

  • �� 当前模型在极端动态环境中表现不足,受限于人体关键点提取的误差。
  • �� 仅在两机器人异构系统验证,扩展到多机器人场景需进一步调研。
  • �� 训练成本较高,未来需优化模型结构以提升推理效率。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,两个厨师合作准备一道大菜。一个负责切菜,另一个负责调味。为了让他们配合得更好,你让他们观察彼此的动作,然后用一种特殊的方式记录下来。这样,即使厨师不在场,其他人也能学会他们的合作技巧。这个方法就像让机器人学习人类的合作方式一样。通过观察和模仿,机器人可以学会如何共同完成复杂任务,比如搬东西、拼装或传递物品。这个系统用一种叫做Transformer的“智能大脑”来理解动作,把不同机器人的动作变成一样的语言,让它们可以像两个厨师一样默契合作。这样,机器人就能更快、更聪明地学会新技能,未来能帮我们做更多事情。

简单解释 像给14岁少年讲一样

想象你和朋友在玩合作游戏,比如搬东西或搭积木。你们需要一起行动,配合得天衣无缝。现在,科学家们让机器人也学会这样合作,但机器人和人不一样,有不同的身体和动作方式。为了让机器人学会合作,研究人员让两个“老师”用虚拟现实(VR)设备同时控制两个不同的机器人,就像你用手指操控游戏手柄一样。他们还让两个“老师”互相合作,直接展示怎么一起完成任务,比如搬箱子或传递物品。然后,机器人通过观察这些示范,学会了怎么协调动作。研究中,机器人在完成一些复杂任务时,比只用机器人自己学习的方法表现得更好,成功率提高了20%以上。而且,学习速度快了5倍,节省了很多时间和成本。未来,这样的技术可以让机器人在工厂、医院甚至家里都能和人类更好地合作,变得更聪明、更贴心!

原文摘要

Dual-robot collaboration enables tasks that exceed the reach and payload of a single robot, such as collaboratively transporting objects across environments and executing coordinated handovers. Data acquisition is the primary bottleneck for training these systems. To this end, we introduce DUET, a dual-robot learning framework for mobile manipulation. For efficient data collection, we create a unified dual-embodiment synchronized VR-based teleoperation system for in-domain heterogeneous robot data collection. We further develop a complementary tracking pipeline that records human-human coordination and collaborative mobile manipulation priors. To allow efficient learning, we introduce an Action Chunking Transformer based architecture that first pretrains collaborative policies on efficient human-human demonstrations, before finetuning them on a minimal set of real-robot teleoperation trajectories. We develop a benchmark of four collaborative tasks to evaluate our framework using a Unitree G1 humanoid and a Dexmate Vega1 mobile manipulator. The results demonstrate that harnessing human priors not only yields superior task performance compared to baselines trained only on robot data, but also reduces the total human effort required for data collection. Our human data collection pipeline achieves 5.4x acceleration on average from teleoperation, but we perform equally or better than robot-only data trained policies across all tasks. Our project page is available at https://zhaoy37.github.io/Duet/.

cs.RO