ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining

TL;DR

ACE-EGO-0通过空间、结构和时间对齐,将人类和机器人数据统一用于VLA预训练,显著提升操控性能。

cs.RO 🔴 高级 2026-06-16 45 次浏览
Hao Li Ganlong Zhao Yufei Liu Haotian Hou Guoquan Ye Tongyan Fang Chunxiao Liu Siyuan Huang Jianbo Liu Xiaogang Wang Hongsheng Li
机器人学习 多模态预训练 虚拟与现实迁移 伪标签 多源数据整合

核心发现

方法论

ACE-EGO-0提出一种统一动作表示,通过空间(相机坐标系)、结构(形态条件)和时间(动作块)三维对齐,融合异质机器人和人类视频数据。采用伪动作生成管线,将原始人类视频转化为机器人格式的伪动作轨迹,并引入可靠性感知的训练目标,利用人类伪标签中的可靠信号进行辅助学习。模型在6千小时多源数据基础上训练,结合真实机器人和模拟数据,有效缓解了数据异质性和标签噪声问题。

关键结果

  • 在RoboCasa GR1桌面任务中,成功率达72.8%,优于现有方法10%以上。在RoboTwin 2.0的Easy/Hard分割中,成功率分别达到91.12%和90.62%。在真实双手操控任务中表现出强大迁移能力,显著优于基线模型。
  • 引入伪动作标签后,模型在多任务、多场景下的泛化能力增强,特别是在复杂环境和长时序任务中表现优异。可靠性感知机制有效降低噪声干扰,提高训练稳定性。
  • 消融实验显示空间、结构和时间对齐机制均对性能提升关键,伪标签的质量控制和多源融合策略显著改善了预训练效果。

研究意义

该研究突破了机器人多源数据融合的瓶颈,提出的统一表示和可靠性机制,为机器人自主学习提供了新范式。通过整合大规模人类视频和机器人数据,显著提升了机器人在复杂环境中的操控能力,推动了虚拟到现实的迁移研究,为未来通用机器人系统的开发奠定基础。

技术贡献

技术创新在于提出空间、结构和时间三维对齐的统一动作表示,结合伪标签生成和可靠性感知机制,有效缓解异质数据带来的标签噪声和表示不一致问题。模型采用多源融合策略,增强了预训练的泛化能力和迁移性,为多模态机器人学习提供了新工具。

新颖性

首次系统性将大规模人类伪动作视频与机器人真实数据融合,提出空间-结构-时间三维对齐方案,解决异质数据的表征和标签质量问题,显著优于现有跨源预训练方法。

局限性

  • 伪动作生成依赖于手部重建和动作估计的准确性,可能在遮挡或复杂背景下出现偏差,影响标签质量。
  • 模型在极端长时序任务和极端复杂环境中的表现仍有限,未来需增强模型的鲁棒性和推理能力。
  • 训练成本较高,尤其是在多源大规模数据处理和模型优化方面,需进一步提升效率。

未来方向

未来将探索更高效的伪标签生成技术,结合自监督和强化学习提升标签质量。还计划扩展多模态信息融合,如语音和触觉,增强模型的感知能力。此外,将研究模型在更广泛实际场景中的适应性和自主性,推动机器人向通用智能方向发展。

AI 总览摘要

随着机器人应用场景的不断扩展,如何实现多源、多模态数据的高效融合,成为推动机器人自主学习的关键。传统方法受限于数据采集成本和多样性不足,难以满足复杂任务的需求。为此,ACE-EGO-0提出一种创新框架,将大规模的人类伪动作视频与机器人真实数据结合,通过空间、结构和时间的三重对齐,统一动作表示,极大缓解了异质数据带来的表征和标签噪声问题。

该方法利用伪动作生成管线,将原始人类视频转化为机器人格式的伪动作轨迹,并引入可靠性感知机制,有效筛选高质量信号,提升训练效果。在6千小时多源数据基础上,模型在多个机器人操控任务中实现了优异性能,成功率超越现有技术10%以上,特别是在复杂环境和长时序任务中表现出强大迁移能力。

实验结果显示,空间、结构和时间的多维对齐机制是提升模型性能的关键。该研究不仅推动了机器人多源数据融合的技术边界,也为未来通用机器人系统的自主学习提供了重要思路。未来,将继续优化伪标签生成和多模态融合技术,推动机器人在现实世界中的自主适应和智能化发展。

深度分析

研究背景

机器人学习近年来经历从任务特定模仿到通用自主系统的演变,代表性工作如RT-1、RT-2、OpenVLA等推动了大规模数据驱动的预训练策略。尽管如此,异质数据的表征差异和标签噪声成为瓶颈,限制了模型的泛化能力。人类视频作为廉价且丰富的补充资源逐渐受到关注,但其伪标签的噪声和多源融合难题仍未解决。

核心问题

核心问题在于如何高效融合异质的机器人和人类数据,克服空间、结构和时间上的差异,以及伪标签的噪声干扰。传统方法多依赖单一数据源或简单融合策略,难以实现跨源信息的充分利用。解决这一问题对于提升机器人自主能力和迁移性具有重要意义,但技术难点在于多模态对齐和标签质量控制。

核心创新

本研究提出空间-结构-时间三维对齐的统一动作表示,解决多源数据的异质性。引入伪动作生成管线,结合可靠性感知机制,有效过滤噪声,提升标签质量。模型采用多源融合策略,结合形态条件和时间对齐,增强模型的泛化能力。创新点在于系统性整合大规模人类伪动作和机器人数据,突破了现有技术的局限。

方法详解

  • �� 构建空间对齐:将机器人和人类动作投影到相机坐标系,避免复杂的空间变换。
  • �� 结构对齐:引入形态条件,将不同机器人和人类手部结构映射到共享的形态空间。
  • �� 时间对齐:采用物理时间尺度定义动作块,确保不同控制频率的数据在时间上的一致性。
  • �� 伪标签生成:利用手部重建和动作估计,将人类视频转化为伪动作轨迹。
  • �� 可靠性感知:根据标签噪声和追踪稳定性动态调整伪标签的权重。
  • �� 多源融合:结合真实机器人、模拟和伪动作数据,进行联合预训练。

实验设计

采用6千小时多源数据,包括机器人示范、模拟和大规模人类视频伪标签。在RoboCasa和RoboTwin 2.0等基准上进行评估,比较不同对齐机制和噪声控制策略的效果。设置消融实验验证空间、结构和时间对齐的重要性。指标包括成功率、迁移性能和泛化能力,采用标准的任务成功率和平均成功率作为评价指标。

结果分析

模型在RoboCasa GR1桌面任务中成功率达72.8%,优于基线10%以上。在RoboTwin 2.0的Easy和Hard分割中,成功率分别达到91.12%和90.62%。在真实双手操控任务中表现出优异的迁移能力,验证了多源融合和伪标签机制的有效性。消融实验显示空间、结构和时间对齐机制对性能提升贡献显著,伪标签质量控制提升训练稳定性。

应用场景

该方法适用于机器人自主学习、复杂环境操控、多任务迁移等场景。通过大规模伪标签和多源数据融合,提升机器人在实际环境中的适应性和自主性。未来可结合自然语言指令和多模态信息,推动机器人实现更智能的自主操作,广泛应用于工业、家庭和服务机器人领域。

局限与展望

伪标签生成依赖于手部重建和动作估计的准确性,可能在遮挡或复杂背景下出现偏差,影响标签质量。模型在极端长时序和复杂环境中的表现仍有限,需增强鲁棒性。训练成本较高,未来需优化数据处理和模型效率,提升实际应用的可行性。

通俗解读 非专业人士也能看懂

想象你在厨房里准备一顿大餐。你有不同的厨具、不同的食材、不同的菜谱,有些是你熟悉的,有些是新学的。为了做出美味的菜肴,你需要把这些不同的工具和食材都放在一个统一的操作平台上,按照一定的顺序和时间安排。有人帮你把复杂的动作拆分成简单的步骤,有的步骤你很确定,有的步骤可能有点不准。这个过程就像ACE-EGO-0,把各种不同的厨房工具和菜谱整理成一个统一的操作流程,确保每个步骤都能顺利完成,最终做出美味佳肴。

简单解释 像给14岁少年讲一样

想象你在学校的科学实验室里做实验。有时候,你用的是老师给的实验器材,有时候是自己带来的不同设备。为了让实验顺利进行,你需要把这些不同的设备和操作步骤整理成一个统一的流程。比如,老师的设备用特定的方式操作,你的朋友用另一种方法,但你们都要达到相同的实验目的。这个过程就像ACE-EGO-0,它把不同的机器人和人类操作方式变成一样的语言,让它们都能理解和合作。这样,机器人就能像人一样学会做很多复杂的事情,无论是在实验室还是在家里,都能帮你完成任务。

术语表

伪动作 (Pseudo-action)

由人类视频通过动作重建和估计生成的近似机器人动作轨迹,用于辅助机器人学习。

在论文中,伪动作作为人类视频的监督信号,用于弥补真实机器人数据的不足。

空间对齐 (Spatial alignment)

将不同数据源的动作投影到统一的相机坐标系中,消除空间上的差异。

确保人类和机器人动作在同一空间框架下进行比较和学习。

结构对齐 (Structural alignment)

通过形态条件,将不同机器人和人类手部结构映射到共享的形态空间。

解决不同形态结构带来的动作表示差异。

时间对齐 (Time-aligned chunking)

以物理时间尺度定义动作块,确保不同控制频率数据的时间一致性。

避免不同数据源在时间尺度上的偏差影响训练。

可靠性感知 (Reliability-aware)

根据标签噪声和追踪稳定性动态调整伪标签的权重,提升训练质量。

用以筛选高质量的伪动作信号,减少噪声干扰。

开放问题 这项研究留下的未解疑问

  • 1 尽管提出了空间、结构和时间的多维对齐方案,但在极端复杂环境或极端长时任务中的表现仍需验证,未来需研究模型的鲁棒性和泛化能力。
  • 2 伪动作生成依赖于手部重建和动作估计的准确性,遮挡和背景复杂时的偏差仍是挑战,如何提升伪标签的精度是未来方向。
  • 3 模型训练成本较高,特别是在多源大规模数据处理和优化方面,如何提升效率和降低计算资源需求仍待解决。

应用场景

近期应用

机器人自主操控

利用ACE-EGO-0的多源融合能力,提升机器人在复杂环境中的自主操作能力,适用于工业自动化、家庭服务等场景。

迁移学习平台

为机器人提供从虚拟到现实的迁移基础,减少实际部署中的调试成本,加快新任务适应速度。

远期愿景

通用机器人自主系统

结合多模态感知和自主决策,推动机器人实现更广泛的自主学习和适应能力,逐步接近人类水平。

原文摘要

Vision-Language-Action (VLA) models benefit from large-scale and diverse embodied data, yet scaling robot trajectory collection is costly and labor-intensive. Recent advances show that large-scale egocentric human videos provide complementary real-world supervision in pretraining. However, joint training on human and robot data remains challenging due to divergences in action spaces, embodiment structures, temporal dynamics, and supervision quality. We introduce ACE-EGO-0, a unified VLA pretraining framework jointly leveraging heterogeneous data sources. To extract large-scale pretraining supervision from egocentric human videos, we build a scalable egocentric video-to-action pipeline that converts raw human videos into robot-format pseudo-action trajectories. To make these labels comparable with robot demonstrations, ACE-EGO-0 uses a unified action representation based on camera-space actions, morphology conditioning, and time-aligned action chunking. To robustly leverage noisy pseudo-action supervision from egocentric human videos, we formulate a reliability-aware training objective with a human auxiliary loss that concentrates supervision on reliable signals. We instantiate ACE-EGO-0 on 4.53K hours of robot and simulation data, together with 1.48K hours of pseudo-action-labeled egocentric human data. Experiments show that incorporating large-scale human supervision under reliability-aware weighting consistently improves both unified joint pretraining and supervised fine-tuning. ACE-EGO-0 achieves state-of-the-art performance on RoboCasa GR1 TableTop and RoboTwin 2.0, while demonstrating strong transfer to real-world bimanual manipulation.

cs.RO