EgoInfinity: A Web-Scale 4D Hand-Object Interaction Data Engine for Any-View Robot Retargeting and Video-to-Action Robot Learning

TL;DR

提出EgoInfinity,基于模块化架构的Web规模4D手-物体交互数据引擎,实现任意视角机器人重定向与视频到动作学习。

cs.RO 🔴 高级 2026-06-16 42 次浏览
Gaotian Wang Kejia Ren Andrew Morgan Yiting Chen Howard H. Qian Podshara Chanrungmaneekul Kaiyu Hang
机器人学习 计算机视觉 动作理解 多模态感知 自主系统

核心发现

方法论

EgoInfinity采用模块化设计,结合手势估计、目标检测、深度重建、交互校准与运动重定向等关键技术。利用MOGE-2实现相机参数与尺度校准,SAM-3和SAM-3D进行目标检测与重建,结合交互状态分类优化手-物体轨迹。核心创新在于交互感知的轨迹校准和跨模态的尺度一致性,自动从网络视频生成高质量4D手物交互数据。重定向模块通过学习机器人特定根坐标变换,将人类手部运动转化为机器人关节轨迹,支持多机器人平台。该系统无需人工标注,自动处理海量网络视频,生成可用于机器人学习的高精度交互数据。

关键结果

  • 在Perception Fidelity方面,EGOINFINITY在手部轨迹重建误差中实现平均2.86cm,手势识别准确率显著优于现有方法,验证了其在复杂场景中的鲁棒性。
  • 在运动重定向方面,成功将人类手部动作转化为多种机器人(如Unitree G1、NASA Robonaut2)可执行的轨迹,IK成功率超过77%,机器人动作表现符合任务需求。
  • 在实际机器人技能学习中,系统支持抓取、切割、擦拭和倒水等多任务,机器人表现出高效的任务完成率和动作自然度,验证了数据的实用性和泛化能力。

研究意义

该研究突破了从网络视频自动生成机器人交互数据的瓶颈,为开放世界机器人学习提供了大规模、多样化的训练数据源。通过无标注、跨模态的自动化流程,极大降低了数据采集成本,加速了机器人自主学习与适应能力的提升。其跨平台的运动重定向技术,推动了机器人在复杂环境中的应用落地,为未来智能机器人普及奠定基础。

技术贡献

提出模块化的4D数据引擎,结合跨模块的尺度校准与交互感知校正,显著提升重建的物理一致性。创新性地实现了从网络视频到机器人动作的自动转化,突破了传统依赖手工标注和有限数据集的限制。引入的运动重定向网络采用SE(3)-等变架构,支持多机器人平台的运动迁移,增强了系统的通用性和扩展性。

新颖性

首次实现基于网页规模视频的全自动4D手-物体交互数据生成,结合交互感知校准与运动重定向技术,突破了现有方法对数据规模和多样性的限制。区别于传统的静态数据集或有限场景重建,系统实现了跨视角、部分观察条件下的高精度交互重建和机器人运动迁移,为机器人自主学习提供了全新平台。

局限性

  • 系统依赖于静态或近静态摄像头场景,动态视角变化或快速运动可能引入误差。
  • 目标检测和重建在复杂背景或遮挡条件下仍存在不稳定性,影响轨迹精度。
  • 运动重定向在极端关节限制或非标准机器人平台上表现有限,需进一步适配不同机器人模型。

未来方向

未来将结合多视角和动态场景,提升系统鲁棒性;引入深度学习优化的交互状态分类与重建模型;扩展多机器人平台的运动迁移能力,支持更复杂任务的自主学习与协作。

AI 总览摘要

互联网视频作为人类操控行为的丰富源泉,蕴含大量潜在的机器人学习数据,但其转化为可用的机器人训练素材一直面临巨大挑战。传统数据集受限于规模和多样性,难以支持开放环境中的自主学习。为突破这一瓶颈,本文提出EgoInfinity,一种基于模块化架构的Web规模4D手-物体交互数据引擎,自动从网络视频中提取高质量的交互信息。

该系统融合了手势估计、目标检测、深度重建、交互校准与运动重定向等关键技术。通过跨模块的尺度校准和交互感知校正,有效减缓重建漂移和接触不一致的问题,确保物理合理性。核心创新在于利用深度学习模型(如SE(3)-等变网络)实现运动重定向,将人类手部动作转化为多种机器人平台的可执行轨迹,支持多视角、部分观察条件下的动作迁移。

在多个机器人平台(如Unitree G1、NASA Robonaut2)上的实验表明,该方法在IK成功率、动作自然度和任务完成率方面均优于现有技术。系统还支持多任务学习,包括抓取、切割、倒水等,验证了其在实际机器人技能中的应用潜力。这一技术突破为大规模、多样化的机器人自主学习提供了基础,有望推动机器人在复杂环境中的广泛应用。

尽管如此,系统仍面临动态场景适应性不足、遮挡影响和机器人平台多样性限制等挑战。未来工作将聚焦于多视角动态场景的适应性提升、模型鲁棒性增强,以及多机器人协作能力的扩展,推动机器人自主学习迈向更高水平。

深度分析

研究背景

机器人自主操控的研究逐步发展,从早期的有限场景手工标注到近年来深度学习的广泛应用。代表性工作如Ego4D、HOT3D等提供了丰富的人类操控视频,但缺乏可直接用于机器人学习的高质量4D数据。传统方法依赖于手工标注或专用硬件(如运动捕捉、深度传感器),成本高且难以扩展。互联网视频作为潜在大规模数据源,因其多样性和丰富性受到关注,但其未标注、无结构的特性限制了直接利用。近年来,深度学习模型(如SAM、MANO、GEOCALIB)推动了单帧或短片段的手-物体重建,但缺乏系统性整合以实现连续、物理合理的4D交互。

核心问题

核心问题在于如何自动从海量网络视频中提取高质量、物理合理的手-物体交互数据,满足机器人学习的需求。现有方法多依赖人工标注或有限场景,难以扩展到Web规模。视频中的视角变化、遮挡、背景复杂性增加了重建难度,导致轨迹漂移和接触不一致,影响数据的可靠性。缺乏统一的尺度校准和交互感知机制,使得不同模块输出难以融合,限制了数据的实用性和泛化能力。

核心创新

系统创新点包括:1)模块化架构,支持逐步升级与集成;2)跨模块尺度校准,确保手物体在统一物理空间中;3)交互感知的轨迹校正,有效减少漂移和接触错误;4)基于深度学习的运动重定向网络(SE(3)-等变架构),实现多机器人平台的运动迁移。通过自动目标发现、深度重建和运动校准,系统实现了从网络视频到机器人动作的全自动流程,突破了传统数据采集的局限。

方法详解

  • �� 输入:网络视频及文本描述。• 目标检测:SAM-3识别目标区域,SAM-2追踪目标。• 深度估计:FLOW3R预测深度图,GEOCALIB估算重力。• 手部重建:WILOR基于MANO模型估算手势。• 目标重建:SAM-3D生成目标网格,FoundationPose追踪目标6DoF。• 交互校准:结合交互状态分类调整手-物体轨迹。• 运动重定向:SE(3)-等变网络预测机器人根坐标变换,将手部运动转化为机器人关节轨迹。• 运动后处理:IK优化、轨迹平滑。• 输出:高质量4D手-物体交互数据,支持多机器人平台迁移。

实验设计

采用Action100M作为主要数据源,验证系统在感知精度、运动迁移和机器人技能学习中的表现。通过多机器人平台(Unitree G1、Robonaut2、Franka FR3)测试运动重定向效果,评估IK成功率、轨迹误差和任务完成率。还在真实机器人上实现抓取、倒水等任务,验证数据的实用性。对比基线方法,系统在轨迹误差、IK成功率和任务表现上均优显著,表明其在大规模自主学习中的潜力。

结果分析

系统在手部轨迹重建误差中实现平均2.86cm,IK成功率达77%以上。机器人在多任务中表现出高效动作执行,抓取成功率超过85%,倒水和切割任务完成率达90%。在跨平台迁移中,运动重定向支持多机器人动作一致性,验证了其泛化能力。实验还表明,系统能自动处理多样化场景,极大降低了数据采集成本,推动机器人自主学习的规模化。

应用场景

该技术适用于机器人自主学习、任务示范、技能迁移等场景。无需专用硬件或人工标注,便于在工业、服务、家庭等多环境中部署。未来可扩展到多机器人协作、复杂任务学习,推动智能机器人普及,降低研发门槛,提升自主适应能力。

局限与展望

系统在动态场景和快速运动中表现有限,可能引入误差。遮挡和复杂背景影响重建质量。运动重定向在极端关节限制或非标准机器人上效果不足。未来需增强多视角适应性和模型鲁棒性,提升在复杂环境中的表现。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,手拿锅铲,操作各种厨具。现在,如果你想教机器人帮你做饭,就像拍视频一样,把你做菜的每个动作都录下来。这个系统就像一个超级智能的厨师助手,它可以从你的视频中学会你做菜的方法,然后用它自己的“手”在机器人身上模仿。它不需要你告诉它每个步骤,只需要看你怎么操作,就能学会。它还能把你学到的动作转成机器人可以理解的指令,让机器人帮你炒菜、倒水、切菜。这就像你教机器人做菜一样,但它不用你手把手教,只要看视频就能学会,未来机器人会变得越来越聪明,帮你做各种事情。

简单解释 像给14岁少年讲一样

你知道吗?有时候我们拍视频记录自己做事情,比如玩游戏或者做手工,然后想让机器人也能学会这些动作。可是,机器人不能直接看视频就知道怎么做,它需要特别的指令和数据。这个系统就像一个超级厉害的老师,它可以从很多网上的视频里,自动学会人们是怎么用手操作东西的。它会分析视频中的手势、物体位置,还能把这些动作转成机器人可以理解的“语言”。比如,你用手抓苹果,它会把这个动作变成机器人可以用的关节运动指令,然后机器人就能帮你拿苹果、切水果。这个方法不用人工标记,不需要特殊设备,就能从海量视频中学习,未来机器人会变得更聪明,能帮我们做更多事情,比如做饭、打扫、甚至陪玩!

原文摘要

Internet videos constitute the largest reservoir of embodied human manipulation knowledge, yet converting arbitrary RGB footage into actionable robot training data remains a major bottleneck. Existing lab- or factory-collected datasets are narrow in scale and diversity, limiting open-world robot learning. Instead of proposing a static dataset, we introduce EgoInfinity, a universal 4D hand-object interaction data engine that enables web-scale data generation for robot retargeting and learning. EgoInfinity is a modular engine integrating perception, segmentation, reconstruction, interaction-aware refinement, and retargeting to automate this traditionally unscalable video-to-action problem without human-in-the-loop annotation. Its modular design lets the engine continuously benefit from advances in any incorporated component. With EgoInfinity, in-the-wild human manipulation videos are lifted into agent-agnostic, metric 4D hand-object representations, including hand trajectories, 6-DoF object poses, and contact-relevant states. Rather than naively connecting standalone components, EgoInfinity combines cross-module metric calibration with interaction-aware refinement to improve physical reliability, reducing drift and contact inconsistencies common in pure visual reconstruction. We further propose a novel motion retargeter that compiles the recovered 3D hand motions into executable joint trajectories for diverse robot morphologies, enabling video-to-action retargeting on any robot from arbitrary viewpoints and shot sizes (e.g., the human body is only partially visible). We validate EgoInfinity across perception fidelity, kinematic feasibility, contact consistency, cross-embodiment generalization, and real-robot skill acquisition (e.g., grasping, cutting, wiping, and pouring), demonstrating a scalable bridge from internet videos to executable robot behavior for open-world robot learning.

cs.RO