AgenticFocus: Object-Preserving Mixed Reality Synthesis from Human FPV Video for Dexterous Humanoid Learning

TL;DR

AgenticFocus将人类第一视角视频转化为机器人可训练演示,SPARC得分为-5.18。

cs.RO 🔴 高级 2026-07-10 35 次浏览
Iaroslav Kolomiets Miguel Altamirano Cabrera Artem Lykov Jeffrin Sam Dmitrii Iarchuk Yara Mahmoud Daniia Zinniatullina Mikhail Konenkov Dzmitry Tsetserukou
混合现实 人机交互 机器人学习 视觉动作 数据转换

核心发现

方法论

AgenticFocus通过混合现实合成管道,将普通的人类第一视角视频转化为机器人可训练的演示。该方法包括恢复被遮挡的物体几何形状、重建完整的手部运动,并通过相机相对对齐和分层合成将其重新定位到类人化身上。最终的数据集将聚焦的视觉观察与同步的机器人动作和状态配对。

关键结果

  • AgenticFocus在轨迹误差和手腕运动平滑度方面优于跨化身基线,SPARC得分为-5.18,而Masquerade和Do as I Do分别为-5.56和-6.05。
  • 通过相机相对对齐和全手重定向,AgenticFocus在空间匹配方面优于基线人机转移管道。
  • 实验显示AgenticFocus在75个验证集中的SPARC值最不负,表明其在手腕运动的平滑度上具有优势。

研究意义

AgenticFocus通过将普通人类视频转化为机器人可训练的监督数据,降低了类人机器人操作的数据壁垒。该方法无需专用捕捉硬件,适用于家庭、日常物品处理、辅助和服务机器人等领域。它为机器人学习研究和教育提供了可访问的数据源,并促进了具身AI社区的规模化、无硬件收集的操作演示。

技术贡献

AgenticFocus在技术上通过混合现实合成、全手跨化身重定向和分层合成策略,实现了与现有方法的根本区别。它提供了新的工程可能性,特别是在无需专用硬件的情况下,生成适合训练的视觉动作数据。

新颖性

AgenticFocus首次将普通人类视频转化为类人机器人可用的视觉动作监督。与现有方法相比,它通过相机相对对齐和全手重定向,解决了空间匹配和运动平滑度的问题。

局限性

  • 在复杂场景中,物体遮挡和运动模糊可能导致重建不准确。
  • 需要高质量的输入视频以确保输出的准确性。

未来方向

未来的工作方向包括扩展到更多的化身和场景,以及在下游策略训练中的应用。

AI 总览摘要

AgenticFocus通过混合现实合成管道,将普通的人类第一视角视频转化为机器人可训练的演示。现有方法在处理手物体遮挡、运动简化或需要专用捕捉硬件时存在困难,而AgenticFocus通过恢复被遮挡的物体几何形状、重建完整的手部运动,并通过相机相对对齐和分层合成将其重新定位到类人化身上。实验结果显示,AgenticFocus在轨迹误差和手腕运动平滑度方面优于跨化身基线,SPARC得分为-5.18,而Masquerade和Do as I Do分别为-5.56和-6.05。

这种方法的意义在于,它降低了类人机器人操作的数据壁垒,适用于家庭、日常物品处理、辅助和服务机器人等领域。因为它不需要专用捕捉硬件,AgenticFocus为机器人学习研究和教育提供了可访问的数据源,并促进了具身AI社区的规模化、无硬件收集的操作演示。

然而,AgenticFocus在复杂场景中可能面临物体遮挡和运动模糊导致的重建不准确问题。未来的工作方向包括扩展到更多的化身和场景,以及在下游策略训练中的应用。

深度分析

研究背景

近年来,物理AI的进步使得对更好监督的需求变得更加明显。尽管视觉-语言-动作政策依赖于大量的机器人可用视觉和动作数据,但对于灵巧的类人机器人来说,这种数据仍然难以获取。现有方法如DexCap和EgoDex展示了使用专用硬件收集高质量监督的价值,但这些方法仍然依赖于复杂的捕捉系统或场景特定的重建。

核心问题

将人类视频转化为机器人数据需要解决三个主要问题:视角差距、交互区域差距和动作基础差距。人类演示通常是从头部或胸部安装的相机捕获的,而类人机器人观察则是从机器人中心框架定义的。此外,手部经常遮挡操作对象,传统的演员移除或生成编辑在这些区域常常失败。

核心创新

AgenticFocus通过混合现实合成管道解决了这些问题。首先,它识别并跟踪任务相关的对象,并在去除人类后恢复稳定的对象模板。其次,它重建完整的手部运动,并通过相机相对框架将其重新定位到类人化身上。最后,通过分层渲染合成恢复的场景和重新定位的机器人,提供视觉稳定的交互。

方法详解

  • �� 识别并跟踪任务相关对象,使用SAM风格的分割模型。 • 去除人类演员,使用E2FGVI-HQ重建背景。 • 重建完整手部运动,使用WiLoR/HaMeR模块。 • 通过相机相对框架将运动重新定位到类人化身上。 • 分层渲染合成恢复的场景和重新定位的机器人。

实验设计

实验使用EPIC-KITCHENS等数据集,标准化为30 FPS。与Masquerade和Do as I Do进行比较,所有轨迹在相同坐标系中重新采样。评估指标包括3D位置误差和SPARC值。

结果分析

AgenticFocus在轨迹误差和手腕运动平滑度方面优于基线,SPARC得分为-5.18。实验结果显示,AgenticFocus在75个验证集中的SPARC值最不负,表明其在手腕运动的平滑度上具有优势。

应用场景

AgenticFocus适用于家庭、日常物品处理、辅助和服务机器人等领域。它为机器人学习研究和教育提供了可访问的数据源,促进了具身AI社区的规模化、无硬件收集的操作演示。

局限与展望

在复杂场景中,物体遮挡和运动模糊可能导致重建不准确。需要高质量的输入视频以确保输出的准确性。未来的工作方向包括扩展到更多的化身和场景,以及在下游策略训练中的应用。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你戴着一副特殊的眼镜,可以记录下你的一举一动。AgenticFocus就像一个聪明的助手,它可以把这些视频转化为机器人可以学习的教程。它会去掉你的视频中的手,只留下你操作的物体,然后用机器人的手来代替你的手。这样,机器人就能学会如何像你一样做饭,而不需要你一直指导。

简单解释 像给14岁少年讲一样

想象一下你在玩一个超级酷的游戏,你的任务是教一个机器人如何像你一样做事情。AgenticFocus就像一个魔法工具,它可以把你在游戏中的动作录下来,然后把你的手换成机器人的手。这样,机器人就能学会你的动作,而不需要你一直在旁边指导。是不是很酷?

术语表

混合现实 (Mixed Reality)

混合现实是一种技术,它结合了真实世界和虚拟世界的元素,创建出一种新的环境。

在本文中,用于将人类视频转化为机器人可用的演示。

SPARC

SPARC是一种度量运动平滑度的指标,数值越小表示运动越平滑。

用于评估AgenticFocus生成的机器人运动轨迹的平滑度。

相机相对对齐 (Camera-Relative Alignment)

一种将人类运动重新定位到机器人化身的技术,保持运动的空间一致性。

用于解决人类视频与机器人观察之间的视角差距。

分层合成 (Layered Compositing)

一种合成技术,通过分层渲染来保持交互区域的深度线索。

用于在合成机器人演示时保持视觉稳定性。

EPIC-KITCHENS

一个大型的第一视角视频数据集,记录了厨房中的日常活动。

用于评估AgenticFocus的实验数据集之一。

开放问题 这项研究留下的未解疑问

  • 1 如何在复杂场景中准确重建被遮挡的物体几何形状?现有方法在处理复杂遮挡时可能不够准确。
  • 2 如何在低质量视频中保持输出的准确性?
  • 3 如何扩展AgenticFocus以适应更多的化身和场景?

应用场景

近期应用

家庭机器人

AgenticFocus可以帮助家庭机器人学习处理日常物品,如洗碗、整理物品等。

辅助机器人

在医疗和老年护理中,AgenticFocus可以帮助机器人学习复杂的护理任务。

远期愿景

教育与研究

AgenticFocus可以作为机器人学习研究和教育的工具,提供可访问的数据源。

原文摘要

Human egocentric video is a scalable supervision source for humanoid policy learning, but current pipelines struggle with hand-object occlusion, oversimplified motion, or specialized capture hardware. We introduce AgenticFocus, a Mixed Reality synthesis pipeline that converts ordinary first-person-view human videos into robot-trainable demonstrations by restoring occluded object geometry, reconstructing full-hand motion, and retargeting it to a humanoid embodiment through camera-relative alignment and layered compositing. The resulting dataset pairs focused visual observations with synchronized robot actions and states. AgenticFocus achieves lower trajectory error and smoother wrist motion than cross-embodiment baselines, with SPARC scores of -5.18 versus -5.56 and -6.05.

cs.RO