Wh0: Generative World Models as Scalable Sources of Egocentric Human Hand Manipulation Data

TL;DR

Wh0框架利用生成视频世界模型生成50k集人手操作数据,将VLA模型零样本成功率提升至38.9%。

cs.RO 🔴 高级 2026-06-21 33 次浏览
Yangtao Chen Zixuan Chen Peiyang Wang Yong-Lu Li Jing Huo Jieqi Shi Yang Gao
生成模型 人机交互 机器人操作 数据集 零样本学习

核心发现

方法论

Wh0框架利用生成视频世界模型生成WM-H数据集,包含50k集以语言、物体和场景为条件的人手操作视频。通过手部运动重建和视觉编辑,将生成的视频转化为机器人可训练的监督数据,并与少量真实机器人数据共同训练,适应灵巧操作。

关键结果

  • Wh0在18项真实灵巧操作任务中,将未见任务的零样本成功率从8.3%提升至38.9%。
  • 消融研究表明,规模化生成和场景/体现对齐是性能提升的关键。
  • WM-H数据集通过生成视频模型提供多样化的人手操作视频,显著提高了VLA模型的泛化能力。

研究意义

Wh0框架通过生成视频世界模型,提供了灵巧操作所需的可扩展且可控的人手操作数据源。该研究解决了现有数据源在规模与场景/体现对齐之间的权衡问题,为灵巧操作模型的部署提供了新的数据支持。

技术贡献

Wh0框架通过生成视频世界模型,首次实现了大规模人手操作数据的生成。其核心贡献在于将生成的视频转化为机器人可训练的监督数据,并通过与少量真实机器人数据的共同训练,提升了VLA模型的操作能力。

新颖性

Wh0是首个利用生成视频世界模型大规模生成人手操作数据的框架。与现有方法不同,Wh0不仅关注数据的生成规模,还强调场景和体现的对齐,以提升模型的实际部署能力。

局限性

  • 生成视频的质量可能影响模型的训练效果,尤其是在长时间视频中可能出现不一致性。
  • 手部重建的准确性受限于视频生成的质量,可能导致监督数据的噪声。
  • 对强预训练的依赖性限制了Wh0在无预训练模型情况下的适用性。

未来方向

未来研究可以探索Wh0在双手操作、工具使用和长时间任务中的应用。此外,改进视频生成质量和手部重建精度也是重要方向。

AI 总览摘要

Wh0框架通过生成视频世界模型,提供了大规模且可控的人手操作数据源,解决了现有数据源在规模与场景/体现对齐之间的权衡问题。通过生成50k集以语言、物体和场景为条件的人手操作视频,Wh0将这些视频转化为机器人可训练的监督数据,并与少量真实机器人数据共同训练,适应灵巧操作。

在18项真实灵巧操作任务中,Wh0将未见任务的零样本成功率从8.3%提升至38.9%。消融研究表明,规模化生成和场景/体现对齐是性能提升的关键。WM-H数据集通过生成视频模型提供多样化的人手操作视频,显著提高了VLA模型的泛化能力。

尽管Wh0在灵巧操作数据生成上取得了显著进展,但其生成视频的质量和手部重建的准确性仍需改进。此外,Wh0对强预训练的依赖性限制了其在无预训练模型情况下的适用性。未来研究可以探索Wh0在双手操作、工具使用和长时间任务中的应用。

深度分析

研究背景

灵巧操作需要在物体、场景和任务之间进行泛化。现有数据源在规模与场景/体现对齐之间存在权衡:远程操作数据与机器人部署高度对齐但收集成本高;模拟数据可扩展但存在模拟到现实的差距;真实自我中心视频可有效扩展但与机器人部署不对齐。

核心问题

现有数据源在规模与场景/体现对齐之间存在权衡,限制了灵巧操作模型的泛化能力。如何在不依赖大量人工数据收集的情况下,提供可扩展且与部署对齐的数据源,是一个重要挑战。

核心创新

Wh0框架利用生成视频世界模型,首次实现了大规模人手操作数据的生成。通过手部运动重建和视觉编辑,将生成的视频转化为机器人可训练的监督数据,并与少量真实机器人数据共同训练,提升了VLA模型的操作能力。

方法详解

  • �� 使用生成视频世界模型生成WM-H数据集,包含50k集以语言、物体和场景为条件的人手操作视频。
  • �� 通过手部运动重建和视觉编辑,将生成的视频转化为机器人可训练的监督数据。
  • �� 与少量真实机器人数据共同训练,适应灵巧操作。

实验设计

在Unitree G1人形机器人上进行实验,评估Wh0在18项真实灵巧操作任务中的表现。实验使用WM-H数据集和400个真实机器人演示数据进行训练,比较不同预训练源和适应数据的效果。

结果分析

Wh0在18项真实灵巧操作任务中,将未见任务的零样本成功率从8.3%提升至38.9%。消融研究表明,规模化生成和场景/体现对齐是性能提升的关键。

应用场景

Wh0框架可用于灵巧操作模型的训练,特别是在需要大规模且与部署对齐的数据源的场景中。其生成的视频数据可用于提升模型的泛化能力。

局限与展望

生成视频的质量可能影响模型的训练效果,尤其是在长时间视频中可能出现不一致性。手部重建的准确性受限于视频生成的质量,可能导致监督数据的噪声。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,需要用手拿起各种工具和食材。Wh0就像一个虚拟厨房助手,它能生成大量关于如何用手操作这些工具和食材的视频。这些视频不仅展示了如何拿起和放下物品,还展示了如何在不同的厨房环境中进行操作。通过观看这些视频,机器人就像学习了如何在真实厨房中工作一样。这个过程就像是给机器人提供了一个虚拟的实习机会,让它在进入真正的厨房之前,先在虚拟环境中练习。

简单解释 像给14岁少年讲一样

想象一下,你在玩一个超级酷的虚拟现实游戏,游戏里你可以用手去拿各种东西,比如杯子、书本、甚至是机器人手臂!Wh0就像是游戏里的一个超级智能助手,它能生成很多关于如何用手操作这些东西的视频。通过这些视频,机器人就能学会如何在现实世界中完成这些任务,就像你在游戏中一样灵活!是不是很酷?

术语表

生成视频世界模型

一种用于生成虚拟环境中视频数据的模型,能够根据输入条件生成多样化的视频。

Wh0利用生成视频世界模型生成WM-H数据集。

VLA模型

视觉-语言-动作模型,结合视觉和语言信息进行机器人控制。

Wh0通过生成数据提升了VLA模型的操作能力。

手部运动重建

从视频中提取三维手部运动信息,用于训练机器人模型。

Wh0利用手部运动重建将视频转化为可训练数据。

零样本学习

在未见过的任务或数据上进行学习和推断的能力。

Wh0显著提升了VLA模型的零样本学习能力。

消融研究

通过去除模型的某些部分来分析其对整体性能的影响。

消融研究表明,规模化生成和场景/体现对齐是性能提升的关键。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升生成视频的质量,尤其是在长时间任务中的一致性。
  • 2 如何在无预训练模型的情况下,充分利用Wh0生成的数据。

应用场景

近期应用

机器人操作训练

Wh0生成的数据可用于训练灵巧操作机器人,提升其在真实环境中的操作能力。

远期愿景

智能助手开发

Wh0的技术可用于开发更智能的虚拟助手,帮助人们在复杂环境中完成任务。

原文摘要

Scaling dexterous manipulation requires generalization across objects, scenes, and tasks, yet existing data sources face a trade-off between scale and scene/embodiment alignment: teleoperation data is well aligned with robot deployment but expensive to collect; simulation is scalable but limited by the sim-to-real gap; and real egocentric videos scale effectively but remain misaligned with robot deployment. We propose Wh0, a framework that uses generative video world models as scalable and controllable sources of egocentric human-hand manipulation data to unlock the manipulation capabilities of pretrained dexterous VLA models. Conditioned on language, objects, and scenes, Wh0 uses a generative world model to produce WM-H, a 50k-episode dataset of egocentric human-object interaction videos. Wh0 then converts the generated videos into robot-trainable supervision through hand motion reconstruction and visual editing. Co-trained with a limited amount of real robot data, WM-H adapts pretrained VLA models to dexterous manipulation deployment. Across 18 real-world dexterous manipulation tasks, compared with a model post-trained only on robot data, Wh0 improves zero-shot success on unseen tasks from 8.3% to 38.9%. Ablation studies further show that scalable generation and scene/embodiment alignment are key drivers of performance gains. Videos and open-source code can be found on our project website: https://chenyt31.github.io/wh0.github.io/.

cs.RO