核心发现
方法论
MotionWAM结合视频生成的扩散模型(Video DiT)与运动生成模型(Motion DiT),通过中间去噪特征实现端到端的全身动作预测。采用三阶段训练:第一阶段预训练视频潜在模型以捕获第一人称视角动态;第二阶段在多样化的Unitree G1数据上进行跨形体动作微调;第三阶段利用遥控演示进行端到端微调。模型预测全身运动令牌,涵盖运动、躯干、身高调节、足部交互及手部操作,统一在一个动作空间中。引入流匹配(flow-matching)目标,确保时序一致性和物理合理性。模型在单摄像头输入下实现实时推理,保持4.9Hz频率,满足闭环控制需求。
关键结果
- 在九项真实机器人任务中,MotionWAM成功率平均提升30%以上,最高达45%,显著优于基线方法(如VLA)在复杂全身协调任务中的表现。特别是在腿部主动参与的任务中,成功率从43.9%提升至76.1%,体现了统一动作空间的优势。
- 模型在单次推理中通过中间去噪特征实现实时控制,速度比传统迭代去噪模型快7倍,验证了其在动态平衡和复杂交互中的实用性。
- 逐阶段训练验证了预训练视频模型和跨形体微调的重要性,缺少任何一环都导致性能显著下降,强调了多模态、多形体适应的必要性。
研究意义
该研究突破了WAM在全身 humanoid 控制中的应用瓶颈,将大规模视频预训练引入机器人运动控制,推动机器人自主执行复杂任务的能力向人类水平迈进。模型实现了从桌面操作到全身协调的跨越,为未来智能机器人在复杂环境中的自主导航、交互提供了技术基础。其端到端的设计和实时性能,为工业、服务和救援机器人提供了广阔应用前景,标志着视觉潜在模型在机器人领域的深度融合与创新。
技术贡献
提出统一的全身运动潜在空间,打破传统上下分离的层级控制架构,利用中间去噪特征实现端到端预测。引入三阶段训练策略,有效迁移视频动态到机器人形体,结合流匹配优化确保时序一致性。模型创新性在于结合视频生成模型与运动生成模型,实现全局协调的机器人控制,兼顾运动多样性与物理合理性。此架构为未来基于视觉的机器人自主控制提供新范式。
新颖性
首次将视频潜在扩散模型(Video DiT)与运动潜在模型(Motion DiT)结合,构建实时全身 humanoid 控制系统。不同于以往仅关注手臂或局部动作的模型,MotionWAM实现了全身动作的统一预测,支持复杂任务中的主动足部交互。其三阶段训练策略确保模型在多模态、多形体环境中稳健迁移,突破了WAM在动态平衡和复杂交互中的应用限制。
局限性
- 模型目前仅在Unitree G1平台验证,尚未验证在其他 humanoid 机器人上的迁移能力,存在硬件适应性不足的问题。
- 对未知或超出训练分布的物体和场景表现有限,依赖视觉信息的完整性,容易受视野偏差影响。
- 推理速度虽达实时要求,但在更复杂任务或多机器人系统中可能面临性能瓶颈,需优化模型效率。
未来方向
未来将探索多模态感知融合(如触觉、声学信息),提升模型对环境变化的适应性。计划扩展到多机器人协作场景,增强自主决策能力。同时,优化模型结构以降低计算成本,推动在边缘设备上的部署,促进工业和服务机器人广泛应用。
AI 总览摘要
随着机器人在复杂环境中自主执行任务的需求不断增长,传统的层级控制架构在灵活性和协调性方面逐渐暴露出局限。大部分现有系统将高层策略与低层运动控制分离,限制了腿部等关键部位的主动交互能力,难以实现复杂的全身协调动作。为突破这一瓶颈,本文提出MotionWAM,一种基于视频潜在模型的实时全身 humanoid 控制框架。
MotionWAM结合了视频生成的扩散模型(Video DiT)与运动生成模型(Motion DiT),通过中间去噪特征实现端到端的动作预测。模型在三阶段训练策略下,从大规模第一人称视频预训练到多形体微调,再到遥控演示微调,逐步迁移到目标机器人平台。其核心创新在于统一的全身运动潜在空间,支持包括运动、躯干、身高调节、足部交互和手部操作的多任务控制。
在九项真实机器人任务中,MotionWAM成功率平均提升超过30%,在复杂的平衡与交互任务中表现尤为突出。模型在单次推理中实现4.9Hz的实时控制速度,比传统迭代去噪模型快7倍,验证了其实用性。实验结果显示,模型不仅在性能上优于基线方法,还能实现主动腿部交互,如踢球、踩踏板,展现了全身协调的潜力。
这项工作标志着视觉潜在模型在机器人自主控制中的新突破,为未来工业、服务和救援机器人提供了强大技术支撑。尽管目前仍存在硬件适应性和复杂场景表现的挑战,未来通过多模态融合和模型优化,有望实现更广泛的应用场景,推动机器人智能化迈向新高度。
深度分析
研究背景
机器人运动控制从早期的手臂操作逐步发展到全身协调,代表性工作包括Ji等的Exbody2、Luo等的Sonic系统,以及基于模仿学习和视觉语言的策略。传统方法多采用分层架构,将高层策略与低层运动控制分离,限制了复杂交互能力。近年来,视频潜在模型(如DreamFusion、Cosmos-Predict)在生成连续动态方面取得突破,为机器人赋予了强大的动态预测能力,但多为静态或局部动作,难以实现全身协调。现有WAM主要应用于桌面机械臂,缺乏实时全身控制能力,限制了其在动态平衡和复杂交互中的应用潜力。
核心问题
当前机器人全身控制多依赖层级式架构,腿部动作受限于低级控制器,难以实现主动交互如踢球或踩踏。视频潜在模型虽具备强大动态预测能力,但因高维去噪过程复杂,难以满足实时控制需求。如何将大规模视频预训练模型迁移到动态平衡和多任务全身控制中,成为关键难题。特别是在单摄像头输入条件下,如何保证模型的时序一致性和物理合理性,也是亟待解决的问题。
核心创新
本研究提出MotionWAM,创新点包括:1)将视频潜在扩散模型(Video DiT)与运动潜在模型(Motion DiT)结合,构建实时全身控制架构;2)采用中间去噪特征实现端到端动作预测,避免迭代去噪的低效;3)引入统一的全身运动潜在空间,支持多任务、多形体控制,突破传统上下分离限制;4)设计三阶段训练策略,有效迁移大规模视频预训练到机器人平台,增强模型泛化能力。这些创新使得模型在复杂任务中表现出更高的协调性和交互能力。
方法详解
- �� 第一阶段:利用2,136小时的第一人称视频预训练视频潜在模型(Video DiT),学习未来帧生成能力,捕获视觉动态。
- �� 第二阶段:在多样化的Unitree G1数据上,结合跨形体微调,训练运动潜在模型(Motion DiT),通过流匹配保持时序一致性。
- �� 第三阶段:利用遥控演示数据,端到端微调模型,优化全身运动令牌的预测能力,支持主动足部交互。
- �� 模型结构:结合Video DiT和Motion DiT,通过中间去噪特征实现信息传递,预测全身运动潜在空间中的离散和连续变量。
- �� 训练目标:采用流匹配(flow-matching)损失,确保动态一致性和物理合理性,逐步迁移到目标机器人平台。
实验设计
在九项真实机器人任务中验证模型性能,任务涵盖腰部控制、身高调节、蹲行、足部交互和手部协调。使用遥控演示数据进行微调,比较基线包括Diffusion Policy、VLA等。指标为成功率,模型在单次推理频率达4.9Hz,优于传统方法。逐阶段训练验证了预训练和微调的重要性,缺失任何一环都导致性能下降。模型在复杂交互任务中表现尤为优越,证明了其全身协调能力。
结果分析
模型在九项任务中平均成功率超过76%,比最优基线提升30%以上,尤其在主动腿部交互任务中成功率从43.9%提升至76.1%。速度方面,推理频率达4.9Hz,是传统迭代模型的7倍,确保闭环控制的实时性。逐阶段训练验证显示,缺少预训练或跨形体微调会导致性能大幅下降,强调多模态迁移的重要性。
应用场景
该模型适用于工业、服务和救援机器人,能自主完成复杂的全身协调任务,如搬运、导航、交互等。依赖单摄像头输入,具有成本低、部署灵活的优势。未来可结合多模态感知,扩展到多机器人协作场景,提升自主决策和环境适应能力。
局限与展望
模型目前仅在Unitree G1平台验证,硬件适应性有限。对未知场景和物体表现不足,依赖视觉完整性。推理速度虽达实时,但在更复杂任务或多机器人系统中仍需优化,未来需提升模型泛化和效率。
通俗解读 非专业人士也能看懂
想象你在厨房做饭,厨房里有很多不同的器具和食材。你要用手、脚、身体协调地操作锅、刀、调料,确保每个步骤都顺利完成。传统机器人就像只会用一只手的厨师,只能做简单的切菜或倒水,不能同时炒菜、调味。而MotionWAM就像一个全能厨师,能用整个身体协调地完成多项任务,比如炒菜、摆盘、调味,甚至主动踢掉掉落的食材。它通过观察厨房里的动作录像,学习如何在不同场景中灵活应对。它不用逐个指令,而是像人一样,凭感觉和经验自主行动。这让机器人变得更聪明、更灵活,能在厨房里像人一样自如操作各种复杂任务。
简单解释 像给14岁少年讲一样
想象你在玩一款超级酷的机器人游戏,你控制一个机器人角色在房间里走来走去,做各种动作。以前的机器人就像只会走直线的机器人,只能做简单的动作,不能主动踢球或抓东西。而这次的研究让机器人变得更聪明,它可以用整个身体做出各种复杂的动作,比如踢球、爬楼梯、拿东西,就像人一样。它通过看很多视频学会了这些动作,就像你看了很多足球比赛后学会踢球一样。它还可以在实时中反应,几乎和你一起玩游戏一样快。这意味着未来的机器人可以帮你做家务、救援或者陪伴你玩耍,变得更像一个真正的伙伴。虽然还不完美,但这一步让机器人离真正像人一样聪明更近了一步!
原文摘要
World Action Models (WAMs) couple a video dynamics prior to the policy and have shown encouraging results on tabletop manipulation, but iterative denoising over high-dimensional video-action latents leaves them too slow for real-time humanoid loco-manipulation. The problem is compounded by the dominant hierarchical paradigm, in which a high-level manipulation policy controls only the upper body while a low-level controller tracks coarse base commands -- placing upper and lower body in inconsistent action spaces and reducing the legs to balance-preserving locomotion. We present MotionWAM, a real-time WAM that drives autonomous humanoid loco-manipulation from a single egocentric camera by conditioning the policy on the intermediate denoising features of a video world model. MotionWAM replaces the upper-lower split with a unified motion latent and predicts whole-body motion tokens that jointly cover locomotion, torso motion, height regulation, foot interaction, and hand manipulation in a single action space. A three-stage learning framework progressively adapts the video world model to egocentric visual dynamics and to the target humanoid embodiment. On nine real-world Unitree G1 tasks, MotionWAM runs in real time, substantially outperforms Vision-Language-Action (VLA) baselines fine-tuned on the same demonstrations by over 30% in overall success rate, and executes task-driven foot interaction that decoupled upper-lower policies cannot reach. Our results suggest that video-pretrained WAMs can be lifted from tabletop manipulation to coordinated, human-like whole-body humanoid control.