World2Act: Latent Action Post-Training from World Model Dynamics

TL;DR

提出World2Act,基于潜在空间无像素监督的后训练框架,提升机器人任务成功率达+2.5%。

cs.CV 🔴 高级 2026-03-11 37 次浏览
An Dinh Vuong Tuan Van Vo Abdullah Sohail Haoran Ding Liang Ma Xiaodan Liang Anqing Duan Ivan Laptev Ian Reid
世界模型 潜在空间 机器人控制 后训练 视觉-语言-动作

核心发现

方法论

本文提出的World2Act框架包括两个阶段:第一阶段通过对比学习,将WM的潜在动态与动作嵌入对齐,构建共享的视频-动作潜在空间;第二阶段在固定的VLA模型基础上,通过引导动作表示向WM想象的潜在动态调整,实现无像素监督的后训练。核心算法采用对比损失(InfoNCE)和残差策略,利用Cosmos-Predict2作为预训练WM,结合动作适配器和视频适配器实现潜在空间映射。该方法避免了像素空间的噪声干扰,提高了模型的稳定性和迁移能力。

关键结果

  • 在RoboCasa、LIBERO和Bridge-SIMPLER等模拟基准上,World2Act分别实现成功率提升+2.5%、+6.0%、+1.4%,显著优于像素空间监督方法。LIBERO任务中,像素监督反而导致性能下降,而潜在空间方法保持稳定,表明潜在动态更具鲁棒性。
  • 在真实机器人任务中,World2Act平均提升成功率6.7%,优于DreamGen等对比方法,验证其在实际场景中的有效性。实验还显示,潜在空间对齐的成功率与后训练的潜在空间相似性高度相关。
  • 消融研究表明,双向对比和时间块对齐显著提升性能,残差策略比微调LoRA更高效,模型在未见任务上的泛化能力也得到增强。

研究意义

该研究突破了以像素为基础的WM后训练限制,提出潜在空间对齐新策略,有助于提升机器人任务的鲁棒性和迁移能力。其在模拟和真实场景中的优异表现,推动了机器人自主学习和泛化能力的发展,为未来自主系统的安全性和适应性提供了新思路。

技术贡献

技术创新在于引入潜在空间对齐机制,利用对比学习在低维潜在空间中实现动态信息的迁移,避免像素噪声干扰。该方法在保持预训练模型结构不变的基础上,通过轻量级残差策略实现高效后训练,显著优于传统像素空间监督,提供了更稳定、更易迁移的训练范式。

新颖性

首次提出在潜在空间中进行无像素监督的后训练方法,有效规避像素噪声带来的不稳定性。与现有的像素级逆动态模型或奖励学习不同,本文通过对比潜在动态实现知识迁移,开创了潜在空间对齐的新路径。

局限性

  • 当前方法依赖于预训练的结构化视频VAE模型,若模型质量不足或场景变化较大,潜在空间的表达能力可能受限。
  • 在极端复杂或高动态场景中,潜在空间的动态建模仍存在一定挑战,可能影响迁移效果。
  • 模型在大规模真实环境中的泛化能力尚需进一步验证,未来需结合在线学习和自适应机制提升鲁棒性。

未来方向

未来将探索多模态潜在空间的联合学习,结合强化学习优化潜在动态的表达能力,提升复杂场景下的适应性。同时,考虑引入在线自适应机制,以增强模型在未知环境中的鲁棒性和泛化能力。

AI 总览摘要

随着机器人自主任务的复杂性不断提升,如何有效利用世界模型(WM)中的动态信息成为关键挑战。现有方法多依赖像素空间的监督,受限于像素噪声和视觉干扰,导致迁移和泛化能力不足。本文提出的World2Act框架,创新性地在潜在空间中进行后训练,通过对比学习将WM的潜在动态与机器人动作表示对齐,避免了像素噪声的干扰。该方法在两个阶段实现:第一阶段构建共享视频-动作潜在空间,第二阶段在固定VLA模型基础上,通过引导动作潜在向WM想象的动态调整,实现无像素监督的知识迁移。实验证明,该方法在模拟环境中提升成功率达+2.5%至+6.9%,在真实机器人任务中平均提升6.7%,优于传统像素空间方法。特别是在LIBERO任务中,潜在空间方法保持稳定,而像素监督反而下降性能,显示出其鲁棒性。该研究不仅突破了像素噪声的限制,也为机器人自主学习提供了更稳定的迁移路径。未来,结合多模态潜在空间和在线适应机制,有望进一步推动机器人自主能力的提升,向更复杂、更动态的环境扩展。整体而言,World2Act为机器人自主控制的潜在空间迁移提供了新范式,具有重要的学术和应用价值。

深度分析

研究背景

机器人自主控制近年来逐渐依赖于世界模型(WM)以模拟环境动态,代表性工作包括VAE、Flow-based模型和V-JEPA等。早期研究多关注像素级的动态预测和逆动态模型(IDM),但受限于像素噪声和视觉干扰,迁移能力不足。随着潜在空间的引入,研究逐步转向低维潜在动态的建模,提升鲁棒性和泛化能力。现有方法如UWM和Cosmos Policy在潜在空间中实现动作预测,但多依赖高维联合嵌入,训练不稳定。本文基于Cosmos-Predict2,结合对比学习,提出潜在空间对齐策略,解决了像素噪声干扰和模型迁移的瓶颈。

核心问题

现有WM后训练方法依赖像素空间的伪标签,易受像素噪声和视觉干扰影响,导致模型性能不稳定,尤其在复杂或真实场景中表现较差。如何在避免像素噪声干扰的同时,有效迁移WM中的动态信息,成为关键难题。传统方法在长时间预测和多任务场景中表现不佳,限制了其实际应用潜力。

核心创新

提出潜在空间无像素监督的后训练框架,利用对比学习在低维潜在空间中对齐WM动态与动作表示,显著提高鲁棒性。引入轻量级残差策略,保持预训练模型结构不变,提升迁移效率。该方法首次实现了在潜在空间中进行动态知识迁移,避免了像素噪声的干扰,增强了模型的稳定性和泛化能力。

方法详解

  • �� 预训练结构化视频VAE(Cosmos-Predict2)获取潜在视频轨迹。• 第一阶段:通过对比学习,将WM潜在动态(V)与机器人动作(a)映射到共享潜在空间,采用视频适配器(Bv)和动作适配器(Ba)实现映射。• 训练目标包括重建损失和双向InfoNCE对比损失,确保潜在动态与动作表示的对齐。• 第二阶段:在固定VLA模型基础上,训练残差策略(fθ),对动作潜在进行微调,利用WM潜在轨迹作为弱监督信号。• 通过模拟环境多次滚动,优化潜在空间的对齐效果,提升实际任务中的表现。

实验设计

在RoboCasa、LIBERO和Bridge-SIMPLER三个模拟基准上,采用成功率作为指标,比较不同后训练方法。实验中使用约3000条合成轨迹,验证潜在空间对齐的有效性。对比基线包括DreamGen、VLA-RFT等,实验还进行消融分析,验证双向对比、时间块对齐和残差策略的贡献。真实机器人任务中,采用Franka机器人,执行多项日常任务,验证方法的实用性。结果显示,World2Act在所有场景中均优于像素空间方法,特别是在LIBERO任务中表现出极强的鲁棒性。

结果分析

在模拟任务中,成功率提升达+2.5%至+6.9%,LIBERO任务中成功率达98.1%,优于对比方法。在真实机器人中,平均提升6.7%,验证了潜在空间迁移的稳定性。消融实验表明,双向对比和时间块对齐是性能提升的关键因素。模型在未见任务上的泛化能力也得到增强,显示出潜在动态的迁移潜力。

应用场景

该方法适用于机器人自主学习、任务迁移和复杂环境中的控制策略开发。无需像素级标注,降低了标注成本,增强了模型的鲁棒性。未来可结合强化学习和在线适应,推动自主系统在未知环境中的应用,提升工业自动化和服务机器人水平。

局限与展望

目前依赖预训练的结构化视频VAE模型,模型质量直接影响潜在空间表达能力。在极端复杂或动态环境中,潜在动态的建模仍存在挑战。模型在大规模真实环境中的泛化能力有限,未来需结合在线学习和自适应机制提升鲁棒性。

通俗解读 非专业人士也能看懂

想象你在一家厨房做饭。传统方法就像用相机拍摄每一步,然后根据照片指导下一步,但照片可能会有模糊或误差,导致做菜不够好。现在,假设你用一种特殊的方式,把每个步骤的动作和食材的变化都变成一个简单的秘密密码(潜在空间),不用看照片,只凭这个密码就能知道下一步怎么做。这种方法避免了照片中的模糊和干扰,更稳妥。它就像用一种特殊的记忆方式,把所有做菜的动态都存下来,之后只要记住这个秘密密码,就能准确完成菜肴。这不仅让做菜变得更可靠,也能学会做更多不同的菜。这个想法就是本文提出的潜在空间对齐策略,帮助机器人在复杂环境中更好地理解和操作。

简单解释 像给14岁少年讲一样

想象你在玩一款游戏,里面的角色需要完成各种任务,比如搬东西、打开门。以前的方法就像用一台摄像机拍下每一步,然后照着照片去做,但有时候照片会模糊或者有干扰,导致机器人做错事。现在,有一种新方法,就像你用脑袋里的秘密记忆,把每个动作和场景的变化都变成一个简单的密码,不用看照片也知道怎么做。这个密码可以帮机器人更聪明地记住动作,即使画面变得模糊也不怕。它就像你用脑袋里的秘密地图,知道每一步该怎么走,不会迷路。这让机器人变得更稳、更聪明,可以在不同的场景中都表现得很好。未来,这种方法还能让机器人学会更多新技能,变得像人一样聪明、灵活!

原文摘要

World Models (WMs) offer a promising mechanism for post-training Vision-Language-Action (VLA) policies by providing dynamics priors that improve generalization under task and scene variation. However, most WM-based post-training methods rely on pixel-space supervision, making policies sensitive to visual artifacts introduced by imperfect WM rollouts. We present World2Act, a latent-space post-training framework that transfers WM dynamics to the VLA policy without pixel-space supervision. World2Act operates in two stages: 1) it induces a shared video-action latent space by contrastively aligning WM-dynamics latents with action embeddings, and 2) it post-trains the VLA by guiding policy action representations toward WM-imagined dynamics rather than decoded pixels. Built on GR00T-N1.6, World2Act delivers absolute success-rate gains of up to +2.5% on simulation benchmarks (RoboCasa, LIBERO, Bridge-SIMPLER) and +6.7% on a real robot over finetuned VLA baselines. Notably, it outperforms pixel-space WM supervision by up to +6.0%, including on LIBERO where pixel supervision degrades the baseline, suggesting that latent WM dynamics offer a more stable WM-based post-training alternative to pixel-space transfer.

cs.CV