LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies

TL;DR

LaWAM通过潜在视觉子目标实现高效动态预测,提升机器人控制成功率。

cs.RO 🔴 高级 2026-06-14 61 次浏览
Jialei Chen Kai Wang Kang Chen Shuaihang Chen Feng Gao Wenhao Tang Zhiyuan Li Weilin Liu Zhuyu Yao Boxun Li Yuanbo Xu Chao Yu
机器人控制 潜在模型 视觉预测 效率优化 动态规划

核心发现

方法论

LaWAM结合预训练的视觉基础模型,利用潜在空间中的潜在动作模型(LaWM)预测场景演变。通过逆动力学编码器推断潜在动作,利用解码器预测未来观察特征,形成潜在视觉子目标。策略在此基础上生成动作,避免像素级视频生成的高计算成本。训练中采用潜在动作蒸馏和知识隔离,确保模型在多任务环境下的稳定性。实验中,LaWAM在LIBERO、RoboTwin及真实场景中均达成最优或接近最优成功率,且推理延迟低至187ms,显著优于像素空间WAM。

关键结果

  • 在LIBERO任务中成功率达98.6%,比传统像素空间WAM快24倍,参数量仅为原模型的5%,极大提升了推理效率。
  • 在RoboTwin和真实操控任务中,成功率均超过90%,表现出良好的泛化能力,尤其在动态变化环境中表现优异。
  • 潜在视觉子目标的引入显著改善了场景演变的预测精度,增强了策略的动态感知能力,验证了潜在空间的表达优势。

研究意义

该研究突破了以像素为基础的未来预测瓶颈,将动态预测转移到潜在空间,极大降低了计算成本,为机器人在复杂环境中的高效自主控制提供了新路径。其成功应用于多任务、多场景,展示了潜在模型在机器人领域的巨大潜力,有望推动智能机器人向更高的自主性和适应性发展。

技术贡献

提出潜在世界动作模型(LaWM),将逆动力学编码器与解码器结合,利用潜在空间进行场景演变预测。创新性地将潜在动作蒸馏引入策略训练,结合知识隔离技术,确保模型在多任务环境中的稳定性。模型在保持低延迟的同时,显著减少参数量,突破了传统像素空间WAM的效率瓶颈,为动态感知与控制提供了新技术基础。

新颖性

首次将潜在动作模型的解码器作为场景演变的预测核心,避免像素级视频生成的高成本,提出潜在视觉子目标作为动作条件,提升效率和泛化能力。这一方法在保持高成功率的同时,大幅降低了推理延迟,代表了机器人动态预测的创新方向。

局限性

  • 当前模型在摄像头运动剧烈或视角剧变的场景中表现不佳,限制了其在移动平台或自我运动场景中的应用。
  • 对细粒度变形物理交互的建模仍不足,未来需扩展训练数据,提升模型对复杂物理场景的适应性。
  • 模型在极端环境或极端动态变化下的鲁棒性仍需验证,未来工作将关注多模态融合与多尺度建模。

未来方向

未来将结合多模态信息,增强模型对动态场景的理解能力,扩展到移动机器人和人形机器人中。同时,计划引入更大规模、多样化的训练数据,提升模型在复杂物理交互中的表现。还将探索潜在空间的可解释性,推动潜在模型在自主决策中的应用,为机器人实现更高层次的自主性奠定基础。

AI 总览摘要

随着机器人应用场景日益复杂,传统的视觉-语言模型(VLA)在场景预测和动态感知方面存在明显瓶颈。现有的世界动作模型(WAM)虽能引入未来场景预测,但多依赖像素级视频生成,导致推理延迟高、参数庞大,难以满足实时控制需求。为解决这一问题,本文提出了LaWAM,一种基于潜在空间的场景预测模型。LaWAM利用预训练的视觉基础模型,将场景演变映射到紧凑的潜在空间中,通过潜在动作模型(LaWM)预测未来观察特征,形成潜在视觉子目标。这一设计避免了像素级生成的高成本,同时保持了丰富的场景动态信息。模型在LIBERO、RoboTwin及真实操控任务中均取得优异表现,成功率达98.6%,推理时间仅187毫秒,比传统像素空间WAM快24倍。该方法不仅提升了效率,还增强了模型的泛化能力,为机器人在复杂环境中的自主控制提供了新思路。未来,LaWAM有望结合多模态信息,扩展到移动和人形机器人,推动自主系统的智能化发展。

深度分析

研究背景

机器人控制中的场景预测一直是核心难题。早期方法多依赖规则或浅层学习,难以应对复杂环境。近年来,视觉-语言模型(VLA)结合大规模预训练,提升了语义理解能力,但缺乏明确的场景演变建模。世界动作模型(WAM)引入未来预测,增强动态感知,但多依赖像素级视频生成,计算成本高,延迟大。现有方法在效率和泛化方面仍有不足,限制了实际应用。

核心问题

核心问题在于如何高效、准确地预测场景未来状态,支持实时机器人控制。像素空间的未来生成虽直观,但计算量巨大,难以满足高频控制需求。现有模型在复杂、多任务环境中表现不佳,尤其在动态变化和多模态融合方面存在瓶颈。解决方案需在保持预测精度的同时,大幅降低推理延迟,增强模型的泛化能力。

核心创新

提出潜在世界动作模型(LaWM),利用预训练视觉模型的潜在空间,将场景演变映射到紧凑表示中。通过逆动力学编码器推断潜在动作,解码器预测未来观察特征,形成潜在视觉子目标。引入潜在动作蒸馏,结合知识隔离技术,确保策略在多任务环境中的稳定性。模型在保持低延迟的同时,大幅减少参数量,突破传统像素空间WAM的瓶颈,为动态预测提供新路径。

方法详解

  • �� 采用预训练的视觉基础模型(如DINOv3)提取场景特征。• 训练潜在动作模型(LaWM),通过逆动力学编码器从观察转移中推断潜在动作。• 利用解码器预测未来观察特征,形成潜在视觉子目标。• 在策略训练中引入潜在动作蒸馏,确保潜在空间的表达能力。• 结合知识隔离技术,防止策略梯度干扰潜在场景模型。• 在推理阶段,策略预测潜在动作,LaWM解码未来场景特征,动作专家根据潜在子目标生成动作。• 训练过程中采用多任务损失,包括潜在动作重建、状态预测和知识隔离,确保模型稳定性。

原文摘要

Vision-Language-Action models (VLAs) leverage large-scale vision-language pretraining for semantic robot control, but often lack explicit foresight into how robot actions change the scene. World-Action Models (WAMs) address this limitation by conditioning policies on predicted futures, yet existing approaches typically rely on computationally expensive video generation with substantial pixel-level redundancy. We present LaWAM, a Latent World Action Model that exposes predictive dynamics to robot policies through compact latent visual subgoals instead of reconstructed future video. At the core of LaWAM is a latent-action-conditioned Latent World Model (LaWM). We obtain LaWM by training a latent action model in the latent space of a pretrained vision foundation model and repurposing its forward decoder to predict future observation features for scene evolution. LaWAM then conditions action generation on these predicted latent visual subgoals to enable dynamics-aware robot control. LaWAM achieves state-of-the-art or competitive success rates (SRs) across LIBERO (98.6% SR), RoboTwin (91.22% SR), and real-world manipulation tasks while retaining low-latency inference. LaWAM runs in 187 ms per action-chunk prediction and achieves up to 24x lower wall-clock latency than pixel-space WAMs.

cs.RO cs.AI