WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos

TL;DR

WALA从标注动作演示和无动作视频中学习可执行的潜在动作,在RoboCasa上达成75.2%成功率。

cs.RO 🔴 高级 2026-07-13 12 次浏览
Jiahao Liu Zhongpu Xia Shuai Tian Huangrui Li Yuhang Zheng Ning Ma Xin Fu Xiaotian Liu Jing Li Yixian Li ShangQing Zhou Zebin Xing Linbo Wang Chaoyue Li Haoran Li Dongbin Zhao
机器人 潜在动作 视频学习 深度学习 动作识别

核心发现

方法论

WALA通过预训练语义-几何潜在动作模型,从无动作标注的视频中学习动作相关表示。模型在DINOv3特征空间和密集深度空间中预测未来变化,避免重建原始像素,保留任务相关的语义和几何结构。

关键结果

  • WALA在RoboCasa上取得75.2%的平均成功率,超越现有最优基线DIAL 5个百分点。
  • 在RoboTwin 2.0的随机设置中,WALA达成92.8%的成功率,领先于其他方法。
  • 通过消融实验,验证语义-几何世界监督对性能提升的贡献。

研究意义

WALA框架通过结合动作标注演示和无动作视频,提供了一种新颖的机器人策略学习方法。它解决了传统方法依赖昂贵的动作标注数据的问题,并在多种操控任务中展示了其强大的泛化能力。

技术贡献

WALA在潜在动作学习中引入了语义-几何未来预测,提供了新的训练信号。通过在DINOv3和密集深度空间中进行预测,避免了像素级重建,提升了模型的效率和准确性。

新颖性

WALA首次将无动作标注的视频用于机器人策略学习,通过潜在动作目标匹配和未来动态预测,提供了有效的训练接口。

局限性

  • WALA在处理复杂场景时,可能会受到视频质量和深度估计精度的限制。
  • 该方法在计算资源有限的环境中可能难以实时应用。

未来方向

未来研究可以探索如何在更复杂的场景中应用WALA,并优化其在资源受限环境中的性能。

AI 总览摘要

WALA是一种新颖的框架,通过结合动作标注演示和无动作视频,学习可执行的潜在动作。传统的机器人策略学习依赖于昂贵且难以扩展的动作标注数据,而WALA通过在DINOv3特征空间和密集深度空间中预测未来变化,提供了有效的训练信号。

在实验中,WALA在RoboCasa上达成了75.2%的平均成功率,显著超越了现有的最优基线。通过消融实验,验证了语义-几何世界监督对性能提升的贡献。此外,WALA在RoboTwin 2.0的随机设置中也表现出色,达成了92.8%的成功率。

尽管WALA在多种操控任务中展示了其强大的泛化能力,但在处理复杂场景时,可能会受到视频质量和深度估计精度的限制。未来研究可以探索如何在更复杂的场景中应用WALA,并优化其在资源受限环境中的性能。

深度分析

研究背景

机器人策略学习通常依赖于动作标注的演示数据,这些数据昂贵且难以扩展。近年来,视觉-语言-动作模型在语言条件下的操控任务中取得了显著进展,但仍面临数据收集困难和未来场景演化监督不足的问题。

核心问题

现有方法主要依赖动作标注的演示数据,难以涵盖真实世界中丰富的物理交互。此外,标准的动作监督训练目标仅提供了关于动作后果的弱监督,难以处理长时间、接触丰富或空间精确的操控任务。

核心创新

WALA通过结合动作标注演示和无动作视频,提供了一种新颖的机器人策略学习方法。其核心创新在于利用无动作标注的视频进行潜在动作学习,并在DINOv3特征空间和密集深度空间中进行未来变化预测。

方法详解

  • �� 预训练语义-几何潜在动作模型,从无动作标注的视频中学习动作相关表示。
  • �� 在DINOv3特征空间和密集深度空间中预测未来变化,避免重建原始像素。
  • �� 在策略训练中,冻结预训练编码器,提供稳定的潜在动作目标。

实验设计

实验在RoboTwin 2.0和RoboCasa-GR1-Tabletop上进行,分别包含50和24个操控任务。使用PPU进行训练和评估,报告平均成功率作为主要指标。

结果分析

在RoboCasa上,WALA取得了75.2%的平均成功率,超越现有最优基线DIAL 5个百分点。在RoboTwin 2.0的随机设置中,WALA达成92.8%的成功率,领先于其他方法。

应用场景

WALA可用于机器人操控任务,特别是在需要泛化能力和低数据依赖的场景中。其方法适用于多种机器人平台和任务设置。

局限与展望

WALA在处理复杂场景时,可能会受到视频质量和深度估计精度的限制。此外,该方法在计算资源有限的环境中可能难以实时应用。

通俗解读 非专业人士也能看懂

想象一个机器人像一个聪明的学徒,它通过观察工人如何操作机器来学习。WALA就像这个学徒,它不仅观察有动作标注的演示,还从没有标注的工人视频中学习。通过这种方式,机器人可以理解如何在没有明确指令的情况下操作。这就像在厨房里,一个新手厨师通过观察视频学会做菜,而不是依赖详细的食谱。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你的角色是一个机器人。这个机器人需要学习如何在没有明确指令的情况下完成任务。WALA就像游戏中的一个超级助手,它可以从其他玩家的视频中学习如何操作,而不仅仅依赖于教练的指导。这就像在Minecraft中,你通过观看YouTube视频学会建造复杂的建筑,而不是只看说明书。

术语表

潜在动作 (Latent Action)

在机器学习中,潜在动作是指通过模型学习的抽象动作表示,用于简化复杂的动作预测问题。

在WALA中,潜在动作用于从视频中提取动作相关的动态信息。

DINOv3特征空间 (DINOv3 Feature Space)

一种用于图像特征提取的深度学习模型,能够捕捉图像中的语义信息。

WALA利用DINOv3特征空间进行未来变化预测。

密集深度空间 (Dense Depth Space)

一种表示图像中每个像素深度信息的空间,用于捕捉场景的几何结构。

WALA在密集深度空间中预测未来的几何变化。

RoboCasa

一个机器人操控任务的基准测试平台,包含多种复杂的操控任务。

WALA在RoboCasa上达成了新的最优结果。

动作标注演示 (Action-Labeled Demonstration)

指带有明确动作标签的机器人演示数据,用于训练机器学习模型。

WALA结合动作标注演示和无动作视频进行学习。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂的场景中应用WALA?现有方法在处理复杂场景时可能受到视频质量的限制。
  • 2 如何优化WALA在资源受限环境中的性能?计算资源有限可能影响其实时应用。

应用场景

近期应用

机器人操控

WALA可用于提升机器人在多种操控任务中的表现,特别是在需要泛化能力的场景中。

远期愿景

自动化生产

WALA有潜力在工业自动化中实现更高效的机器人学习和操作,减少对昂贵数据的依赖。

原文摘要

Generalizable robot policies typically rely on action-labeled robot demonstrations, which are expensive to collect and difficult to scale. In contrast, large-scale human and robot videos contain rich physical interactions but often lack executable robot action labels. We present WALA, a framework for learning executable latent actions from both action-labeled demonstrations and action-free videos. WALA first pretrains a semantic-geometric latent action model from videos by modeling the evolution between current observations and sparsely sampled future observations. Instead of reconstructing raw pixels, WALA predicts future deltas in the DINOv3 feature space and dense depth space, preserving task-relevant semantic and geometric structure while reducing sensitivity to appearance details. During policy training, the pretrained encoder provides stable latent action targets, and the decoder serves as a trainable latent world model. The latent actions generated by the vision-language backbone are jointly supervised by robot action prediction, latent action target matching, and future dynamics prediction. This enables action-labeled demonstrations to provide executable control supervision, while action-free videos contribute dynamics supervision without requiring robot action annotations. Experiments show that WALA achieves strong performance on RoboTwin, sets a new state-of-the-art result on RoboCasa with 75.2% average success, and improves both policy performance and generalization in real-world manipulation tasks.

cs.RO