Learning Visual Feature-Based World Models via Residual Latent Action

TL;DR

提出Residual Latent Action (RLA)方法,通过DINO残差学习世界模型,在多任务机器人操作中提升预测精度并减少计算开销。

cs.CV 🔴 高级 2026-05-08 39 次浏览
Xinyu Zhang Zhengtong Xu Yutian Tao Yeping Wang Yu She Abdeslam Boularias
世界模型 视觉特征 机器人学习 强化学习 生成模型

核心发现

方法论

研究提出Residual Latent Action (RLA),通过DINO残差编码时间进程,并结合流匹配预测未来状态。RLA-WM通过紧凑的潜在空间实现高效动态预测,显著优于现有方法。

关键结果

  • RLA-WM在ManiSkill任务中LPIPS指标降低至0.071,比DINO-WM的0.156提升54.5%。
  • 在IWS数据集上,RLA-WM的DINO L1误差为0.053,优于Vid2World的0.139,同时计算开销减少近三个数量级。
  • RLA-WM在无动作视频中实现了63.6%的成功率,比基线方法提高8.5%。

研究意义

该研究解决了视觉特征空间中预测模糊和计算成本高的问题,为机器人学习提供了更高效的世界模型框架,并首次实现了完全基于离线视频的视觉强化学习。

技术贡献

提出了一种新的潜在动作表示RLA,结合流匹配技术显著提升了预测精度。同时,开发了两种机器人学习技术:基于RLA的简化世界动作模型和完全在离线视频中训练的视觉强化学习框架。

新颖性

RLA首次利用DINO残差编码时间动态,避免了直接回归的模糊问题,并通过紧凑潜在空间实现高效预测,显著区别于现有生成模型。

局限性

  • RLA-WM对训练数据的多样性较为敏感,可能在复杂场景中表现不佳。
  • 需要预训练DINO特征提取器,增加了模型部署的复杂性。

未来方向

未来工作可探索RLA在其他视觉特征空间的应用,并优化模型以适应更复杂的动态场景,例如多机器人协作任务。

AI 总览摘要

现有的世界模型主要依赖像素级视频生成,但计算成本高且易出现幻觉问题。视觉特征空间的预测提供了更高效的替代方案,但直接回归方法在复杂场景中易模糊或崩溃。

本文提出Residual Latent Action (RLA),通过DINO残差编码时间动态,并结合流匹配技术预测潜在动作。基于RLA的世界模型(RLA-WM)显著提升了预测精度,同时计算效率远超现有视频生成模型。

实验表明,RLA-WM在ManiSkill和IWS数据集上均优于基线方法,并支持两种新型机器人学习技术:从无动作视频中学习的简化世界动作模型,以及完全基于离线视频的视觉强化学习框架。这项研究为机器人学习的未来发展提供了重要的技术基础。

深度分析

研究背景

世界模型用于预测观察和动作间的未来状态转换,是机器人学习中的核心技术。现有方法多依赖像素级视频生成,如VAE和扩散模型,但计算成本高且易出现幻觉问题。视觉特征空间预测,如DINO-WM,提供了更高效的替代方案,但在复杂场景中表现有限。

核心问题

直接回归视觉特征空间易导致预测模糊或崩溃,而高维特征空间的生成建模则面临维度诅咒和计算开销问题。如何在复杂场景中实现高效且准确的视觉特征预测仍是未解难题。

核心创新

提出Residual Latent Action (RLA),通过DINO残差编码时间动态,避免直接回归的模糊问题。结合流匹配技术,RLA-WM在紧凑潜在空间中实现高效预测,并支持从离线视频中学习的机器人策略。

方法详解

  • �� RLA通过DINO残差编码时间动态,训练自编码器以重建未来特征。
  • �� RLA-WM使用流匹配预测潜在动作,并通过解码器结合当前状态重建未来状态。
  • �� 支持两种应用:简化世界动作模型和视觉强化学习框架。

实验设计

在ManiSkill和IWS数据集上评估模型性能,使用LPIPS、SSIM和DINO L1等指标比较预测精度。实验设计包括多任务场景和无动作视频学习。

结果分析

RLA-WM在ManiSkill任务中LPIPS指标降低至0.071,比DINO-WM提升54.5%。在IWS数据集上,DINO L1误差为0.053,优于Vid2World,同时计算开销减少近三个数量级。

应用场景

适用于机器人操作任务,如物体操作和工具使用。可扩展至无人驾驶和工业自动化领域,减少对在线交互和手工奖励的依赖。

局限与展望

模型对训练数据的多样性较为敏感,可能在复杂场景中表现不佳。此外,依赖预训练DINO特征提取器,增加了部署复杂性。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。DINO特征就像食材,直接回归预测就像尝试一次性做出完整菜肴,结果可能模糊或失败。而RLA就像提前准备好的调料包,帮助你一步步完成菜肴。通过流匹配技术,RLA-WM就像一个高效的厨师助手,能快速准确地帮你完成复杂的烹饪任务。

简单解释 像给14岁少年讲一样

想象你在玩Minecraft,想建造一个复杂的城堡。直接回归就像试图一次性放置所有方块,结果可能乱七八糟。而RLA就像一个智能助手,帮你规划每一步,确保城堡最终完美呈现!是不是很酷?

术语表

Residual Latent Action (残差潜在动作)

通过DINO特征间的残差编码时间动态,用于预测未来状态。

用于训练RLA-WM模型的核心表示。

DINO

一种视觉特征提取器,生成高维语义特征。

用于编码视频帧的视觉特征。

Flow Matching (流匹配)

一种生成模型技术,通过预测潜在空间的速度实现状态转换。

用于RLA-WM预测潜在动作。

LPIPS

用于评估图像之间的感知距离,衡量预测质量。

实验中用于比较模型预测精度。

ManiSkill

机器人操作任务的模拟数据集,包含多种场景。

用于评估模型性能的主要数据集之一。

开放问题 这项研究留下的未解疑问

  • 1 如何优化RLA在更复杂场景中的表现?
  • 2 是否可以将RLA扩展至其他视觉特征空间?

应用场景

近期应用

机器人操作优化

通过RLA-WM提升机器人操作任务的预测精度和效率。

无动作视频学习

支持从无动作视频中学习机器人策略,减少标注需求。

远期愿景

工业自动化

通过视觉特征世界模型实现更高效的工业自动化流程。

原文摘要

World models predict future transitions from observations and actions. Existing works predominantly focus on image generation only. Visual feature-based world models, on the other hand, predict future visual features instead of raw video pixels, offering a promising alternative that is more efficient and less prone to hallucination. However, current feature-based approaches rely on direct regression, which leads to blurry or collapsed predictions in complex interactions, while generative modeling in high-dimensional feature spaces still remains challenging. In this work, we discover that a new type of latent action representation, which we refer to as *Residual Latent Action* (RLA), can be easily learned from DINO residuals. We also show that RLA is predictive, generalizable, and encodes temporal progression. Building on RLA, we propose *RLA World Model* (RLA-WM), which predicts RLA values via flow matching. RLA-WM outperforms both state-of-the-art feature-based and video-diffusion world models on simulation and real-world datasets, while being orders of magnitude faster than video diffusion. Furthermore, we develop two robot learning techniques that use RLA-WM to improve policy learning. The first one is a minimalist world action model with RLA that learns from actionless demonstration videos. The second one is the first visual RL framework trained entirely inside a world model learned from offline videos only, using a video-aligned reward and no online interactions or handcrafted rewards. Project page: https://mlzxy.github.io/rla-wm

cs.CV cs.AI cs.LG cs.RO