DUET-DINO: Simultaneous Cross-View World Modeling for Latent Planning in Robot Manipulation

TL;DR

DUET-DINO通过跨视角潜在世界建模,实现机器人7自由度操作规划,达成92%到60%的任务成功率。

cs.RO 🔴 高级 2026-09-10 81 次浏览
Nisarga Nilavadi Ralf Römer Moritz Reuss Michael Krawez Tobias Jülg Angela P. Schoellig Rudolf Lioutikov Wolfram Burgard
机器人操作 潜在世界模型 跨视角建模 7自由度控制 强化学习

核心发现

方法论

DUET-DINO通过侧视和腕视相机的联合潜在建模,利用交叉注意力模块实现视角间信息互补,并通过双视角目标代价优化7自由度动作序列。

关键结果

  • 在到达任务中,DUET-DINO成功率达92%,显著优于单视角基线的79%。
  • 在角度到达任务中,DUET-DINO成功率为72.5%,最终角度误差降低至22.7°。
  • 在抓取并提升任务中,DUET-DINO达成60%的成功率,优于独立双视角基线的45%。

研究意义

该研究解决了现有潜在世界模型在精细化7自由度控制中的不足,显著提升了机器人在复杂操作任务中的规划能力,为未来机器人自主操作奠定了基础。

技术贡献

提出了跨视角潜在建模框架,结合DINOv3编码器和交叉注意力模块,首次实现双视角联合优化,显著提升了复杂任务的规划精度。

新颖性

首次提出同时利用侧视和腕视信息的潜在世界模型,解决了单视角模型在空间和旋转动作预测中的局限。

局限性

  • DUET-DINO在动态环境中的泛化能力尚未充分验证。
  • 模型训练成本较高,需大规模计算资源。
  • 腕视相机视野受限可能影响某些任务的性能。

未来方向

未来可探索动态环境下的模型性能提升,以及通过轻量化设计降低计算成本。

AI 总览摘要

DUET-DINO是一种新型跨视角潜在世界模型,专为机器人7自由度操作规划设计。现有潜在世界模型在精细化空间和旋转动作预测中表现不佳,限制了其在复杂操作任务中的应用。DUET-DINO通过联合侧视和腕视相机的观察,利用交叉注意力模块在潜在空间中实现视角信息的互补,从而提升了对全7自由度动作的规划能力。

实验结果表明,DUET-DINO在到达、角度到达和抓取提升任务中分别达成92%、72.5%和60%的成功率,显著优于单视角和独立双视角基线。尤其是在需要精确旋转的任务中,DUET-DINO的最终角度误差仅为22.7°,展现了其在复杂场景中的卓越性能。

尽管DUET-DINO在静态环境中表现优异,但其在动态场景中的表现仍需进一步验证。此外,模型训练成本较高,未来可通过轻量化设计和动态环境适配进一步优化其性能和应用范围。

深度分析

研究背景

潜在世界模型近年来在机器人操作中备受关注,其通过预测未来潜在表示实现目标导向的规划。然而,现有模型多依赖单一视角,难以捕捉复杂的空间和旋转动态,尤其在7自由度控制任务中表现不足。

核心问题

当前的潜在世界模型在处理精细化的7自由度操作任务时,预测精度不足,尤其在旋转和夹爪状态变化的动态捕捉上存在显著局限。这限制了其在复杂机器人操作任务中的应用。

核心创新

DUET-DINO的核心创新包括:

  • �� 跨视角潜在建模:结合侧视和腕视相机信息,利用交叉注意力实现视角互补。
  • �� 双视角目标代价优化:通过联合优化双视角潜在滚动预测,提升7自由度动作规划能力。
  • �� 采用DINOv3编码器:利用其密集自监督特性,更好地捕捉精细动作动态。

方法详解

DUET-DINO的实现包括:

  • �� 使用DINOv3编码器将侧视和腕视图像编码为潜在表示。
  • �� 通过交叉注意力模块实现视角间潜在信息的交互。
  • �� 使用视角特定的预测头预测未来潜在状态。
  • �� 通过CEM优化双视角目标代价,生成7自由度动作序列。

实验设计

实验基于DROID和RoboArena数据集,涵盖多种复杂操作任务,包括到达、角度到达和抓取提升。评估指标包括成功率、最终位置误差和角度误差。

结果分析

DUET-DINO在到达任务中成功率达92%,角度到达任务中成功率为72.5%,抓取提升任务中达60%,显著优于单视角和独立双视角基线。

应用场景

DUET-DINO适用于工业机器人装配、仓储物流等场景,尤其在需要精细化空间和旋转控制的任务中表现突出。

局限与展望

模型在动态环境中的表现尚需验证,训练成本较高,腕视相机的视野限制可能影响某些任务的性能。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,侧视相机就像你的眼睛,可以看到整个厨房布局,而腕视相机就像你的手,专注于切菜或搅拌。DUET-DINO就像一个聪明的助手,能同时利用你的眼睛和手的视角信息,帮助你更精准地完成每一步操作。

简单解释 像给14岁少年讲一样

想象你在玩一个机器人游戏,机器人有两个摄像头,一个看整个房间,一个看它的手。DUET-DINO就像游戏里的超级AI,可以同时用两个摄像头的信息,帮机器人做出最聪明的动作!它能让机器人更快、更准地完成任务,比如抓起一个香蕉或者转动一个物品。是不是很酷?

术语表

潜在世界模型 (Latent World Model)

通过学习潜在表示预测未来状态的模型,用于机器人规划。

DUET-DINO利用潜在世界模型进行7自由度动作规划。

交叉注意力 (Cross-Attention)

一种机制,用于在不同视角的潜在表示间交换信息。

DUET-DINO通过交叉注意力模块实现视角信息互补。

DINOv3

一种自监督视觉编码器,能提取高质量的潜在特征。

DUET-DINO使用DINOv3编码器处理侧视和腕视图像。

CEM (Cross-Entropy Method)

一种优化算法,用于生成高质量的动作序列。

DUET-DINO使用CEM优化双视角目标代价。

7自由度 (7-DoF)

机器人末端执行器的7个独立运动维度,包括3个平移、3个旋转和夹爪状态。

DUET-DINO专注于7自由度动作规划。

开放问题 这项研究留下的未解疑问

  • 1 如何在动态环境中提升DUET-DINO的泛化能力?
  • 2 如何优化模型以降低训练和推理的计算成本?
  • 3 是否可以扩展到更多视角的联合建模?

应用场景

近期应用

工业自动化

在制造业中用于复杂装配任务,提升生产效率和精度。

仓储物流

在物流中心用于物品分拣和搬运,优化仓储管理。

远期愿景

家庭机器人助手

未来可用于家庭服务机器人,帮助完成复杂家务任务。

原文摘要

Action-conditioned latent world models predict future visual representations, enabling zero-shot goal-conditioned robot planning and control. However, their predictions for fine-grained spatial and rotational actions are unreliable for full 7-DoF end-effector control. To address this gap, we introduce DUET-DINO, a simultaneous cross-view latent world model that jointly learns action-conditioned predictions from static side- and wrist-camera observations through cross-view conditioning. By exploiting complementary global scene and gripper-centric information, DUET-DINO enables latent planning over the full 7-DoF action space. Across spatially diverse reach, orientation-intensive angled-reach, and multi-goal grasp-and-lift tasks, DUET-DINO consistently outperforms single-view and independent dual-view baselines, achieving 92% success on reach, 72.5% on angled-reach, and 60.0% on lift tasks. DUET-DINO is trained from scratch on DROID and RoboArena datasets and generalizes robustly under visual distribution shifts. We further show that while V-JEPA 2 wrist-view predictions underestimate visual dynamics induced by fine-grained actions, DINOv3 predictions better capture action-conditioned scene changes, leading to stronger downstream planning. The code and model checkpoints will be open-sourced. Project page: https://utn-air.github.io/DUET-DINO

cs.RO cs.CV