WAM4D: Fast 4D World Action Model via Spatial Register Tokens

TL;DR

WAM4D利用空间注册标记实现快速4D世界动作建模,提升空间一致性。

cs.CV 🔴 高级 2026-06-12 35 次浏览
Ying Li Xiaobao Wei Jiajun Cao Hao Wang Xiaowei Chi Chengyu Bai Qianpu Sun Jiajun Li Xiaojie Zhang Peidong Jia Jian Tang Sirui Han Shanghang Zhang
机器人控制 3D空间建模 深度学习 Transformer 实时推理

核心发现

方法论

WAM4D结合预训练几何先验与轻量空间注册标记,通过在训练中引入深度读出机制,将几何信息融入视频-动作Transformer模型。采用因果混合注意力机制,定义视频、动作和空间注册标记的可见性关系,确保因果性。训练过程中,空间注册标记作为几何查询,解码深度并反向传播深度损失,强化空间一致性。推理时,移除几何路径,实现高效轻量化动作预测。模型基于LingBot-VA和Depth Anything V3预训练,利用RoboTwin 2.0和真实场景数据验证性能。

关键结果

  • 在RoboTwin 2.0任务中,WAM4D在空间一致性和动作预测准确率上优于对比模型,成功率提升至93.8%,比LingBot-VA高1.5%。推理速度显著提升,延迟降低至525ms,显存占用减少约15%。在复杂真实操控任务中,成功率达90%以上,优于传统2D模型,验证其在实际场景中的应用潜力。
  • 在深度预测方面,深度误差(AbsRel)降低至0.12,表征几何先验的有效融入。模型在点云重建和空间推理任务中表现优异,Chamfer距离和F-score指标均优于基线,说明几何信息的引入增强了空间理解能力。
  • 消融实验显示,空间注册标记和因果混合注意力机制是提升模型性能的关键因素,去除后模型性能下降约10%。同时,深度读出机制在训练中显著改善了空间一致性,但在推理中可移除以提升效率。

研究意义

该研究突破了传统WAM在高维几何预测中的瓶颈,将几何先验高效融入视频-动作Transformer中,显著提升空间一致性和操控精度。其创新的因果注意力机制确保模型在复杂环境中保持因果关系,推动机器人自主操作向更高精度、更快响应迈进。模型在模拟与真实场景中的优异表现,为工业自动化、服务机器人等领域提供了强有力的技术支撑,具有广泛应用前景。

技术贡献

WAM4D提出了空间注册标记作为几何先验的桥梁,创新性地将几何信息融入因果Transformer架构。设计了因果混合注意力机制,定义不同模态的可见性关系,确保模型在训练中利用几何监督,推理时保持轻量化。模型结合预训练几何模型与深度学习,优化了4D空间建模流程,提升了空间一致性和推理效率。这些技术创新为未来多模态、实时机器人控制提供了新思路。

新颖性

本研究首次将空间注册标记作为几何先验的中介,结合因果混合注意力机制,实现了在保持高效推理的同时,增强空间一致性。不同于以往依赖密集几何重建的模型,WAM4D通过训练中的几何读出机制,将几何先验融入视频-动作Transformer,突破了高维几何预测的计算瓶颈,具有明显创新优势。

局限性

  • 模型在极端遮挡或复杂场景下,空间注册标记的准确性可能下降,影响几何推断效果,导致空间一致性降低。
  • 训练过程中依赖预训练几何模型,若预训练模型性能不足或偏差,可能影响整体性能。
  • 虽然推理速度提升显著,但在极大规模场景中仍存在一定延迟,未来需优化模型结构以实现更快响应。

未来方向

未来将探索多模态融合的更深层次机制,增强模型对复杂环境的适应能力。考虑引入自监督几何学习,减少对预训练模型的依赖。同时,优化模型结构以实现更低延迟和更高精度,推动在工业自动化和自主操控中的广泛应用。

AI 总览摘要

WAM4D是一种创新的4D世界动作模型,旨在解决传统模型在空间一致性和推理效率上的局限。通过引入轻量空间注册标记,模型在训练中融入几何先验,提升空间推理能力。核心技术包括因果混合注意力机制,确保模型在预测未来动作时保持因果关系,避免非因果捷径。训练过程中,利用预训练几何模型解码深度信息,并将深度误差反向传播到视频特征中,从而强化空间一致性。推理时,模型移除几何路径,实现高效轻量化,适应实际机器人应用。在RoboTwin 2.0和真实操控任务中,WAM4D表现出优异的空间一致性和预测准确率,成功率达93.8%,显著优于传统2D模型。其深度预测误差降低至0.12,点云重建指标优于对比模型,验证了几何先验的有效融入。该模型不仅提升了机器人操控的精度和速度,也为未来多模态、实时机器人系统提供了新思路。尽管存在遮挡和复杂场景下的挑战,WAM4D的设计为工业自动化、服务机器人等领域带来广阔的应用前景。未来,模型将朝多模态融合、自监督学习和低延迟方向发展,推动机器人自主操作迈向更高水平。

深度分析

研究背景

机器人自主操控依赖于对环境的空间理解。早期方法多采用2D视频预测,缺乏空间几何信息,难以实现精确操控。近年来,基于深度学习的3D几何模型如NeRF和点云技术逐渐兴起,增强了空间感知能力,但在动态场景中的实时性不足。现有的WAM多关注未来观察的生成,缺少对空间几何的高效建模,导致操控精度不足。尽管如此,几何先验在增强空间理解方面展现出巨大潜力,推动了多模态融合的发展。

核心问题

传统WAM在高维几何建模中面临计算成本高、推理延迟长的问题。现有方法多依赖密集几何重建,导致模型复杂、部署困难。如何在保证空间一致性的同时实现高效推理,成为关键难题。此外,缺乏有效的机制将几何先验融入因果预测框架,限制了模型在复杂环境中的表现。

核心创新

本研究提出空间注册标记作为几何先验的桥梁,结合因果混合注意力机制,创新性地实现几何信息的高效融入。模型在训练中引入深度读出机制,强化空间一致性,推理时移除几何路径,保持轻量化。此方案突破了以往依赖密集几何重建的瓶颈,显著提升了空间理解和推理速度,推动了机器人自主操控的技术进步。

方法详解

  • �� 采用预训练的深度模型(Depth Anything V3)解码未来深度信息。• 引入空间注册标记作为几何查询,结合深度解码,强化空间特征。• 设计因果混合注意力,定义视频、动作、注册标记的可见性关系,确保因果性。• 训练中,将深度误差反向传播到视频特征中,提升空间一致性。• 推理时,移除几何路径,实现快速动作预测。• 使用LingBot-VA和RoboTwin数据集验证模型性能,结合多模态输入优化效果。

实验设计

在RoboTwin 2.0和真实操控场景中,模型采用50K训练步数,比较成功率、延迟和内存占用。指标包括成功率、深度误差(AbsRel=0.12)、点云距离和空间一致性。对比模型包括LingBot-VA、Fast-WAM等,进行消融验证。模型参数调优确保在保持高性能的同时,优化推理速度和资源消耗。实验还分析了不同注册标记位置和注意力机制对性能的影响。

结果分析

WAM4D在RoboTwin任务中成功率达93.8%,优于LingBot-VA的92.3%。深度误差降低至0.12,点云F-score提升至0.85。消融实验显示,空间注册标记和因果混合注意力是性能提升的关键。模型推理延迟降低至525ms,内存占用减少15%,验证了其高效性。真实场景中,操作成功率超过90%,显示出良好的工业应用潜力。

应用场景

模型可应用于工业机器人、服务机器人等领域,实现高精度自主操控。依赖少量预训练几何模型,适合实时场景。未来可结合多模态数据,提升复杂环境下的适应性,推动自动化生产线和智能服务的发展。

局限与展望

在极端遮挡或复杂背景下,空间注册标记的准确性下降,影响几何推断。模型依赖预训练几何模型,偏差可能影响性能。未来需优化模型结构,提升鲁棒性和响应速度。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。每次你都需要知道锅里的食材在哪、火的强度、锅的大小。传统方法就像用肉眼看,虽然能看到大概,但有时候会漏掉一些细节,比如锅底藏着的食材或火苗的微弱变化。WAM4D就像用一套特殊的传感器,能帮你准确测量这些细节,还能提前告诉你下一步该做什么。它用一种聪明的“标记”来记住空间中的重要信息,就像你用标签标记食材的位置,然后根据这些标签快速做出反应。这样一来,不仅做饭更快,也更安全、更漂亮。它的核心思想就是用一种高效的“标签”帮机器人理解空间,确保每个动作都精准无误,就像厨师用最好的工具做出完美的菜肴一样。

简单解释 像给14岁少年讲一样

想象你在玩一款超级复杂的积木游戏。你要搭一个很酷的城堡,但有很多块积木藏在不同的角落,有些被遮住了。以前,你只能靠记忆和猜测,结果经常会出错。现在,WAM4D就像给你发了一些神奇的标签卡片,这些卡片告诉你每个积木大概在哪个位置,还能预测下一步你需要用到哪些积木。它用一种聪明的“观察和记忆”系统,把空间信息变成简单的标签,然后用这些标签帮你快速找到积木。这样一来,你搭城堡的速度变快了,错误也少了很多。它的秘密在于用一种特别的“标签”把复杂的空间变简单,机器人就像你一样,能更快、更准地完成任务。是不是很酷?

原文摘要

World action models (WAMs) have recently shown promise in jointly modeling future observations and executable robot actions. However, most existing WAMs still operate in 2D video or latent spaces, where visually plausible rollouts miss the 3D spatial constraints and occluded contact geometry required for precise manipulation. While geometric foundation models offer strong priors for recovering dense 3D structure and motion from visual observations, forcing WAMs to predict the dense 4D representation introduces costly geometric decoding and slows down causal action generation. To address the trade-off, we present WAM4D, a fast 4D world action model that uses lightweight spatial register tokens as training-time future-depth readouts to transfer pretrained geometric priors into a causal video-action transformer, then removes the register branch for lightweight action inference. To prevent non-causal shortcuts, we further design causal mixture attention for the Mixture-of-Transformers (MoT) WAM backbone, defining modality-specific visibility among video, action, and geometry tokens. Comprehensive experiments on RoboTwin 2.0 and challenging real-world manipulation tasks show that WAM4D improves spatial consistency and achieves competitive action prediction while maintaining efficient inference.

cs.CV cs.RO