WSA$_1$: a 3D-Centric World-Spatial-Action Model for Generalizable Robot Control

TL;DR

提出WSA1,基于3D世界-空间-动作联合建模,数据仅用6千小时示范实现高效泛化。

cs.RO 🔴 高级 2026-07-05 49 次浏览
Jiahao Jiang Jianing Zhang Zhenhan Yin Ruidong Chen Sen Wang Zhaoshu Yu Pengpeng Zeng Xiaofeng Cao Xuanhan Wang Jingkuan Song Heng Tao Shen
机器人控制 3D建模 泛化能力 深度学习 embodied AI

核心发现

方法论

WSA1采用融合Transformer的多模态架构,结合三大专家模块:2D空间专家、3D空间专家和3D动作专家。模型通过双向因果注意机制,联合学习预测3D世界演变、视觉推理和逆动力学,实现世界状态的因果关系建模。训练目标包括3D世界预测、2D视觉思考和逆动力学,利用有限示范数据(6000小时)实现高效预训练。核心算法包括基于扩散变换器的动作预测和多模态注意机制,确保模型在复杂任务中的泛化能力。

关键结果

  • 在RoboTwin2.0模拟基准上,WSA1达成93%的成功率,优于现有SOTA模型,且仅用6000小时示范数据(其中1000小时为真实机器人数据)。在真实机器人任务中,性能提升超过20%,展现出强大的泛化能力。
  • 模型在多任务、多场景下表现稳定,验证了3D世界-空间-动作联合建模的有效性。 ablation研究显示,双向因果机制显著优于单向预测,模型对环境变化的适应性增强。
  • 通过有限数据实现高性能,突破了大规模真实机器人数据依赖瓶颈,为机器人泛化提供新思路。

研究意义

该研究突破了传统RFMs对大规模真实数据的依赖,提出3D世界-空间-动作联合建模范式,极大提升机器人在复杂环境中的泛化能力。其数据效率和模型通用性,为机器人自主操作、复杂任务适应提供理论基础和技术路径,推动机器人AI向更智能、更自主方向发展。

技术贡献

创新点在于引入3D因果关系建模,结合多模态Transformer实现世界状态、视觉推理和逆动力学的联合学习。模型采用双向因果注意机制,确保不同任务间的相互支持。提出的多专家架构和有限示范数据训练策略,显著提升了泛化能力和数据效率,为未来机器人自主学习提供新范式。

新颖性

首次提出基于3D世界-空间-动作的联合建模框架,打破了传统单向预测限制,融合因果关系,显著改善模型在真实环境中的适应性和泛化能力。这一方法区别于现有的单向视频预测或语义驱动模型,强调因果关系和多模态融合。

局限性

  • 模型在极端环境变化或未见场景中仍存在一定的泛化瓶颈,主要因训练数据覆盖有限。
  • 高效预训练依赖预先构建的多模态基础模型,存在迁移性和适应性问题。
  • 目前主要在模拟和有限真实场景验证,实际工业应用仍需规模化验证。

未来方向

未来将拓展多模态数据源,增强模型对未见场景的适应性;探索更高效的训练策略,减少预训练依赖;结合强化学习优化策略,提升自主决策能力;同时推动模型在复杂工业和服务机器人中的应用落地。

AI 总览摘要

随着机器人应用场景的不断扩展,如何实现具有强泛化能力的机器人控制模型成为研究热点。传统方法依赖大量真实机器人数据,成本高昂且难以规模化。本文提出的WSA1模型,基于创新的3D世界-空间-动作联合建模范式,通过融合多模态Transformer架构,实现对3D世界演变、视觉推理和逆动力学的同步学习。模型引入双向因果注意机制,确保不同任务间的因果关系和相互支持,从而在有限示范数据下,达到优异的泛化效果。实验证明,WSA1在RoboTwin2.0模拟基准中取得93%的成功率,超越现有SOTA模型,且在真实机器人任务中性能提升超过20%。这一突破性进展表明,结合3D因果关系建模的多模态学习路径,为未来自主机器人实现更高水平的智能和适应性提供了坚实基础。未来,模型将结合多源数据和强化学习,推动机器人在复杂环境中的自主操作能力,逐步实现从实验室走向工业应用的目标。

深度解读

原文摘要

Recent advances in embodied AI have established robot foundation models (RFMs) as the dominant approach for generalist robotic systems to date. By leveraging imitation learning on extensive robot demonstrations, RFMs have achieved impressive capabilities in mapping visual observations and language instructions to continuous robotic actions. However, current RFMs lack an inherent ability to reason about physical dynamics and the causal effects of robot behaviors on the 3D physical world. This creates a fundamental mismatch between 2D-centric visual perception and 3D-centric embodied interaction, severely limiting the generalization ability of RFMs in real-world tasks.To address this gap, we present WSA$_1$, a novel RFM built upon proposed 3D-Centric World-Spatial-Action modeling paradigm. It not only learns 3D world-aware visual thought for future robot behaviors, but also models mutual constraints between 3D world state transitions and robotic actions to enhance behavior generalization. Notably, WSA$_1$ achieves highly data-efficient pre-training with 6k hours of expert demonstration data (only 1k hours from real robot), while delivering competitive manipulation performance (93% success rate) on RoboTwin2.0 simulation benchmark and achieving +20% average boosted performance over state-of-the-art RFMs on real-world robot control tasks. These results reveal that generalizable RFM can be attained without large-scale real robot data when paired with 3D-centric world-action joint modeling, which offers a practical and affordable pathway to generalist robotic systems.

cs.RO