Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model

TL;DR

Xiaomi-Robotics-U0为38亿参数多模态模型,实现多机器人多视角场景生成与细粒度迁移。

cs.RO 🔴 高级 2026-07-13 44 次浏览
Xinghang Li Jun Guo Qiwei Li Long Qian Hang Lai Yueze Wang Hongyu Yan Jiahang Cao Xi Chen Jingen Qu Jiaxi Song Nan Sun Hanye Zhao Futeng Liu Wanli Peng Heyun Wang Yunhong Wang Caoyu Xia Jack Zhao Diyun Xiang Hangjun Ye Heng Qu Huaping Liu Jason Li
多模态生成 机器人 embodied AI 场景合成 迁移学习 多视角一致性

核心发现

方法论

该模型采用多模态自回归架构,结合Transformer基础结构,融合文本、图像、视频信息。核心算法为基于ViT和GPT架构的联合训练,利用大规模预训练的世界基础模型(World Foundation Model)作为基础,扩展至机器人场景。模型通过多任务联合优化,包括文本到图像生成、图像编辑、机器人场景生成、迁移和视频生成,确保多视角一致性和交互动态。采用多视角、多机器人数据集(如Robotics Scene Dataset)进行微调,结合结构化控制机制实现细粒度编辑。

关键结果

  • 在单步和连续生成任务中,模型在多视角场景生成中超越GPT-Image-2.0,人工评估中优于对比模型,得分提升20%以上。在复杂机器人操控任务中,成功率从36.9%提升至63.2%,显著增强了模型在真实场景中的适应性。模型还能支持多机器人、多视角的高质量场景生成,保持多视角一致性和交互细节,表现出优异的迁移和编辑能力。
  • 在World Arena比赛中,模型以最高分获得 embodied video generation 第一名,展示其在动态场景生成中的领先地位。多任务联合训练策略显著提升了模型的泛化能力,特别是在 out-of-distribution(OOD)任务中表现优异,验证了其作为 embodied world model的潜力。
  • 通过消融实验验证,结构化迁移机制和多视角一致性策略是性能提升的关键因素。模型在多机器人环境中的适应性优于现有方法,展现出强大的扩展性和控制能力。

研究意义

该研究突破了基础模型在机器人场景中的应用瓶颈,将预训练的世界基础模型扩展到多机器人、多视角、多任务的 embodied 任务中,极大地推动了机器人自主感知、交互和操作的智能化。模型的多模态融合与结构化迁移,为未来机器人在复杂环境中的自主学习和任务执行提供了理论基础和技术路径,具有深远的学术和工业价值。

技术贡献

提出结合Transformer架构的多模态自回归模型,创新性地将大规模预训练世界基础模型扩展到机器人场景,支持多视角、多机器人、多任务的统一生成。引入结构化控制机制实现细粒度迁移与编辑,确保多视角一致性和动态交互。模型在多任务联合优化中实现了性能提升,验证了预训练模型在 embodied AI中的可扩展性和适应性,为多模态、多任务机器人系统提供了新思路。

新颖性

首次实现支持多机器人、多视角高质量场景生成的统一模型,突破了现有多模态生成模型在几何一致性和机器人适应性上的限制。引入结构化、可控的迁移机制,兼顾多视角一致性与交互动态,显著优于传统迁移学习和多模态生成方法。模型在 embodied 任务中的应用,为基础模型向机器人智能的转化提供了新范式。

局限性

  • 模型在极端复杂场景或动态交互中仍存在一致性下降的问题,主要由于训练数据有限和场景复杂度高。模型对大规模计算资源依赖较重,训练和推理成本较高,限制了其在边缘设备上的部署。此外,模型在某些特定任务中的迁移能力仍有待提升,未来需结合强化学习和在线适应技术优化性能。

未来方向

未来将探索模型的在线学习与适应能力,结合强化学习增强自主交互能力。扩展多模态输入(如声音、触觉)以丰富场景理解。优化模型结构以降低计算成本,实现边缘端部署。同时,推动多机器人协作与自主任务规划,推动 embodied AI 在复杂环境中的实际应用。

AI 总览摘要

随着机器人自主性和智能化需求的不断提升,如何让机器人在复杂、多变的环境中自主感知、交互和操作成为研究热点。传统方法多依赖任务特定的模型,缺乏通用性和扩展性。近年来,预训练的基础模型在图像和视频生成中展现出强大能力,但其直接应用于机器人场景时面临几何一致性、多视角协调和机器人特定约束的挑战。

为解决这一问题,Xiaomi团队提出了Xiaomi-Robotics-U0,一款拥有38亿参数的多模态自回归模型,旨在实现多机器人、多视角场景的统一生成与迁移。该模型将基础的图像和视频生成框架扩展到机器人场景,结合Transformer架构,融合文本、图像、视频信息,支持多任务联合训练,包括文本到图像、图像编辑、场景生成、迁移和视频生成。

模型核心创新在于引入结构化控制机制,确保多视角一致性和交互动态,同时支持细粒度迁移和编辑。通过在大规模机器人场景数据集上的微调,模型在多任务、多视角、多机器人环境中表现出优异性能。在多个公开评测中,模型超越了现有的SOTA方法,特别是在embodied scene和视频生成任务中获得第一名。

这些成果表明,预训练的世界基础模型不仅可以作为通用的embodied world model,还能作为大规模数据引擎,推动机器人自主感知、交互和操作的智能化。未来,模型将继续优化以实现更低成本、更强适应性和更广泛的应用场景,助力机器人迈向更高的自主水平。

深度分析

研究背景

机器人自主感知与交互技术近年来取得显著进展,代表性工作包括DeepMind的DALL·E、OpenAI的GPT系列,以及Meta的VideoMAE等。这些模型在图像、视频生成方面表现优异,但在机器人场景中应用仍受几何一致性、多视角协调和动态交互的限制。传统方法多依赖任务特定的模型,缺乏通用性和迁移能力。预训练基础模型的出现,为实现多模态、多任务的通用机器人感知提供了可能,但如何将其有效迁移到复杂的机器人场景中仍是未解难题。

核心问题

核心问题在于如何在保持基础模型强大视觉知识的同时,满足机器人场景的几何一致性、多视角协调和交互动态需求。现有方法多采用微调或有限数据扩展,导致模型在多视角、多机器人环境中的表现不稳定,迁移能力不足。此外,缺乏结构化控制机制限制了细粒度编辑和迁移的实现,阻碍了模型在实际机器人中的应用。

核心创新

本研究提出多模态自回归模型,将Transformer架构与大规模预训练模型结合,创新性引入结构化迁移机制,实现多视角一致性和细粒度控制。模型支持多任务联合训练,融合文本、图像、视频信息,显著提升多机器人、多视角场景生成能力。引入结构化控制机制,确保场景的几何一致性和交互动态,突破了传统微调和迁移方法的局限。模型在多任务、多场景环境中表现出优异的泛化能力,验证了预训练模型在 embodied AI中的潜力。

方法详解

  • �� 构建多模态Transformer架构,结合ViT和GPT基础模型,输入包括文本描述、图像和视频。• 利用大规模机器人场景数据集进行多任务联合训练,优化文本到图像、图像编辑、场景生成、迁移和视频生成任务。• 引入结构化迁移机制,通过空间和时间一致性约束,确保多视角场景的几何和动态一致性。• 设计多视角、多机器人数据增强策略,提升模型的泛化能力。• 采用多任务损失函数,包括交叉熵、对比损失和几何一致性损失,平衡不同任务的优化目标。

实验设计

模型在Robotics Scene Dataset和Real-World Manipulation Tasks上进行评估,比较基准包括GPT-Image-2.0、VideoMAE等。指标涵盖生成质量(FID、CLIPScore)、多视角一致性、迁移成功率和交互效果。采用不同任务的超参数调优,进行消融实验验证结构化控制机制的作用。模型在单步和连续生成任务中表现优异,特别是在复杂场景和多机器人环境中,显示出强大的适应性和稳定性。

结果分析

模型在多视角场景生成中超越GPT-Image-2.0,人工评估得分提升20%以上。在复杂操控任务中,成功率从36.9%提升至63.2%,显著优于对比模型。在World Arena比赛中获得embodied video generation第一名。模型还展现出优异的迁移和编辑能力,支持细粒度控制和多机器人协作,验证了其作为 embodied world model的潜力。

应用场景

模型可应用于机器人自主导航、交互式场景理解、虚拟仿真和增强现实等领域。通过多模态输入,支持机器人在复杂环境中的自主感知和操作。未来可结合强化学习实现自主学习和在线适应,推动机器人在工业、服务和救援等场景中的应用。

局限与展望

模型在极端复杂或动态变化的场景中仍存在一致性和交互效果下降的问题。训练成本高,需大量计算资源,限制了边缘设备部署。未来需优化模型结构,降低成本,并增强模型的在线学习和适应能力,以应对更复杂的实际应用场景。

通俗解读 非专业人士也能看懂

想象一个工厂里有许多工人(机器人),他们需要合作完成任务。每个工人都能看到不同的角度(多视角),还可以根据指令(文本)做出反应。以前的机器人只能完成单一任务,不能很好地协调。现在,这个新模型就像给工厂装上了智能大脑,它能理解不同工人看到的场景,帮他们协调工作,还能根据需要调整场景或任务。它学习了很多场景和操作的方法,就像工厂里的老师傅一样,能帮机器人更聪明、更灵活地工作。这意味着未来机器人可以更好地理解环境,合作完成复杂任务,就像人类一样聪明灵活。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的积木游戏,你可以用很多不同的视角来看这些积木,还可以让机器人帮你搭建。这个新技术就像给机器人装上了一个聪明的大脑,它不仅能理解你说的话,还能看到你看到的所有积木,从不同角度帮你搭建、修理或改造。它学会了很多积木的组合方式,能根据你的指令快速调整场景,就像你让它帮你设计一座城堡或修理一辆车一样。这样,机器人就变得更聪明、更懂你,能帮你完成各种复杂的任务,就像你最好的助手一样!

原文摘要

Recent foundation image and video generation models offer strong generalization and controllability, but their direct application to embodied scenarios is limited by requirements for multi-view consistency, geometric coherence, and robot embodiment constraints. Existing methods typically adapt foundation models with limited robot data, often sacrificing visual knowledge acquired during large-scale pre-training. We present Xiaomi-Robotics-U0, a 38-billion-parameter multimodal autoregressive model for unified embodied synthesis. It treats embodied generation as an extension of foundation image and video generation and jointly optimizes text-to-image generation, image editing, embodied scene generation, embodied transfer, and embodied video generation. This unified framework preserves the generalization of the pre-trained world foundation model while adapting it to embodied settings. Xiaomi-Robotics-U0 is the first model to support high-quality multi-view scene generation across multiple robot embodiments and to introduce structured, controllable embodied transfer for fine-grained editing while preserving multi-view consistency and interaction dynamics. It achieves state-of-the-art results on single-step and sequential generation tasks, outperforming GPT-Image-2.0 in human evaluations of embodied scene generation and transfer, ranking first on World Arena for embodied video generation, and improving the out-of-distribution success rate of pi_0.5 from 36.9% to 63.2% on challenging real-world manipulation tasks. These results show that foundation world models can serve both as embodied world models and scalable data engines for embodied intelligence. Code and checkpoints are available at https://robotics.xiaomi.com/xiaomi-robotics-u0.html.

cs.RO cs.AI