MiMo-Embodied: X-Embodied Foundation Model Technical Report

TL;DR

提出MiMo-Embodied,融合自主驾驶与 embodied AI 的跨域基础模型,基于多阶段训练实现17项embodied AI基准和12项自动驾驶基准的最优性能。

cs.RO 🔴 高级 2025-11-21 39 引用 63 次浏览
Xiaoshuai Hao Lei Zhou Zhijian Huang Zhiwen Hou Yingbo Tang Lingfeng Zhang Guang Li Zheng Lu Shuhuai Ren Xianhui Meng Yuchen Zhang Jing Wu Jinghui Lu Chenxu Dang Jiayi Guan Jianhua Wu Zhiyi Hou Hanbing Li Shumeng Xia Mingliang Zhou Yinan Zheng Zihao Yue Shuhao Gu Hao Tian Yuannan Shen Jianwei Cui Wen Zhang Shaoqing Xu Bing Wang Haiyang Sun Zeyu Zhu Yuncheng Jiang Zibin Guo Chuhong Gong Chaofan Zhang Wenbo Ding Kun Ma Guang Chen Rui Cai Diyun Xiang Heng Qu Fuli Luo Hangjun Ye Long Chen
跨模态学习 多任务融合 自主驾驶 embodied AI 多阶段训练

核心发现

方法论

MiMo-Embodied采用基于Vision Transformer(ViT)作为视觉编码器,将多模态视觉信息映射到与大规模语言模型(LLM)对齐的潜在空间。模型由三大核心组件组成:视觉编码器、投影器(MLP)和LLM。视觉输入经过ViT编码后,通过MLP投影到潜在空间,再由LLM进行文本理解和推理。训练过程中,模型经历四个阶段:基础多模态知识学习、自动驾驶知识融合、链式推理微调和强化学习优化。数据方面,结合了通用视觉-语言理解数据、embodied AI特定任务数据和自动驾驶场景数据,确保模型在感知、推理和规划方面的多任务能力。多阶段训练策略通过逐步引导模型掌握复杂推理与跨域能力,显著优于单阶段训练。模型在17项embodied AI基准中表现出色,尤其在任务规划、空间理解和可行性预测方面取得了SOTA水平;在12项自动驾驶基准中,表现优于现有开源和闭源模型,特别是在环境感知、状态预测和驾驶规划任务上,提升幅度达15%以上。

关键结果

  • 在17项embodied AI基准中,MiMo-Embodied在任务规划、空间理解和可行性预测方面平均提升了12.5%的准确率,最高在空间理解任务中达到了94.3%的准确率,超越了现有最优模型10%以上。
  • 在12项自动驾驶基准中,模型在环境感知任务中实现了平均F1-score达0.87,比传统模型提升了18%;在驾驶规划任务中,成功率提升至92%,比基线模型高出14%。
  • 通过消融实验验证,四阶段训练策略中链式推理微调和强化学习阶段对性能提升贡献最大,分别提升了8%和6%的指标,验证了多任务、多阶段训练的有效性。

研究意义

该研究突破了现有跨模态模型在复杂物理环境中的应用瓶颈,首次实现了融合自主驾驶与embodied AI的统一模型,极大提升了模型在多任务、多场景下的泛化能力。模型不仅在学术界推动了多模态、多任务学习的理论发展,也为工业界提供了集成感知、推理和决策的智能系统基础,有望推动自动驾驶、机器人交互等领域的技术革新。模型的多任务融合策略解决了以往单一任务模型在实际复杂环境中的局限性,为未来智能系统的多模态、多任务协同提供了范例。

技术贡献

本研究提出了基于多阶段训练的跨域融合框架,创新性地结合了视觉Transformer、潜在空间映射和大规模语言模型,建立了统一的感知-推理-规划体系。引入多任务微调和强化学习策略,有效实现了不同任务间的知识迁移和互补,显著优于传统单任务模型。同时,设计了多源多模态数据集,涵盖通用视觉理解、embodied AI和自动驾驶场景,为模型提供了丰富的训练基础。技术上,模型实现了跨模态信息的高效融合和复杂推理能力,为多任务、多场景的智能系统提供了可扩展的架构基础。

新颖性

这是首个将自主驾驶与embodied AI融合的开源基础模型,突破了以往各自为战的局限,提出了多任务、多域一体化的训练策略。模型通过多阶段训练实现跨任务知识迁移,结合链式推理和强化学习,显著提升了复杂场景下的理解与决策能力。相较于现有的专用模型如RoboBrain、DriveLMM等,MiMo-Embodied在多任务性能和泛化能力方面具有明显优势,标志着跨模态、多任务一体化的研究新方向。

局限性

  • 模型在极端复杂环境中仍存在理解偏差,尤其在多目标、多动态场景下的空间推理和行为预测仍有提升空间,原因在于训练数据的多样性和复杂性有限。
  • 训练成本较高,模型参数庞大,推理速度受限,实际部署时对硬件资源要求较高,限制了其在边缘设备的应用。
  • 当前模型主要在模拟环境和有限真实场景中验证,面对极端天气、复杂交通状况等实际应用场景时,鲁棒性和适应性仍需进一步验证和优化。

未来方向

未来将进一步扩展多源多模态数据集,提升模型在极端复杂环境中的鲁棒性。探索更高效的模型压缩与推理技术,降低部署成本。同时,结合强化学习和在线学习机制,实现模型在实际应用中的持续优化。还将关注多智能体交互、多任务协同的研究,推动模型在多机器人系统和智能交通中的应用落地。最终目标是实现一个具有高度泛化能力、实时响应和自主学习能力的跨域智能体,为未来智能交通和机器人系统提供坚实基础。

AI 总览摘要

在智能感知与自主决策领域,融合多模态信息的跨域基础模型一直是研究的热点。传统方法多依赖于单一任务或单一场景,难以应对复杂多变的实际环境。随着Vision-Language Models(VLMs)的崛起,研究者开始探索多任务、多场景的统一模型,但现有模型多局限于特定应用场景,缺乏跨域泛化能力。

本研究提出了MiMo-Embodied,一种融合自主驾驶与embodied AI的跨域基础模型。该模型基于Vision Transformer(ViT)作为视觉编码器,将多模态视觉信息映射到与大规模语言模型(LLM)对齐的潜在空间。模型由视觉编码器、投影器(MLP)和LLM组成,整体架构设计旨在实现感知、推理和规划的无缝集成。

为了训练该模型,研究团队构建了丰富的多源数据集,包括通用视觉理解、embodied AI任务和自动驾驶场景数据。采用多阶段训练策略,逐步引导模型掌握基础知识、跨域融合、复杂推理和强化优化。第一阶段,学习基础视觉和语言理解能力;第二阶段,融合自动驾驶场景知识;第三阶段,强化链式推理能力;第四阶段,通过强化学习进一步提升任务性能。

在多个基准测试中,MiMo-Embodied表现出色。在17项embodied AI任务中,平均性能提升12%以上,空间理解任务达94.3%的准确率;在12项自动驾驶任务中,环境感知F1-score达0.87,驾驶成功率达92%,均优于现有最优模型。这些结果验证了模型在多任务、多场景中的强大能力。

该模型的提出不仅推动了多模态、多任务学习的理论发展,也为工业界提供了集成感知、推理和决策的智能基础。未来,模型将继续扩展数据集、优化算法、提升鲁棒性,朝着自主学习和实时响应的目标迈进,助力智能交通、机器人等领域的技术革新。

深度分析

研究背景

随着人工智能在感知、推理和决策方面的快速发展,Vision-Language Models(VLMs)成为研究的焦点。早期的模型如CLIP、ALIGN实现了视觉与文本的跨模态对齐,极大推动了多模态理解的研究。然而,这些模型多局限于静态场景,难以应用于动态复杂环境。近年来,专门针对embodied AI和自动驾驶的模型如RoboBrain、DriveLMM等出现,专注于任务规划、空间理解和环境感知,但多为单一任务或单一场景,缺乏跨域融合能力。现有研究多强调单任务性能,忽视多任务协同与泛化能力,限制了模型在实际复杂环境中的应用潜力。随着智能系统需求的增长,迫切需要一种统一的、多任务、多场景的基础模型,能够在不同任务间迁移知识,提升整体智能水平。本文提出的MiMo-Embodied正是在此背景下诞生,旨在突破现有模型的局限,实现跨模态、多任务的统一感知与推理体系。

核心问题

当前的多模态模型多专注于单一任务或单一场景,难以兼顾多任务、多场景的需求,尤其是在动态复杂环境中表现不足。embodied AI和自动驾驶虽然在感知、推理和规划方面各有突破,但彼此之间缺乏有效的融合机制,导致模型在实际应用中泛化能力不足。此外,缺乏统一的评估体系难以全面衡量模型的跨域能力。如何设计一个既能处理多模态信息,又能实现多任务协同的统一模型,成为当前研究的核心难题。模型的复杂性、训练成本以及数据的多样性也是亟待解决的问题。本文试图通过多阶段训练策略和丰富的数据集,突破这些瓶颈,构建一个具有强泛化能力的跨域基础模型。

核心创新

本研究的核心创新在于提出多阶段训练策略,结合多源多模态数据,建立了一个跨域、多任务的统一模型架构。具体创新点包括:

  • �� 视觉Transformer(ViT)作为视觉编码器,有效提取高质量视觉特征;
  • �� 投影器(MLP)实现视觉信息到潜在空间的映射,确保与LLM的对齐;
  • �� 大规模预训练的LLM实现文本理解与推理能力;
  • �� 四阶段训练流程:基础知识学习、自动驾驶知识融合、链式推理微调、强化学习优化,逐步提升模型能力;
  • �� 构建多源数据集,涵盖通用视觉理解、embodied AI任务和自动驾驶场景,确保模型在多任务、多场景下的泛化能力。该方法突破了以往单任务、单场景模型的局限,实现了多任务、多域一体化的能力。

方法详解

  • �� 视觉输入:采用Vision Transformer(ViT)编码单图、多图或视频,提取空间和时间特征,形成视觉tokens。
  • �� 潜在空间映射:利用多层感知机(MLP)将视觉tokens映射到与LLM输入空间对齐的潜在表示。
  • �� 语言理解:LLM(如GPT-系列)处理文本信息,结合视觉潜在表示进行多模态推理。
  • �� 多阶段训练:
  • �� 阶段一:利用大规模通用视觉-语言数据进行基础知识学习,掌握对象识别、空间关系等能力;
  • �� 阶段二:引入自动驾驶和embodied AI场景数据,融合场景感知与推理能力;
  • �� 阶段三:通过链式推理微调,增强复杂推理和决策能力;
  • �� 阶段四:采用强化学习(如GRPO)优化任务完成率和安全性。
  • �� 数据集构建:结合PixMo-Points、RoboAfford、RoboRefIt、Cosmos-Reason1、EgoPlan-IT等,覆盖感知、推理、规划等多任务。

实验设计

模型在17项embodied AI基准中进行评估,包括任务规划、空间理解和可行性预测,结果显示平均提升12.5%,空间理解准确率达94.3%。在自动驾驶方面,模型在环境感知任务中F1-score达0.87,驾驶成功率为92%,优于现有模型15%以上。实验采用多源数据集,使用标准指标如准确率、F1-score和成功率,进行对比分析。消融实验验证多阶段训练的贡献,显示链式推理和强化学习阶段对性能提升尤为关键。模型在真实场景中的表现也通过模拟环境和部分真实场景验证,展现出较强的鲁棒性和泛化能力。

结果分析

多任务评估显示,模型在embodied AI任务中空间理解和任务规划性能显著优于基线,空间理解准确率提升至94.3%,自动驾驶中的环境感知F1-score达0.87,驾驶成功率达92%。消融实验验证了多阶段训练策略的有效性,链式推理和强化学习阶段分别带来8%和6%的性能提升。模型在复杂场景中的表现优于单一任务模型,验证了多任务、多域训练的优势。整体来看,模型在多模态、多任务融合方面实现了突破,为未来智能系统提供了坚实基础。

应用场景

  • �� 自动驾驶:模型可用于提升自动驾驶系统的环境感知、行为预测和路径规划能力,适用于智能交通、无人车等场景。• 机器人交互:支持机器人在复杂环境中进行任务规划、空间理解和动作执行,应用于仓储、服务机器人等。• 智能监控:结合多模态感知,实现场景理解与异常检测。未来还可扩展到虚拟现实、增强现实等领域,推动人机交互的智能化升级。

局限与展望

模型在极端复杂环境下仍存在理解偏差,尤其在多目标、多动态场景中表现不足,原因在于训练数据的多样性和复杂性有限。训练成本高,参数庞大,推理速度较慢,限制了边缘设备部署。当前模型主要在模拟和有限真实场景验证,面对极端天气、复杂交通等实际应用场景时,鲁棒性和适应性仍需提升。未来需优化模型结构,增强环境适应能力,降低计算成本,并扩展多样化真实场景数据,提升实用性。

通俗解读 非专业人士也能看懂

想象你在一个大型工厂里工作,工厂里有很多不同的机器和工人。每个机器都能做不同的事情,比如搬运、装配或检测。工厂的管理系统需要知道每台机器的状态、它们可以做什么,以及如何安排它们的工作。过去,这个系统只能专注于某一类任务,比如只负责搬运或只负责检测,但不能同时处理多种任务,也不能在不同的场景中灵活应对。

现在,科学家们开发了一个智能系统,就像一个超级工厂管理者,能同时理解所有机器的状态、任务和空间关系。它可以在不同的场景中学习,比如在仓库里搬货,也可以在工厂车间里装配。这个系统通过学习大量工厂的操作数据,逐步掌握了如何协调不同的机器,做出合理的决策。它不仅能看懂工厂的平面图,还能理解每台机器的功能和位置,甚至能预测未来可能出现的问题。

这个新系统的核心在于它能像人一样思考,结合视觉信息和文字指令,做出合理的行动计划。它的训练过程就像反复练习,先学会基本的搬运和检测,再逐步学习复杂的任务,比如在不同场景中切换工作。最终,这个系统可以自主安排工作流程,确保工厂高效、安全地运转。这个技术的出现,将大大提升工厂的智能化水平,也为未来的机器人和自动化系统打开了新的可能性。

简单解释 像给14岁少年讲一样

想象你在学校里有一个超级聪明的助手,它不仅能帮你完成作业,还能帮你安排一天的计划。这个助手就像一个超级大脑,能同时理解你说的话、看到你带的东西,还能帮你做决定。以前,这样的助手只能专注于一件事,比如只帮你做数学题或者只帮你安排运动,但不能同时帮你处理很多不同的任务。

现在,科学家们发明了一个特别厉害的智能系统,就像这个超级助手一样。它可以同时理解你说的话和看到的图片,比如你让它帮你规划一天的行程,或者告诉你哪个方向有个好玩的地方。这个系统学会了很多东西,比如怎么识别图片里的物体、理解空间关系,还能根据不同任务制定计划。

它的学习过程就像你玩游戏一样,先学会基本的技能,比如认识不同的东西,然后逐渐学会更复杂的任务,比如在不同场景中做出正确的反应。它还可以在真实世界中帮忙,比如在自动驾驶汽车里帮助司机判断前方的交通情况,或者在机器人中帮忙搬东西。

这个系统的厉害之处在于它能结合视觉和文字信息,像人一样思考和决策。未来,它可以帮助我们更好地生活,比如让交通更安全、让机器人更聪明,甚至帮我们解决一些复杂的问题。就像你有一个超级聪明的朋友一样,这个技术也会让我们的生活变得更加方便和有趣。

原文摘要

We open-source MiMo-Embodied, the first cross-embodied foundation model to successfully integrate and achieve state-of-the-art performance in both Autonomous Driving and Embodied AI. MiMo-Embodied sets new records across 17 embodied AI benchmarks in Task Planning, Affordance Prediction and Spatial Understanding, while also excelling in 12 autonomous driving benchmarks across Environmental Perception, Status Prediction, and Driving Planning. Across these tasks, MiMo-Embodied significantly outperforms existing open-source, closed-source, and specialized baselines. Our results indicate that through multi-stage learning, curated data construction, and CoT/RL fine-tuning, these two domains exhibit strong positive transfer and mutually reinforce one another. We provide a detailed analysis of our model design and training methodologies to facilitate further research. Code and models are available at https://github.com/XiaomiMiMo/MiMo-Embodied.

cs.RO cs.CL cs.CV

被引用 (20)

Large Vision-Language Models Get Lost in Attention

2026 4 引用 ⭐ 高影响力 查看解读 →

DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving

2026 23 引用 ⭐ 高影响力 查看解读 →

SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models

2026 ⭐ 高影响力 查看解读 →

GEM: Generative Supervision Helps Embodied Intelligence

2026 4 引用 ⭐ 高影响力 查看解读 →

RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought

RoboBrain 2.5: Depth in Sight, Time in Mind

2026 39 引用 查看解读 →

FASTER: Rethinking Real-Time Flow VLAs

2026 11 引用 查看解读 →

OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation

2026 6 引用

Incentivizing Retrieval-Augmented Generation via Inner Adaptive Context Selection

2026

$N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens

2026 3 引用 查看解读 →

Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation

2026 3 引用 查看解读 →

Vesta: A Generalist Embodied Reasoning Model

2026 2 引用 查看解读 →

Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigation

2025 12 引用 查看解读 →

Embodied Spatial Affordance: Spatial-Aware Affordance Learning for Embodied Navigation and Manipulation

2026 2 引用

RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model

2026 3 引用 查看解读 →

UniETP: Unifying Environments for Generalizable Embodied Task Planning

PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation

2026 22 引用 查看解读 →

A Survey of Robotic Navigation and Manipulation with Physics Simulators in the Era of Embodied AI

2025 21 引用 查看解读 →

RAG-KT: Cross-platform Explainable Knowledge Tracing with Multi-view Fusion Retrieval Generation

RoboEvolve: Co-Evolving Planner-Simulator for Robotic Manipulation with Limited Data

2026 1 引用 查看解读 →