MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining

TL;DR

MiMo-7B通过三阶段数据混合和多Token预测提升推理能力,预训练25万亿Token,后训练130K验证问题,显著优于更大模型。

cs.CL 🔴 高级 2025-05-12 48 次浏览
LLM-Core Xiaomi : Bingquan Xia Bowen Shen Cici Dawei Zhu Di Zhang Gang Wang Hailin Zhang Huaqiu Liu Jiebao Xiao Jinhao Dong Liang Zhao Peidian Li Peng Wang Shihua Yu Shimao Chen Weikun Wang Wenhan Ma Xiangwei Deng Yi Huang Yifan Song Zihan Jiang Bowen Ye Can Cai Chenhong He Dong Zhang Duo Zhang Guoan Wang Hao Tian Haochen Zhao Heng Qu Hongshen Xu Jun Shi Kainan Bao Kai Fang Kang Zhou Kangyang Zhou Lei Li Menghang Zhu Nuo Chen Qiantong Wang Shaohui Liu Shicheng Li Shuhao Gu Shuhuai Ren Shuo Liu Sirui Deng Weiji Zhuang Weiwei Lv Wenyu Yang Xin Zhang Xing Yong Xing Zhang Xingchen Song Xinzhe Xu Xu Wang Yihan Yan Yu Tu Yuanyuan Tian Yudong Wang Yue Yu Zhenru Lin Zhichao Song Zihao Yue
大模型 推理能力 预训练 后训练 强化学习

核心发现

方法论

该研究采用多源数据预处理、三阶段数据混合策略,结合多Token预测(MTP)机制,提升模型推理潜能。预训练在25万亿Token基础上,加入Synthetic reasoning数据,强化推理模式。后训练阶段,构建130K验证问题集,采用基于难度的奖励方案,结合策略重采样,稳定训练过程。开发了高效的RL基础设施,实现快速训练与验证。模型架构基于Decoder-only Transformer,集成Grouped-Query Attention、pre-RMSNorm、SwiGLU激活和RoPE位置编码。MTP模块通过多层预测加速推理,提升长文本生成速度。整体训练采用AdamW优化,逐步调节学习率和批次大小,确保训练稳定性。评估涵盖数学、编码、推理等多任务,结果显示MiMo-7B-Base在推理任务中超越32B模型,RL调优后性能进一步提升,超越OpenAI o1-mini。

关键结果

  • MiMo-7B-Base在BBH达75.2分,超越同参数模型,展现出卓越推理能力。其在SuperGPQA、GSM8K等多项任务中表现优异,显著优于Llama-3.1-8B和Qwen2.5-7B。RL调优模型MiMo-7B-RL在数学(AIME 2025达55.4分)和编码(LiveCodeBench v5得32.9)任务中超越OpenAI o1-mini,证明其推理潜能的有效激发。模型在长文本理解(支持32K上下文)方面表现出色,达近乎完美的检索与推理能力。实验结果验证了多源高质量数据和多Token预测机制对推理能力的促进作用。
  • 结果还显示,MiMo-7B在多任务、多场景下具有广泛适应性,特别是在复杂推理、长文本理解和代码生成方面表现优异。模型的推理能力不仅体现在单一任务中,更在多任务融合中展现出强大潜力,预示未来大模型在多领域的应用前景。
  • 通过策略重采样和高效基础设施,模型训练效率大幅提升,训练时间缩短近一半,验证速度提升近两倍,极大推动了大模型的实用化进程。

研究意义

本研究突破了小参数模型在推理任务中的瓶颈,证明通过优化预训练数据和引入多Token预测机制,模型推理潜能可以被充分激发。其在数学、编程和长文本理解等多个复杂任务中表现优异,为未来AI系统的智能化提供了新路径。模型的开源也为学术界和工业界提供了宝贵资源,有助于推动大规模推理模型的研发与应用。该工作不仅提升了模型的推理能力,也展示了高效训练和验证的技术方案,为大模型的可持续发展奠定基础。

技术贡献

本研究提出了多源数据优化、三阶段数据混合策略和多Token预测(MTP)机制,显著提升模型推理能力。引入Synthetic reasoning数据丰富推理模式,结合基于难度的奖励方案,改善稀疏奖励问题。开发高效的RL基础设施,实现训练与验证的加速。模型架构采用Group-Query Attention和pre-RMSNorm,结合长上下文支持,优化推理路径。整体训练流程结合动态学习率调节和策略重采样,确保训练稳定性和效率。该方法在参数规模较小的模型中实现了超越更大模型的推理表现,展示了数据和机制创新的巨大潜力。

新颖性

本工作首次系统性结合多源高质量数据、三阶段数据混合策略和多Token预测机制,显著增强小参数模型的推理能力。提出基于难度的奖励方案,有效缓解稀疏奖励问题,提升训练稳定性。开发高效RL基础设施,实现训练与验证的快速迭代。与传统模型主要依赖模型规模不同,本研究强调数据和机制创新在推理能力中的核心作用,开辟了小模型高性能推理的新路径。

局限性

  • 模型在极端复杂推理任务或超大规模知识推理中仍存在一定局限,部分任务表现不及超大模型,原因在于模型容量和训练数据的限制。
  • 训练成本较高,尤其是在多Token预测和RL阶段,硬件资源需求大,限制了广泛应用。
  • 模型对某些特殊领域知识的掌握仍不足,未来需引入更丰富的专业数据进行微调。

未来方向

未来将探索更高效的多Token预测机制,优化训练流程,降低成本。计划引入更丰富的专业领域数据,提升模型在特定任务中的表现。还将研究模型的可解释性和鲁棒性,增强其在实际应用中的可靠性。进一步结合多模态信息,拓展模型的多任务能力,推动推理模型在工业界的落地应用。

AI 总览摘要

近年来,深度学习模型在自然语言处理领域取得了巨大突破,但其推理能力仍受限于模型规模和训练数据的丰富程度。传统大模型如GPT-4、Claude 3.7虽然表现优异,但训练成本极高,难以普及。为此,本文提出MiMo-7B,通过创新的数据预处理、多阶段数据混合和多Token预测机制,有效激发了模型的推理潜能。预训练阶段,模型在25万亿Token基础上,融合Synthetic reasoning数据,强化推理模式。后训练阶段,构建130K验证问题集,采用基于难度的奖励方案,结合策略重采样,稳定训练过程。模型架构基于Decoder-only Transformer,集成Group-Query Attention和长上下文支持,显著提升长文本理解能力。实验结果显示,MiMo-7B在多项推理任务中超越更大模型,特别是在数学(AIME 2025达55.4分)和编码(LiveCodeBench v5得32.9)任务中表现优异。RL调优后,模型性能进一步提升,超越OpenAI o1-mini,展现出强大的推理潜能。该研究不仅证明了数据和机制创新在模型推理中的关键作用,也为未来小参数高性能模型提供了新思路。模型开源,惠及学术与工业界,推动智能系统的持续发展。

深度分析

研究背景

近年来,大规模预训练语言模型(如GPT系列、BERT、LLaMA)在自然语言理解和生成方面取得突破,但其推理能力仍受限于模型参数和训练数据的丰富程度。深度强化学习(RL)被广泛应用于提升模型推理能力,尤其在数学、编码等专业任务中表现突出。现有研究多依赖超大模型(如32B参数以上)进行微调,难以普及。近年来,少参数模型在推理任务中的潜力逐渐被关注,如何在参数有限的情况下激发模型的推理潜能成为研究热点。此前的工作如DeepSeek、Qwen等在多任务、多场景中展现出一定的推理能力,但仍存在模型规模大、训练成本高、推理速度慢等问题。本研究旨在通过优化预训练数据和机制,提升小模型的推理能力,为模型普及和工业应用提供新路径。

核心问题

当前大模型在推理任务中的表现虽优,但训练成本高昂,难以普及。同时,模型在长文本推理、复杂数学问题和代码生成中仍存在瓶颈。如何在参数规模有限的情况下,激发模型的潜在推理能力,成为亟待解决的问题。传统方法多依赖模型规模扩展,导致训练成本激增,且难以实现实时推理。现有模型在多任务融合和长上下文理解方面表现不足,限制了其在实际场景中的应用。解决这一问题需要在数据、模型机制和训练策略上进行创新,以实现高效、强大的推理能力。

核心创新

本研究的核心创新包括:1)多源高质量数据预处理与三阶段混合策略,丰富推理模式;2)引入Synthetic reasoning数据,增强模型推理潜能;3)多Token预测(MTP)机制,通过多层预测加速推理,提升长文本生成速度;4)基于难度的奖励方案,有效缓解稀疏奖励问题;5)高效RL基础设施,显著提升训练验证效率。模型架构采用Group-Query Attention和长上下文支持,结合多Token预测机制,优化推理路径。整体流程强调数据质量和机制创新,突破了参数规模限制,展现出超越更大模型的推理能力。这些创新为小模型高性能推理提供了新思路,推动了AI推理能力的普及。

方法详解

  • �� 数据预处理:开发高效HTML、PDF提取工具,优化数学和代码内容的提取;进行全局去重和多维过滤,确保数据质量。• 数据混合:采用三阶段策略,第一阶段融合多源数据,过滤低质量内容;第二阶段增加数学和代码数据比例至70%;第三阶段引入Synthetic推理数据,扩展上下文长度至32K。• 模型架构:基于Decoder-only Transformer,集成GQA、pre-RMSNorm、SwiGLU和RoPE。• 多Token预测:在预训练中使用单层MTP,推理时多层并行预测,加速推理路径。• 训练策略:采用AdamW优化,逐步调节学习率和批次,结合策略重采样,确保训练稳定。• RL训练:构建130K验证问题集,设计基于难度的奖励方案,利用高效基础设施实现快速训练。• 评估:在多任务、多场景下测试模型推理能力,验证其超越更大模型的潜能。

实验设计

实验采用多任务评估,包括数学(GSM8K、AIME)、编码(LiveCodeBench、HumanEval)和推理(BBH、SuperGPQA)等数据集。模型参数为36层、隐藏维度4096,训练在25万亿Token基础上,结合多Token预测和Synthetic数据。对比基线包括Llama-3.1-8B、Qwen2.5-7B等。评估指标涵盖准确率、Pass@k、F1等。通过 ablation 实验验证多Token预测和难度奖励的贡献。模型在数学(AIME 2025达55.4分)、编码(LiveCodeBench v5得32.9)和长文本理解(支持32K上下文)中表现优异,超越同参数模型。

结果分析

MiMo-7B-Base在多项推理任务中优于32B模型,特别是在BBH(75.2分)和SuperGPQA中表现突出。RL调优模型MiMo-7B-RL在数学(AIME 2025达55.4分)和代码(LiveCodeBench v5得32.9)任务中显著优于OpenAI o1-mini。模型在长文本理解(支持32K上下文)和复杂推理场景中表现出色,验证了机制创新的有效性。实验还显示,模型在多任务融合中具备广泛适应性,未来可在多模态和专业领域拓展。

应用场景

模型可广泛应用于数学教育、自动编码、法律和科研等领域的复杂推理任务。其长上下文能力适合长篇文档分析、法律审查和科研论文理解。工业界可利用其推理能力提升自动化水平,推动智能问答、自动编程等应用落地。未来,结合多模态信息,模型有望实现跨领域的智能推理与决策支持。

局限与展望

模型在极端复杂推理或超大知识推理中仍有限,部分任务表现不及超大模型。训练成本高,硬件资源需求大,限制普及。对某些专业知识掌握不足,需引入更丰富的领域数据进行微调。未来需优化模型架构和训练流程,降低成本,提升鲁棒性和解释性。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,工厂里有许多不同的机器,每台机器都能做不同的事情。为了让工厂更高效,你不断优化机器的设计和操作流程。这个研究就像是在改造一台“智能机器”,让它能更聪明、更快地解决问题。科学家们用大量的“原料”——也就是各种各样的文本和代码——来“喂养”这台机器,让它学会推理和解决复杂问题。通过特殊的“训练方法”,这台机器变得越来越聪明,甚至可以在数学题、编程任务中表现得比一些更大更复杂的机器还要好。它还能理解长长的文章和对话,就像你能记住一整本书一样。这个研究的目标是让这些“智能机器”变得更聪明、更快、更实用,从而帮助人们在学习、工作和生活中解决更难的问题。

简单解释 像给14岁少年讲一样

想象你有一台超级聪明的机器人,它可以帮你解数学题、写代码,还能理解很长的故事。可是,要让它变得更聪明,不仅仅是让它变大,而是教它用更聪明的方法学习。科学家们用很多不同的书、网页和题目来“喂养”这台机器人,让它学会推理和解决问题。为了让它更快地回答问题,他们还设计了一种特别的预测方法,让机器人在思考时可以提前“猜测”下一步的答案,就像你在猜谜一样。经过这些努力,这台机器人变得非常厉害,不仅能在数学和编程比赛中获奖,还能理解长长的文章,比以前的模型更聪明、更快。它就像是一个超级助手,可以帮你学习、工作,甚至解决一些以前很难的问题。未来,这样的机器人会变得越来越聪明,帮助我们做更多事情!

原文摘要

We present MiMo-7B, a large language model born for reasoning tasks, with optimization across both pre-training and post-training stages. During pre-training, we enhance the data preprocessing pipeline and employ a three-stage data mixing strategy to strengthen the base model's reasoning potential. MiMo-7B-Base is pre-trained on 25 trillion tokens, with additional Multi-Token Prediction objective for enhanced performance and accelerated inference speed. During post-training, we curate a dataset of 130K verifiable mathematics and programming problems for reinforcement learning, integrating a test-difficulty-driven code-reward scheme to alleviate sparse-reward issues and employing strategic data resampling to stabilize training. Extensive evaluations show that MiMo-7B-Base possesses exceptional reasoning potential, outperforming even much larger 32B models. The final RL-tuned model, MiMo-7B-RL, achieves superior performance on mathematics, code and general reasoning tasks, surpassing the performance of OpenAI o1-mini. The model checkpoints are available at https://github.com/xiaomimimo/MiMo.

cs.CL cs.AI cs.LG