MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining
MiMo-7B通过三阶段数据混合和多Token预测提升推理能力,预训练25万亿Token,后训练130K验证问题,显著优于更大模型。
核心发现
方法论
该研究采用多源数据预处理、三阶段数据混合策略,结合多Token预测(MTP)机制,提升模型推理潜能。预训练在25万亿Token基础上,加入Synthetic reasoning数据,强化推理模式。后训练阶段,构建130K验证问题集,采用基于难度的奖励方案,结合策略重采样,稳定训练过程。开发了高效的RL基础设施,实现快速训练与验证。模型架构基于Decoder-only Transformer,集成Grouped-Query Attention、pre-RMSNorm、SwiGLU激活和RoPE位置编码。MTP模块通过多层预测加速推理,提升长文本生成速度。整体训练采用AdamW优化,逐步调节学习率和批次大小,确保训练稳定性。评估涵盖数学、编码、推理等多任务,结果显示MiMo-7B-Base在推理任务中超越32B模型,RL调优后性能进一步提升,超越OpenAI o1-mini。
关键结果
- MiMo-7B-Base在BBH达75.2分,超越同参数模型,展现出卓越推理能力。其在SuperGPQA、GSM8K等多项任务中表现优异,显著优于Llama-3.1-8B和Qwen2.5-7B。RL调优模型MiMo-7B-RL在数学(AIME 2025达55.4分)和编码(LiveCodeBench v5得32.9)任务中超越OpenAI o1-mini,证明其推理潜能的有效激发。模型在长文本理解(支持32K上下文)方面表现出色,达近乎完美的检索与推理能力。实验结果验证了多源高质量数据和多Token预测机制对推理能力的促进作用。
- 结果还显示,MiMo-7B在多任务、多场景下具有广泛适应性,特别是在复杂推理、长文本理解和代码生成方面表现优异。模型的推理能力不仅体现在单一任务中,更在多任务融合中展现出强大潜力,预示未来大模型在多领域的应用前景。
- 通过策略重采样和高效基础设施,模型训练效率大幅提升,训练时间缩短近一半,验证速度提升近两倍,极大推动了大模型的实用化进程。
研究意义
本研究突破了小参数模型在推理任务中的瓶颈,证明通过优化预训练数据和引入多Token预测机制,模型推理潜能可以被充分激发。其在数学、编程和长文本理解等多个复杂任务中表现优异,为未来AI系统的智能化提供了新路径。模型的开源也为学术界和工业界提供了宝贵资源,有助于推动大规模推理模型的研发与应用。该工作不仅提升了模型的推理能力,也展示了高效训练和验证的技术方案,为大模型的可持续发展奠定基础。
技术贡献
本研究提出了多源数据优化、三阶段数据混合策略和多Token预测(MTP)机制,显著提升模型推理能力。引入Synthetic reasoning数据丰富推理模式,结合基于难度的奖励方案,改善稀疏奖励问题。开发高效的RL基础设施,实现训练与验证的加速。模型架构采用Group-Query Attention和pre-RMSNorm,结合长上下文支持,优化推理路径。整体训练流程结合动态学习率调节和策略重采样,确保训练稳定性和效率。该方法在参数规模较小的模型中实现了超越更大模型的推理表现,展示了数据和机制创新的巨大潜力。
新颖性
本工作首次系统性结合多源高质量数据、三阶段数据混合策略和多Token预测机制,显著增强小参数模型的推理能力。提出基于难度的奖励方案,有效缓解稀疏奖励问题,提升训练稳定性。开发高效RL基础设施,实现训练与验证的快速迭代。与传统模型主要依赖模型规模不同,本研究强调数据和机制创新在推理能力中的核心作用,开辟了小模型高性能推理的新路径。
局限性
- 模型在极端复杂推理任务或超大规模知识推理中仍存在一定局限,部分任务表现不及超大模型,原因在于模型容量和训练数据的限制。
- 训练成本较高,尤其是在多Token预测和RL阶段,硬件资源需求大,限制了广泛应用。
- 模型对某些特殊领域知识的掌握仍不足,未来需引入更丰富的专业数据进行微调。
未来方向
未来将探索更高效的多Token预测机制,优化训练流程,降低成本。计划引入更丰富的专业领域数据,提升模型在特定任务中的表现。还将研究模型的可解释性和鲁棒性,增强其在实际应用中的可靠性。进一步结合多模态信息,拓展模型的多任务能力,推动推理模型在工业界的落地应用。
AI 总览摘要
近年来,深度学习模型在自然语言处理领域取得了巨大突破,但其推理能力仍受限于模型规模和训练数据的丰富程度。传统大模型如GPT-4、Claude 3.7虽然表现优异,但训练成本极高,难以普及。为此,本文提出MiMo-7B,通过创新的数据预处理、多阶段数据混合和多Token预测机制,有效激发了模型的推理潜能。预训练阶段,模型在25万亿Token基础上,融合Synthetic reasoning数据,强化推理模式。后训练阶段,构建130K验证问题集,采用基于难度的奖励方案,结合策略重采样,稳定训练过程。模型架构基于Decoder-only Transformer,集成Group-Query Attention和长上下文支持,显著提升长文本理解能力。实验结果显示,MiMo-7B在多项推理任务中超越更大模型,特别是在数学(AIME 2025达55.4分)和编码(LiveCodeBench v5得32.9)任务中表现优异。RL调优后,模型性能进一步提升,超越OpenAI o1-mini,展现出强大的推理潜能。该研究不仅证明了数据和机制创新在模型推理中的关键作用,也为未来小参数高性能模型提供了新思路。模型开源,惠及学术与工业界,推动智能系统的持续发展。
深度分析
研究背景
近年来,大规模预训练语言模型(如GPT系列、BERT、LLaMA)在自然语言理解和生成方面取得突破,但其推理能力仍受限于模型参数和训练数据的丰富程度。深度强化学习(RL)被广泛应用于提升模型推理能力,尤其在数学、编码等专业任务中表现突出。现有研究多依赖超大模型(如32B参数以上)进行微调,难以普及。近年来,少参数模型在推理任务中的潜力逐渐被关注,如何在参数有限的情况下激发模型的推理潜能成为研究热点。此前的工作如DeepSeek、Qwen等在多任务、多场景中展现出一定的推理能力,但仍存在模型规模大、训练成本高、推理速度慢等问题。本研究旨在通过优化预训练数据和机制,提升小模型的推理能力,为模型普及和工业应用提供新路径。
核心问题
当前大模型在推理任务中的表现虽优,但训练成本高昂,难以普及。同时,模型在长文本推理、复杂数学问题和代码生成中仍存在瓶颈。如何在参数规模有限的情况下,激发模型的潜在推理能力,成为亟待解决的问题。传统方法多依赖模型规模扩展,导致训练成本激增,且难以实现实时推理。现有模型在多任务融合和长上下文理解方面表现不足,限制了其在实际场景中的应用。解决这一问题需要在数据、模型机制和训练策略上进行创新,以实现高效、强大的推理能力。
核心创新
本研究的核心创新包括:1)多源高质量数据预处理与三阶段混合策略,丰富推理模式;2)引入Synthetic reasoning数据,增强模型推理潜能;3)多Token预测(MTP)机制,通过多层预测加速推理,提升长文本生成速度;4)基于难度的奖励方案,有效缓解稀疏奖励问题;5)高效RL基础设施,显著提升训练验证效率。模型架构采用Group-Query Attention和长上下文支持,结合多Token预测机制,优化推理路径。整体流程强调数据质量和机制创新,突破了参数规模限制,展现出超越更大模型的推理能力。这些创新为小模型高性能推理提供了新思路,推动了AI推理能力的普及。
方法详解
- �� 数据预处理:开发高效HTML、PDF提取工具,优化数学和代码内容的提取;进行全局去重和多维过滤,确保数据质量。• 数据混合:采用三阶段策略,第一阶段融合多源数据,过滤低质量内容;第二阶段增加数学和代码数据比例至70%;第三阶段引入Synthetic推理数据,扩展上下文长度至32K。• 模型架构:基于Decoder-only Transformer,集成GQA、pre-RMSNorm、SwiGLU和RoPE。• 多Token预测:在预训练中使用单层MTP,推理时多层并行预测,加速推理路径。• 训练策略:采用AdamW优化,逐步调节学习率和批次,结合策略重采样,确保训练稳定。• RL训练:构建130K验证问题集,设计基于难度的奖励方案,利用高效基础设施实现快速训练。• 评估:在多任务、多场景下测试模型推理能力,验证其超越更大模型的潜能。
实验设计
实验采用多任务评估,包括数学(GSM8K、AIME)、编码(LiveCodeBench、HumanEval)和推理(BBH、SuperGPQA)等数据集。模型参数为36层、隐藏维度4096,训练在25万亿Token基础上,结合多Token预测和Synthetic数据。对比基线包括Llama-3.1-8B、Qwen2.5-7B等。评估指标涵盖准确率、Pass@k、F1等。通过 ablation 实验验证多Token预测和难度奖励的贡献。模型在数学(AIME 2025达55.4分)、编码(LiveCodeBench v5得32.9)和长文本理解(支持32K上下文)中表现优异,超越同参数模型。
结果分析
MiMo-7B-Base在多项推理任务中优于32B模型,特别是在BBH(75.2分)和SuperGPQA中表现突出。RL调优模型MiMo-7B-RL在数学(AIME 2025达55.4分)和代码(LiveCodeBench v5得32.9)任务中显著优于OpenAI o1-mini。模型在长文本理解(支持32K上下文)和复杂推理场景中表现出色,验证了机制创新的有效性。实验还显示,模型在多任务融合中具备广泛适应性,未来可在多模态和专业领域拓展。
应用场景
模型可广泛应用于数学教育、自动编码、法律和科研等领域的复杂推理任务。其长上下文能力适合长篇文档分析、法律审查和科研论文理解。工业界可利用其推理能力提升自动化水平,推动智能问答、自动编程等应用落地。未来,结合多模态信息,模型有望实现跨领域的智能推理与决策支持。
局限与展望
模型在极端复杂推理或超大知识推理中仍有限,部分任务表现不及超大模型。训练成本高,硬件资源需求大,限制普及。对某些专业知识掌握不足,需引入更丰富的领域数据进行微调。未来需优化模型架构和训练流程,降低成本,提升鲁棒性和解释性。
通俗解读 非专业人士也能看懂
想象你在一家工厂工作,工厂里有许多不同的机器,每台机器都能做不同的事情。为了让工厂更高效,你不断优化机器的设计和操作流程。这个研究就像是在改造一台“智能机器”,让它能更聪明、更快地解决问题。科学家们用大量的“原料”——也就是各种各样的文本和代码——来“喂养”这台机器,让它学会推理和解决复杂问题。通过特殊的“训练方法”,这台机器变得越来越聪明,甚至可以在数学题、编程任务中表现得比一些更大更复杂的机器还要好。它还能理解长长的文章和对话,就像你能记住一整本书一样。这个研究的目标是让这些“智能机器”变得更聪明、更快、更实用,从而帮助人们在学习、工作和生活中解决更难的问题。
简单解释 像给14岁少年讲一样
想象你有一台超级聪明的机器人,它可以帮你解数学题、写代码,还能理解很长的故事。可是,要让它变得更聪明,不仅仅是让它变大,而是教它用更聪明的方法学习。科学家们用很多不同的书、网页和题目来“喂养”这台机器人,让它学会推理和解决问题。为了让它更快地回答问题,他们还设计了一种特别的预测方法,让机器人在思考时可以提前“猜测”下一步的答案,就像你在猜谜一样。经过这些努力,这台机器人变得非常厉害,不仅能在数学和编程比赛中获奖,还能理解长长的文章,比以前的模型更聪明、更快。它就像是一个超级助手,可以帮你学习、工作,甚至解决一些以前很难的问题。未来,这样的机器人会变得越来越聪明,帮助我们做更多事情!
原文摘要
We present MiMo-7B, a large language model born for reasoning tasks, with optimization across both pre-training and post-training stages. During pre-training, we enhance the data preprocessing pipeline and employ a three-stage data mixing strategy to strengthen the base model's reasoning potential. MiMo-7B-Base is pre-trained on 25 trillion tokens, with additional Multi-Token Prediction objective for enhanced performance and accelerated inference speed. During post-training, we curate a dataset of 130K verifiable mathematics and programming problems for reinforcement learning, integrating a test-difficulty-driven code-reward scheme to alleviate sparse-reward issues and employing strategic data resampling to stabilize training. Extensive evaluations show that MiMo-7B-Base possesses exceptional reasoning potential, outperforming even much larger 32B models. The final RL-tuned model, MiMo-7B-RL, achieves superior performance on mathematics, code and general reasoning tasks, surpassing the performance of OpenAI o1-mini. The model checkpoints are available at https://github.com/xiaomimimo/MiMo.