InternLM-Math: Open Math Large Language Models Toward Verifiable Reasoning
InternLM-Math结合链式推理、奖励模型和形式证明,达成SOTA性能。
核心发现
方法论
该研究将链式推理、奖励模型、形式推理、数据增强和代码解释器统一为序列到序列(seq2seq)格式,训练多能力模型。通过继续预训练InternLM2-Base,结合高质量数学数据集,模型在GSM8K、MATH、MiniF2F等多项基准测试中实现SOTA表现。采用多任务监督,包括问题求解、验证、证明和增强辅助,提升模型的多样性和泛化能力。引入推理与编码交互(RICO)机制,增强复杂计算能力。利用LEAN实现形式证明,结合奖励模型进行路径筛选,提升推理可信度。
关键结果
- 模型在MiniF2F测试集达到30.3分,无需微调,优于大部分公开模型。基于ICL、监督微调和代码辅助推理,模型在GSM8K、MATH等任务中表现优异,达到或超越GPT-4的相对水平。模型还在形式证明任务MiniF2F中实现了30.3的最高性能,显著优于之前的SOTA。
- 通过多任务训练和奖励模型筛选,模型在数学推理、验证和证明方面展现出强大的能力。利用LEAN进行形式验证,提升推理的可信度和可解释性。模型在多项正式和非正式基准中均取得优异成绩,验证了其多能力融合的有效性。
- 引入推理与编码交互机制(RICO)显著增强复杂计算能力,模型在多轮推理中表现优异。数据增强和路径筛选策略有效减少错误,模型在多任务、多场景中表现出良好的适应性和鲁棒性。
研究意义
该研究突破了大语言模型在数学推理中的瓶颈,通过多能力融合实现了更高的推理可信度和泛化能力。模型在正式证明和复杂计算任务中的优异表现,为数学自动化、教育和科研提供了强有力的工具。其统一的框架和多任务训练策略,为未来构建更智能、更可信的数学AI奠定基础,推动AI在科学研究中的应用深化。模型的开源也将极大促进学术交流与技术创新。
技术贡献
本研究提出了将链式推理、奖励模型、形式证明和代码解释器统一为序列到序列模型的创新框架,实现多能力一体化。引入推理与编码交互(RICO)机制,显著提升复杂计算和多轮推理能力。结合LEAN实现形式验证,创新性地将形式证明融入大模型训练流程。通过多任务监督和数据增强策略,模型在多项数学基准中实现SOTA,展示了多能力融合的潜力。这些技术突破为大模型在数学推理中的可信性和实用性提供了新路径。
新颖性
首次将链式推理、奖励模型、形式证明和代码解释器全部融合在统一的序列到序列框架中,特别引入推理与编码交互机制(RICO),增强多轮复杂推理能力。利用LEAN实现形式验证,提升推理的可信度,突破了以往单一任务或单一能力模型的局限。模型在多个正式和非正式数学基准中均达到了SOTA水平,展示了多能力融合的创新优势。
局限性
- 模型在极端复杂的数学证明或超大规模推理路径中仍存在一定的错误率,主要由于推理路径的累积误差。形式验证依赖LEAN的表达能力,可能受限于语言表达的准确性。训练成本较高,模型参数规模大,推理速度有限,限制了实时应用的普及。
- 在某些特定数学领域(如高阶微积分、抽象代数)表现仍有待提升,未来需引入更专业的数学知识库。模型对输入的敏感性较高,微小变化可能导致推理偏差。
未来方向
未来将进一步优化推理路径的准确性,结合更丰富的数学知识库,提升模型在高阶数学中的表现。探索更高效的推理与验证机制,降低计算成本。推动模型在实际科研和教育中的应用,如自动定理证明、数学教学辅助等。加强模型的可解释性和可信度,结合符号推理和深度学习,打造更智能的数学AI系统。
AI 总览摘要
InternLM-Math代表了大规模数学推理模型的最新进展。通过继续预训练和多任务微调,模型融合链式推理、奖励模型、形式证明和代码解释能力,显著超越了现有的公开模型。在基础能力方面,模型在GSM8K、MATH等标准数据集上展现出优异表现,达到了30.3的MiniF2F得分,几乎接近GPT-4的水平。这一突破得益于创新的推理与编码交互(RICO)机制,使模型在多轮复杂推理和计算任务中表现出色。模型不仅在非正式推理任务中表现优异,还在正式数学证明中实现了30.3的最高性能,验证了其在科学研究和教育中的潜力。该研究还引入LEAN作为形式验证工具,增强推理的可信度和可解释性,为自动定理证明提供了新思路。模型的开源极大促进了学术交流,为未来构建更智能、更可信的数学AI奠定基础。未来的工作将聚焦于提升推理路径的准确性、降低计算成本,并拓展在科研和教育中的应用场景,推动AI在数学领域的深度融合。
深度分析
研究背景
数学推理一直是人工智能中的难点,早期模型多依赖符号推理或规则系统。近年来,深度学习模型如GPT系列、Minerva、Llemma在数学任务中取得突破,但仍存在推理可信度不足、复杂计算能力有限的问题。链式推理(Chain-of-Thought)引入显著提升了模型的推理能力,但多能力融合仍是挑战。此前的工作多集中在单一任务或单一能力上,缺乏系统性解决方案。随着大模型的发展,结合形式证明、代码解释和奖励模型成为新的研究方向,旨在实现更可信、更通用的数学AI。
核心问题
现有大模型在数学推理中的表现虽有所提升,但在复杂推理、多轮验证和形式证明方面仍存在不足。模型推理路径易出错,可信度不足,难以满足科研和教育的需求。如何融合多能力、提升推理可信度、降低错误率成为核心难题。此外,模型在高阶数学和抽象证明中的泛化能力仍待加强,限制了其应用范围。
核心创新
本研究提出多能力融合框架,将链式推理、奖励模型、形式证明和代码解释器统一为序列到序列模型。引入推理与编码交互(RICO)机制,增强多轮复杂推理能力。利用LEAN实现形式验证,提升推理可信度。采用多任务监督和数据增强策略,显著提升模型在多项数学基准中的表现。这些创新突破了单一能力模型的局限,为数学AI的可信性和实用性提供新路径。
方法详解
- �� 继续预训练:基于InternLM2-Base,结合数学相关数据(如arXiv、web页面、合成数据)进行大规模预训练。• 多任务微调:在链式推理、奖励模型、形式证明和代码解释等多任务上进行微调,增强模型多能力。• 统一序列格式:将推理、验证、证明等任务统一为seq2seq输入输出格式,便于多能力集成。• 推理与编码交互(RICO):多轮推理中引入代码生成和执行,增强复杂计算能力。• 形式验证:利用LEAN将推理路径转化为形式证明,提升可信度。• 数据增强:通过路径筛选、合成问题和路径扩展,丰富训练样本。
实验设计
模型在GSM8K、MATH、Hungary数学考试、MathBench-ZH和MiniF2F等数据集上进行评估。采用ICL、微调和代码辅助推理,比较不同模型参数(7B、20B)和训练策略的效果。使用多数投票和贪婪解码作为指标,验证模型在零样本推理和正式证明中的表现。对比基线模型如Llemma、Minerva和GPT-4,展示模型的优越性。还通过LEAN验证推理路径的正确性,分析模型在复杂推理中的表现差异。
结果分析
模型在MiniF2F测试集达到30.3分,优于大部分公开模型,接近GPT-4水平。在GSM8K和MATH任务中,ICL表现优异,达到了82.6%和37.7%的准确率。结合奖励模型筛选后,推理路径的正确率显著提升。在形式证明任务中,模型实现了最高的30.3得分,验证了多能力融合的有效性。多轮推理和代码交互机制显著增强了复杂计算能力,模型在多任务场景中表现稳定。
应用场景
模型可应用于自动定理证明、数学教育辅助、科研中的公式验证和复杂计算自动化。其多能力融合使其在科研、教育、工程等多个领域具有广泛潜力。模型的开源也为学术界提供了强有力的工具,加速数学AI的发展。未来可结合符号推理和深度学习,推动智能数学系统的构建。
局限与展望
模型在极端复杂证明或超大规模推理路径中仍存在误差,推理路径的累积误差影响可信度。形式验证依赖LEAN的表达能力,可能受限于语言表达的准确性。训练成本高,参数规模大,推理速度有限,限制了实时应用。高阶数学领域表现尚需提升,未来需引入更多专业知识库。
通俗解读 非专业人士也能看懂
想象一个工厂,里面有很多不同的机器,每台机器都负责不同的任务,比如制造零件、组装、检测等。以前,这些机器都只能做单一任务,不能合作。现在,研究人员设计了一台特别的智能机器,它不仅能自己解决问题,还能验证其他机器的工作,还能用“代码”这个工具来帮助自己做复杂的计算。这个新机器可以像人一样,先想好步骤,再一步步完成任务,还能用“形式证明”确保每一步都正确。这样一来,它在数学问题上变得非常聪明,能解决以前难以攻克的问题。这个研究就像让工厂里的机器变得更智能、更合作,未来可以用在科学研究、教育甚至自动证明数学定理。
简单解释 像给14岁少年讲一样
想象你在学校里学数学,有时候老师会出一些难题,你需要一步步推理才能找到答案。以前的电脑程序就像只会做简单计算的机器人,遇到复杂问题就不知道怎么解决。现在,科学家们设计了一台超级聪明的机器人,它不仅能自己思考,还能检查自己的答案是否正确,还能用一种叫“代码”的特殊语言来帮忙计算。这个机器人可以多次思考、验证,确保每一步都没有错,就像你做数学题时反复检查一样。它还能用“形式证明”来证明一些数学定理,确保答案绝对正确。这个研究让机器人变得更聪明、更可靠,将来可以帮助我们解决更难的数学问题,甚至帮助科学家们发现新定理。是不是很酷?
原文摘要
The math abilities of large language models can represent their abstract reasoning ability. In this paper, we introduce and open-source our math reasoning LLMs InternLM-Math which is continue pre-trained from InternLM2. We unify chain-of-thought reasoning, reward modeling, formal reasoning, data augmentation, and code interpreter in a unified seq2seq format and supervise our model to be a versatile math reasoner, verifier, prover, and augmenter. These abilities can be used to develop the next math LLMs or self-iteration. InternLM-Math obtains open-sourced state-of-the-art performance under the setting of in-context learning, supervised fine-tuning, and code-assisted reasoning in various informal and formal benchmarks including GSM8K, MATH, Hungary math exam, MathBench-ZH, and MiniF2F. Our pre-trained model achieves 30.3 on the MiniF2F test set without fine-tuning. We further explore how to use LEAN to solve math problems and study its performance under the setting of multi-task learning which shows the possibility of using LEAN as a unified platform for solving and proving in math. Our models, codes, and data are released at \url{https://github.com/InternLM/InternLM-Math}.