MathArena: Evaluating LLMs on Uncontaminated Math Competitions

TL;DR

MathArena基于新颖竞赛流,评估LLMs数学推理与证明能力,避免数据污染。

cs.AI 🔴 高级 2025-05-29 47 次浏览
Mislav Balunović Jasper Dekoninck Ivo Petrov Nikola Jovanović Martin Vechev
数学推理 基准测试 大模型 证明写作 数据污染

核心发现

方法论

该研究提出MathArena基准,利用持续更新的数学竞赛题库,实时评估LLMs的推理与证明能力。通过在题目发布后立即测试模型,有效避免了数据污染。采用自动解析、人工评分和多轮响应平均,确保评估的公正性与可靠性。涵盖7项竞赛,共162题,覆盖代数、几何、数论等领域。模型性能通过准确率、证明质量等指标衡量,结合统计置信区间分析模型排名。实验显示,最优模型在AIME 2024中表现出明显污染迹象,但在更难的CMIMC 2025中展现出强大推理能力,证明该方法的有效性。

关键结果

  • 在AIME 2024中,模型表现受到污染影响,部分模型得分高于人类顶尖水平(如QWQ-PREVIEW-32B超出预期60%),但在无污染的CMIMC 2025中,顶尖模型达成90%以上的准确率,显示出强推理能力。
  • 在IMO 2025中,模型证明写作能力达不到预期,最高仅接近40%,表明证明能力仍有巨大提升空间。
  • 评估了50余模型,涵盖7项竞赛,验证了MathArena在动态、无污染环境下的评估优势,为未来数学AI发展提供了可靠基准。

研究意义

该研究突破了传统静态、易污染的数学基准限制,提出实时、 uncontaminated的评估框架,极大提升了模型推理与证明能力的评估可信度。其创新在于利用真实竞赛题库,确保数据新鲜与原始,推动AI在数学推理、证明写作等方面的长远发展。此方法不仅为学术界提供了更公平的评测工具,也为工业界开发更具推理能力的AI系统奠定基础,解决了现有基准在可复现性、透明性和动态性上的核心难题。

技术贡献

论文提出了完整的MathArena评估流程,包括题目提取、模型响应、自动解析、人工评分和统计分析。引入基于竞赛题库的动态评测机制,结合自动化解析和人工验证,确保评估的公正性。创新性在于实现实时无污染评估,利用多模型、多轮响应平均提升鲁棒性,并开发了支持证明写作的评分体系,为未来数学AI评估树立新标杆。

新颖性

首次提出基于持续更新竞赛题库的动态、 uncontaminated评估框架,区别于传统静态、公开数据集,极大降低数据污染风险。该方法结合自动解析与人工评分,兼顾效率与准确性,特别在证明写作能力评估方面实现突破,填补了现有基准的空白。

局限性

  • 当前模型在证明写作方面仍表现不足,准确率低于40%,需进一步优化推理与逻辑能力。
  • 评估依赖人工评分,存在主观性和效率瓶颈,未来需发展自动化证明验证技术。
  • 部分竞赛题目可能仍存在在线资源泄露风险,影响污染控制效果。

未来方向

未来将扩展竞赛题库,涵盖更多数学领域与难度层级,提升自动解析和证明验证技术,推动模型在复杂推理和证明写作上的突破。同时,计划引入多模态评估,结合图形、代码等多样化题型,完善动态无污染评估体系,推动数学AI的长远发展。

AI 总览摘要

MathArena创新性地利用持续更新的数学竞赛题库,建立了一个动态、 uncontaminated的评估平台,解决了传统基准面临的数据污染和可复现性难题。通过在题目发布后立即测试模型,有效避免了模型在训练中“记忆”竞赛题的风险,确保评估的真实性和前瞻性。该平台涵盖7项竞赛,总计162题,涉及多种数学领域,采用自动解析、人工评分和多轮响应平均等多重机制,确保评估的公正性与可靠性。实验结果显示,最优模型在AIME 2024中表现出明显污染迹象,但在更难的CMIMC 2025中展现出强大推理能力,证明了该方法的有效性。值得注意的是,模型在证明写作方面仍有提升空间,最高仅达40%左右。该研究不仅为学术界提供了更公平、透明的评测工具,也为工业界开发具有深度推理能力的AI系统提供了重要参考。未来,MathArena将持续扩展题库,结合新兴技术,推动数学AI的长远发展,成为衡量模型推理与证明能力的权威平台。

深度分析

研究背景

近年来,随着大规模语言模型(LLMs)在自然语言处理中的突破,其在数学推理领域的能力也受到广泛关注。早期的数学基准如GSM8K、MATH等,已被模型大幅突破,但存在数据污染和评估局限。AIME、USAMO等竞赛题库因在线公开,导致模型训练中潜在“记忆”问题,影响评估公正性。为解决这一难题,研究者尝试私有化、动态更新的评测体系,但仍面临成本高昂、透明度不足等挑战。本文提出MathArena,利用未公开的竞赛题库,实时评估模型推理与证明能力,填补了现有方法的空白。

核心问题

传统数学基准多依赖公开题库,易被模型训练数据污染,导致模型在测试集上的表现失去可信度。此外,现有评测多侧重于最终答案,忽视推理过程和证明能力,难以全面衡量模型的数学理解深度。如何在保证公平、实时、无污染的前提下,准确评估模型的推理和证明能力,成为亟待解决的核心问题。

核心创新

本研究提出基于持续更新竞赛题库的动态评估框架,避免了静态数据集的污染风险。引入自动解析与人工评分相结合的多轮响应机制,确保评估的准确性。特别在证明写作方面,首次实现了自动评分体系,结合模型生成的证明文本,评估其逻辑严密性和正确性。这一创新极大提升了评估的可信度和全面性,为未来数学AI的发展提供了新思路。

方法详解

  • �� 题目提取:从竞赛官网或官方数据库获取题目,格式化为标准模板。
  • �� 模型响应:在题目发布后,立即用多模型进行响应,避免训练数据污染。
  • �� 解析与评分:自动解析答案或由人工评审证明,结合规则和模型判定进行评分。
  • �� 统计分析:利用置信区间和排名分析,确保结果的稳健性。
  • �� 竞赛覆盖:涵盖代数、几何、数论等领域,确保多样性与挑战性。

实验设计

采用AIME 2024、CMIMC 2025、IMO 2025等竞赛题,评估50余模型,指标包括准确率、证明质量、响应一致性。模型响应四次取平均,确保稳定性。通过对污染迹象的分析,验证了平台的无污染特性。实验还包括不同模型规模、不同推理策略的对比,验证平台的适应性和评估效果。

结果分析

最优模型在AIME 2024中表现优异,准确率达91.3%,远超人类顶尖水平,但污染迹象明显。CMIMC 2025中,模型在无污染环境下达90%以上,展现出强推理能力。证明写作方面,最高仅40%,显示出巨大提升空间。整体验证了MathArena在动态、无污染评估中的优势,为未来模型优化提供了方向。

应用场景

该平台可用于学术界评估新模型推理能力,推动数学AI研究;同时也为工业界开发更具逻辑推理和证明能力的AI助手提供基础。未来还可扩展到教育、自动证明、科研等多个场景,促进AI在数学领域的深度应用。

局限与展望

目前模型证明能力仍不足,自动评分技术尚不成熟,存在主观性和误判风险。部分竞赛题仍可能存在在线泄露,影响污染控制。未来需加强自动验证技术,扩展题库和难度层级,提升评估的全面性与公正性。

通俗解读 非专业人士也能看懂

想象你在参加一个数学比赛,但这个比赛的题目都来自过去的题库,很多题目早就被人记住或在网上看到过。为了公平起见,你的老师决定每次比赛刚开始就给你出新题,这样你就不能提前知道答案。这个方法就像MathArena一样,利用最新的竞赛题,确保每次评测都是真实的考验。模型就像学生,试图用自己的推理能力解决问题,而不是靠记忆。通过不断测试不同的模型,我们可以知道它们真正的数学理解水平,就像老师观察学生的思考过程一样。这样的方法帮助我们筛选出真正聪明、会推理的AI,而不是那些靠背题的“作弊者”。

简单解释 像给14岁少年讲一样

想象你在参加一个数学比赛,但题目都是刚刚出来的,从来没有人提前知道过。每次比赛开始,老师就给你一些新题,你得用自己的脑袋想办法解决。这样一来,没有人能提前准备答案,大家都得靠自己聪明才智。这个方法就像MathArena,它用最新的题目来测试AI,确保它们不是靠记忆,而是真正会推理。模型就像学生,试图用逻辑和数学知识解题,而不是死记硬背。通过不断测试不同的AI,我们可以知道谁最聪明、最会推理,就像老师观察学生的思考过程一样。这样,我们就能找到真正厉害的AI助手,帮助我们解决复杂的数学问题。

原文摘要

The rapid advancement of reasoning capabilities in large language models (LLMs) has led to notable improvements on mathematical benchmarks. However, many of the most commonly used evaluation datasets (e.g., AIME 2024) are widely available online, making it difficult to disentangle genuine reasoning from potential memorization. Furthermore, these benchmarks do not evaluate proof-writing capabilities, which are crucial for many mathematical tasks. To address this, we introduce MathArena, a new benchmark based on the following key insight: recurring math competitions provide a stream of high-quality, challenging problems that can be used for real-time evaluation of LLMs. By evaluating models as soon as new problems are released, we effectively eliminate the risk of contamination. Using this framework, we find strong signs of contamination in AIME 2024. Nonetheless, evaluations on harder competitions, such as CMIMC 2025, demonstrate impressive reasoning capabilities in top-performing models. MathArena is also the first benchmark for proof-writing capabilities. On IMO 2025, top models achieve slightly less than 40%, demonstrating both notable progress and significant room for improvement. So far, we have evaluated over $50$ models across seven competitions, totaling $162$ problems. As an evolving benchmark, MathArena will continue to track the progress of LLMs on newly released competitions, ensuring rigorous and up-to-date evaluation of mathematical reasoning.

cs.AI cs.CL