Augmenting Math Word Problems via Iterative Question Composing

TL;DR

提出IQC方法生成MMIQC数据集,Qwen-72B-MMIQC在MATH基准上达45.0%准确率。

cs.CL 🔴 高级 2024-01-17 28 次浏览
Haoxiong Liu Yifan Zhang Yifan Luo Andrew Chi-Chih Yao
数学推理 数据增强 大语言模型 开源模型 基准测试

核心发现

方法论

提出迭代问题生成(IQC)方法,通过GPT-4生成新问题并用GPT-3.5进行拒绝采样,结合现有数据构建MMIQC数据集以增强数学推理能力。

关键结果

  • Qwen-72B-MMIQC在MATH基准测试中达45.0%准确率,比开源SOTA高8.2%,超越2023年发布的GPT-4初版。
  • MMIQC增强模型在匈牙利高中数学考试中表现优异,证明其泛化能力。
  • 通过消融实验发现IQC方法贡献显著,单独使用IQC数据提升模型准确率3.1%。

研究意义

研究解决了开源LLM在复杂数学问题上的性能瓶颈,为数学推理领域提供了新的数据增强方法,推动了开源模型在学术和工业中的应用。

技术贡献

首次结合高质量预训练语料和合成数据进行微调,提出IQC方法显著提高数据多样性,优化了数学推理性能。

新颖性

IQC方法通过迭代生成复杂问题扩展数据集,避免传统数据增强方法的单一性,显著提升模型性能。

局限性

  • IQC生成的问题复杂性有限,可能无法覆盖所有数学领域。
  • 拒绝采样依赖GPT-3.5的准确性,可能存在错误答案过滤不完全的情况。
  • 模型微调成本较高,尤其是对于较大的模型如Qwen-72B。

未来方向

未来可探索IQC在其他领域的应用,如科学问题生成,并优化采样效率以降低计算成本。

AI 总览摘要

尽管大型语言模型在数学推理方面取得了进展,但解决竞赛级数学问题仍是开源模型的难题。本文提出了一种新的数据增强方法——迭代问题生成(IQC),结合高质量预训练数据和合成数据构建MMIQC数据集。微调后的模型在MATH基准测试中表现出色,其中Qwen-72B-MMIQC准确率达45.0%,显著超越开源SOTA和GPT-4初版。

IQC方法通过GPT-4生成新问题并用GPT-3.5进行拒绝采样,确保生成数据的质量和多样性。实验表明,IQC方法不仅提升了模型在数学推理上的表现,还具有良好的泛化能力,在匈牙利高中数学考试中也取得了优异成绩。

尽管如此,IQC方法仍存在生成问题复杂性有限和微调成本较高的局限性。未来研究可探索其在其他领域的应用,并优化采样效率以进一步降低成本。

深度分析

研究背景

数学推理是人工智能领域的重要挑战,尤其是竞赛级数学问题。现有开源LLM在MATH基准测试中的表现远低于闭源模型,如GPT-4和Gemini-Ultra。传统数据增强方法如拒绝采样和问题引导生成虽有一定效果,但数据多样性和质量仍是瓶颈。

核心问题

开源LLM在复杂数学问题上的表现受限于数据质量和模型推理能力。如何构建高质量、多样化的数据集以提升模型性能是亟待解决的问题。

核心创新

提出IQC方法,通过迭代生成复杂问题扩展数据集,结合高质量预训练语料和合成数据进行微调。IQC避免了传统数据增强方法的单一性,显著提升数据多样性和模型性能。

方法详解

  • �� 使用GPT-4生成新问题,基于种子问题进行扩展。
  • �� 用GPT-3.5进行拒绝采样,过滤错误答案。
  • �� 构建MMIQC数据集,包含120万问题-答案对。
  • �� 微调多种模型,包括Qwen-72B,优化数学推理能力。

实验设计

在MATH基准测试中评估模型性能,使用零样本设置提取答案并比较准确率。还在匈牙利高中数学考试中测试模型的泛化能力。进行消融实验分析MMIQC各子集的贡献。

结果分析

Qwen-72B-MMIQC在MATH基准测试中准确率达45.0%,比MetaMathQA微调模型高8.2%。IQC方法单独提升模型准确率3.1%。匈牙利考试成绩验证了模型的泛化能力。

应用场景

可用于数学教育中的自动题目生成和解题辅助,帮助学生理解复杂问题。也可应用于数学竞赛备赛和研究领域。

局限与展望

IQC生成的问题复杂性有限,可能无法覆盖所有数学领域。微调成本较高,尤其是对于大规模模型。拒绝采样依赖GPT-3.5的准确性,可能存在过滤不完全的情况。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,IQC就像一个厨师助手,它会根据你的原始食材(种子问题)不断创造新的菜谱(问题),并确保每道菜都符合你的口味(答案正确)。这个助手不仅能帮你扩展菜单,还能提升你的厨艺(模型性能)。

简单解释 像给14岁少年讲一样

假设你在玩一个解谜游戏,IQC就像一个超级聪明的队友,它会根据你已经解开的谜题,创造更多有趣的谜题让你挑战!而且它会检查每个谜题的答案是否合理,确保你玩的每一关都很棒!

术语表

IQC (迭代问题生成)

一种数据增强方法,通过迭代生成复杂问题扩展数据集。

用于生成MMIQC数据集中的合成问题。

MMIQC

一个包含高质量数学问题和答案的数据集,用于微调LLM。

提升模型在MATH基准测试中的表现。

拒绝采样

通过过滤错误答案提高数据质量的方法。

用于IQC生成问题的质量控制。

MATH基准测试

一个包含5000道竞赛级数学问题的测试集。

评估模型数学推理能力的标准。

Qwen-72B

一种开源大语言模型,微调后在数学推理中表现优异。

在MMIQC数据集上微调并测试。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升IQC生成问题的复杂性以覆盖更多领域?
  • 2 如何优化拒绝采样效率以降低计算成本?
  • 3 IQC方法在其他领域的适用性如何?

应用场景

近期应用

数学教育

自动生成题目和解题辅助,帮助学生理解复杂问题。

竞赛备赛

为数学竞赛选手提供高质量训练题目。

远期愿景

跨领域问题生成

将IQC方法应用于科学、逻辑推理等领域,推动AI在复杂问题上的应用。

原文摘要

Despite the advancements in large language models (LLMs) for mathematical reasoning, solving competition-level math problems remains a significant challenge, especially for open-source LLMs without external tools. We introduce the MMIQC dataset, comprising a mixture of processed web data and synthetic question-response pairs, aimed at enhancing the mathematical reasoning capabilities of base language models. Models fine-tuned on MMIQC consistently surpass their counterparts in performance on the MATH benchmark across various model sizes. Notably, Qwen-72B-MMIQC achieves a 45.0% accuracy, exceeding the previous open-source state-of-the-art by 8.2% and outperforming the initial version GPT-4 released in 2023. Extensive evaluation results on Hungarian high school finals suggest that such improvement can generalize to unseen data. Our ablation study on MMIQC reveals that a large part of the improvement can be attributed to our novel augmentation method, Iterative Question Composing (IQC), which involves iteratively composing new questions from seed problems using an LLM and applying rejection sampling through another LLM.

cs.CL cs.AI cs.LG