Key-Point-Driven Data Synthesis with its Enhancement on Mathematical Reasoning

TL;DR

提出Key-Point-Driven Data Synthesis(KPDDS),构建800K+数学推理问答数据集,显著提升模型性能。

cs.CL 🔴 高级 2024-03-05 28 次浏览
Yiming Huang Xiao Liu Yeyun Gong Zhibin Gou Yelong Shen Nan Duan Weizhu Chen
数据合成 数学推理 大模型微调 知识驱动 算法创新

核心发现

方法论

本文提出基于关键点的知识挖掘与样例实践的KPDDS框架,结合主题共现概率矩阵(TCPM)进行问题生成。核心包括知识提取、TCPM构建、问题生成、质量评估与共识答案生成。利用GPT-4作为标签模型,从真实题库中提取主题和关键点,进行去重和聚类,构建MPKP数据集。通过TCPM指导多主题采样,结合GPT-4生成新题,采用模型评分筛选高质量题目,最后通过投票机制生成答案。该流程在MATH和GSM8K基础上扩展,生成超过800K高质量问答对,训练Qwen1.5-72B模型,显著优于现有同类模型。

关键结果

  • 在GSM8K测试集上,微调后模型达87.0%的PASS@1准确率,超越所有7B-70B模型,接近GPT-4水平。
  • 在MATH数据集上,模型达58.3%的PASS@1,优于多数竞品,平均性能提升超过10%。
  • 结合多源数据,KPMath-Plus达成79.4%的平均准确率,验证了知识驱动合成的有效性。

研究意义

该研究解决了高质量数学推理数据不足的问题,为大规模模型提供了丰富的训练资源,推动模型在复杂推理任务中的表现突破。其知识驱动的合成策略增强了数据的多样性与真实性,具有重要的学术和工业应用价值,尤其在自动化教育、智能辅导和数学研究中具有广泛潜力。

技术贡献

提出结合知识提取、主题共现建模与质量控制的KPDDS框架,创新性地利用TCPM引导问题生成,结合多轮投票机制确保答案可靠性。该方法在数据规模和质量上实现突破,显著提升模型推理能力,提供了可扩展的知识驱动数据合成新范式。

新颖性

本研究首次系统结合关键点提取、主题共现概率建模与多轮质量筛选,提出知识驱动的数学数据合成框架,突破传统纯生成或知识库依赖的局限,显著改善数据多样性和质量,为大模型推理能力提升提供新路径。

局限性

  • 当前方法依赖GPT-4作为标签和生成模型,存在模型偏差和成本较高的问题,难以在资源有限环境中广泛应用。
  • 知识提取和聚类过程可能引入冗余或遗漏,影响数据的代表性和多样性。
  • 生成题目的复杂度受模型能力限制,部分高难度题目生成仍存在挑战。

未来方向

未来将探索多模态知识融合,增强模型对复杂推理的理解能力;优化数据筛选与质量控制机制,降低成本;同时考虑自主知识库构建,减少对大模型的依赖,推动知识驱动数据合成的普及。

AI 总览摘要

随着大规模语言模型(LLMs)在复杂推理任务中的表现不断提升,数据质量成为制约其潜力的关键因素。传统的数学推理数据集如MATH和GSM8K虽具代表性,但规模有限且多依赖人工标注,难以满足模型训练的需求。为此,本文提出Key-Point-Driven Data Synthesis(KPDDS)框架,结合知识提取、主题共现建模与质量控制,系统生成超过800K高质量数学问答对。

该方法通过从真实题库中自动提取主题和关键点,利用TCPM指导多主题采样,结合GPT-4生成新题,经过模型评分和投票筛选,确保数据的多样性和准确性。基于此,构建了KPMath和扩展的KPMath-Plus数据集,显著提升了模型在GSM8K和MATH上的推理性能。微调Qwen1.5-72B模型后,模型在GSM8K达87.0%的PASS@1,优于多数同规模模型,接近GPT-4水平。

这项工作不仅丰富了数学推理训练数据,也为知识驱动的数据合成提供了新范式,推动大模型在复杂推理中的应用前沿。未来,结合多模态信息与自主知识库,将进一步降低成本,提升模型泛化能力,助力智能教育和科研创新。

深度分析

研究背景

近年来,随着GPT-4等大模型的崛起,推动了自然语言理解和推理能力的快速发展。数学推理作为评估模型推理能力的重要指标,吸引了大量研究关注。早期数据集如MATH、GSM8K提供了基础训练资源,但存在规模不足、题目多为人工标注、难以覆盖复杂推理场景的问题。近年来,合成数据的方法逐渐兴起,试图通过自动生成题目提升数据多样性,但多依赖规则或知识库,缺乏真实性。现有研究如Chain-of-Thought prompting、程序化答案等虽有效,但仍面临数据质量和规模的瓶颈。本文在此背景下,提出基于知识驱动的合成框架,以解决数据不足和多样性不足的问题,推动模型推理能力的实质性提升。

核心问题

当前数学推理模型的性能受限于训练数据的质量和规模。虽然存在一些合成数据方法,但多依赖规则或知识库,缺乏真实性和多样性,导致模型泛化能力不足。此外,缺乏系统的知识提取与问题生成机制,难以有效覆盖复杂推理场景。如何高效生成高质量、多样化的数学题目,成为提升模型推理能力的关键。本文旨在通过知识驱动的合成框架,系统挖掘真实题库中的知识点,结合主题共现模型,自动生成符合逻辑且多样化的题目,为模型提供丰富的训练资源。

核心创新

本研究的核心创新在于提出结合知识提取、主题共现建模与质量筛选的KPDDS框架。首先,通过GPT-4自动提取题库中的主题和关键点,建立MPKP数据集。其次,利用TCPM模型分析主题共现关系,指导多主题采样,确保生成题目的合理性。再次,采用GPT-4进行题目生成,并通过模型评分和投票机制筛选高质量题目,提升数据的真实性和多样性。最后,将生成的题目用于微调大模型,显著提升其数学推理能力。这一流程突破了传统纯规则或知识库依赖的局限,提供了可扩展的知识驱动数据合成新范式。

方法详解

  • �� 知识提取:利用GPT-4从真实题库中自动提取主题和关键点,进行去重和聚类,构建MPKP数据集。
  • �� TCPM构建:分析题库中主题的共现关系,生成主题共现概率矩阵,指导多主题采样。
  • �� 问题生成:基于TCPM采样多个主题,从题库中随机选题,结合关键点,利用GPT-4生成新题。
  • �� 质量评估:采用GPT-4模型对生成题目进行打分,筛选得分高于0.85的题目。
  • �� 答案生成:通过多轮采样和投票机制,生成多样化答案,确保答案的正确性和一致性。
  • �� 数据集构建:将高质量题目与答案整合,形成KPMath和KPMath-Plus,作为模型训练基础。

实验设计

在GSM8K和MATH数据集上进行微调,采用PASS@1作为性能指标。模型训练细节包括:使用BFloat16、DeepSpeed ZeRO Stage3、Flash-Attention 2,最大序列长度2048。对比多种模型(如GPT-4、LLaMA-2、Mistral)和不同数据集(KPMath、KPMath-Plus),验证合成数据的有效性。通过消融实验分析TCPM、质量筛选等关键环节的贡献。评估模型在多场景、多难度任务中的表现,确保泛化能力。

结果分析

微调Qwen1.5-72B模型在GSM8K达87.0%的PASS@1,优于大部分同规模模型,接近GPT-4。MATH测试集达58.3%,显著优于未增强模型。结合多源数据,KPMath-Plus实现79.4%的平均准确率,验证知识驱动合成的有效性。实验还显示,TCPM引导的多主题采样和质量筛选机制是提升数据质量的关键因素。这些结果表明,系统化的知识驱动合成方法能有效增强模型推理能力,具有广泛的应用潜力。

应用场景

该方法可用于自动生成数学竞赛题、智能辅导系统和教育内容开发。只需提供基础题库和关键知识点,即可快速扩充高质量训练数据,降低人工成本。长远来看,知识驱动的数据合成有望推动自主学习系统的发展,实现个性化教育和智能评测,促进数学教育的普及与创新。

局限与展望

目前依赖GPT-4等大模型,成本较高且存在偏差问题。知识提取和聚类可能引入冗余或遗漏,影响数据多样性。生成题目的复杂度受模型能力限制,难以涵盖所有高难度场景。未来需优化算法,提高效率,降低成本,并探索自主知识库的构建以减少对大模型的依赖。

通俗解读 非专业人士也能看懂

想象你在准备一场盛大的厨艺比赛,想要做出各种不同的菜肴。你有很多食谱(题库),每个食谱都包含一些关键的步骤(知识点)和材料(主题)。为了做出新菜,你会从这些食谱中提取重要的步骤,分析哪些步骤经常一起出现(主题共现),然后用这些信息设计新的菜谱。你还会用厨师的建议(模型评分)判断新菜谱是否合理,最后由厨师投票决定哪些菜谱可以用。这样一来,你就能不断创造出丰富多样的菜肴,供大家品尝,既保证质量,又能不断创新。

简单解释 像给14岁少年讲一样

想象你在学校参加厨艺比赛,你想做出很多不同的菜肴。你有一些很棒的食谱,但数量不够,不能让每个人都满意。于是,你决定用一种聪明的方法,先找出这些食谱中最重要的步骤,比如“切菜”、“调味”、“烹饪时间”。然后,你分析哪些步骤经常一起出现,比如“切菜”和“调味”常常搭配。接着,你用这些信息,自己设计新的菜谱,把这些关键步骤组合在一起,确保新菜肴合理又有趣。最后,你请老师(模型)尝试做这些菜,老师会给出评分,你只留下评分高的菜谱。这样,你就能不断创造出新颖又好吃的菜肴,赢得比赛!

术语表

Key Point(关键点)

在题目中起到核心作用的知识或方法,帮助理解和解决问题。

用于提取和指导题目生成的关键知识元素。

Topic Co-occurrence Probability Matrix(主题共现概率矩阵)

描述不同数学主题在题库中同时出现频率的矩阵,用于指导多主题题目的生成。

模型分析题目主题关系的重要工具。

PASS@1

模型在一次尝试中正确回答问题的比例,用于衡量推理性能。

评估模型数学推理能力的标准指标。

KPMath

由知识驱动合成方法生成的数学问答数据集,包含超过80万对问答。

模型训练和性能评估的重要数据资源。

GPT-4

由OpenAI开发的先进大模型,具备强大的自然语言理解和生成能力。

用于知识提取、题目生成和质量评估。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步降低生成数据的偏差和重复率?
  • 2 能否实现完全自主的知识库构建以减少对大模型的依赖?
  • 3 在更复杂的数学推理场景中,模型的表现如何提升?

应用场景

近期应用

智能教育平台

利用合成数据丰富题库,提升智能辅导系统的推理能力,支持个性化学习路径。

自动题库生成

为教师和考试机构自动生成多样化高质量数学题,节省人工成本,提升效率。

远期愿景

自主学习系统

构建具备自主知识更新和推理能力的智能系统,实现个性化、普及化的数学教育。

原文摘要

Large language models (LLMs) have shown great potential in complex reasoning tasks, yet their performance is often hampered by the scarcity of high-quality and reasoning-focused training datasets. Addressing this challenge, we propose Key-Point-Driven Data Synthesis (KPDDS), a novel data synthesis framework that synthesizes question-answer pairs by leveraging key points and exemplar practices from authentic data sources. KPDDS ensures the generation of novel questions with rigorous quality control and substantial scalability. As a result, we present KPMath, an extensive synthetic dataset tailored for mathematical reasoning, comprising over 800K question-answer pairs. Utilizing KPMath and augmenting it with additional reasoning-intensive corpora, we create the comprehensive KPMath-Plus dataset. The Qwen1.5-72B model, fine-tuned on KPMath-Plus, achieves 87.0% PASS@1 accuracy on GSM8K and 58.3% on MATH, surpassing competitors in the 7B to 70B range and best commercial models like GPT-4 across multiple math reasoning datasets.

cs.CL cs.AI