NaturalThoughts: Selecting and Distilling Reasoning Traces for General Reasoning Tasks

TL;DR

通过筛选多样且难度适中的推理轨迹,从强教师模型蒸馏出高质量自然思考数据,显著提升模型推理能力。

cs.CL 🔴 高级 2025-07-03 27 次浏览
Yang Li Youssef Emad Karthik Padthe Jack Lanchantin Weizhe Yuan Thao Nguyen Jason Weston Shang-Wen Li Dong Wang Ilia Kulikov Xian Li
AI推理 模型蒸馏 数据筛选 推理策略 自然语言处理

核心发现

方法论

本文采用基于大规模推理数据池,从强教师模型DeepSeek-R1生成高质量推理轨迹。通过多维筛选策略,包括题目主题、语义嵌入、推理策略多样性和难度,构建NaturalThoughts数据集。利用监督微调(SFT)在Llama和Qwen模型上进行训练,比较随机采样与策略筛选的效果。引入System-1和System-2混合蒸馏,优化推理效率。实验在多个STEM推理基准上验证效果,显示筛选多样且难度适中的样本能显著提升模型性能。

关键结果

  • 在自然推理任务中,训练数据规模从1k到500k,模型性能逐步提升,尤其在GPQA-Diamond、MMLU-Pro和SuperGPQA上,NaturalThoughts显著优于OpenThoughts、LIMO等数据集,提升幅度达3-5个百分点。
  • 筛选策略中,基于推理策略多样性和难度的样本效果优于随机采样,尤其在复杂推理任务中表现更佳,验证了多样性和难度的关键作用。
  • 引入System-1和System-2混合蒸馏,模型在推理速度和准确率之间实现动态平衡,显著提高推理效率,减少过度思考现象,提升实际应用中的响应速度。

研究意义

本研究突破了以往仅依赖随机采样的局限,提出系统化筛选多样且难度适中的推理示范,极大增强模型的泛化能力和推理深度。其在多领域、多任务的推理基准中表现优异,为大规模语言模型的推理能力提升提供了新的数据驱动路径,具有重要的学术价值和产业应用潜力。特别是在教育、科研和自动化决策等场景中,能显著提高模型的推理质量与效率,推动AI智能的普及与深化。

技术贡献

本文提出一种基于多维筛选策略的推理数据蒸馏方法,包括主题多样性、语义分布、推理策略和难度评估,系统性构建高质量推理训练集。引入System-1与System-2混合蒸馏技术,有效平衡推理深度与速度,提升模型推理能力和推理效率。实验验证显示,该方法在多个推理基准上优于现有数据集和蒸馏技术,展示了数据筛选与混合蒸馏的创新结合,为大模型推理能力的提升提供了新思路。

新颖性

本研究首次系统性结合多维筛选策略与混合蒸馏技术,突破了以往只关注数据规模或单一筛选标准的局限。提出基于推理策略多样性和难度的筛选机制,显著提升样本的代表性和训练效率,推动推理数据蒸馏的理论与实践创新,填补了高质量、多样性推理数据集构建的研究空白。

局限性

  • 当前筛选策略依赖人工标注和模型判别,存在一定的主观偏差和计算成本,难以完全自动化。
  • 模型在极端复杂推理任务中的表现仍有限,未来需结合更深层次的推理结构和知识图谱进行优化。
  • 大规模数据训练带来高昂的计算资源消耗,限制了在资源有限环境中的应用推广。

未来方向

未来将探索自动化多维筛选机制,结合知识增强和多模态信息,丰富推理轨迹的表达形式。还将研究更高效的混合蒸馏策略,减少训练成本,提升模型在极端复杂任务中的表现。同时,推动推理数据的跨领域迁移,增强模型的泛化能力,促进AI推理能力的全面提升。

AI 总览摘要

近年来,随着大规模语言模型(LLMs)在推理任务中的表现不断突破,如何高效提升模型推理能力成为研究热点。传统方法多依赖于大规模数据训练或强化学习(RL),但效果有限且成本高昂。本文提出一种创新的推理轨迹筛选与蒸馏框架,通过从强教师模型DeepSeek-R1生成高质量推理示范,结合多维筛选策略,筛选出多样且难度适中的推理样本,构建NaturalThoughts数据集。

该数据集在多个推理基准上表现优异,显著优于现有的OpenThoughts、LIMO等数据集。研究发现,单纯增加数据规模虽有效,但筛选出具有多样推理策略和挑战性的样本,能更高效地传递推理能力。引入System-1(最终答案)与System-2(推理链)混合蒸馏技术,模型在保持推理深度的同时,大幅提升推理速度,减少过度思考现象。

实验结果显示,训练规模从1k到500k,模型性能逐步提升,尤其在复杂推理任务中,筛选策略的效果更为明显。这不仅推动了推理数据的系统化构建,也为大模型的推理能力提升提供了新思路。未来,结合知识图谱、多模态信息和自动化筛选,将进一步优化推理训练流程,推动AI在科学研究、教育和自动决策等领域的应用落地。

深度分析

研究背景

大规模语言模型(LLMs)在推理任务中的应用不断扩大,早期代表性工作如GPT系列、Codex和PaLM,已在数学、逻辑推理等领域取得突破。近年来,Chain-of-Thought(CoT)推理技术通过引导模型生成推理链,显著提升理解复杂问题的能力。相关研究如OpenThoughts、LIMO和S1K,强调数据质量和筛选策略的重要性,推动了推理能力的提升。然而,现有方法多依赖手工筛选或随机采样,难以系统性地提升推理深度和泛化能力。随着模型规模不断扩大,如何高效构建多样且具有挑战性的推理数据集,成为亟待解决的问题。

核心问题

核心问题在于,现有推理数据集多为随机采样或有限手工筛选,难以全面覆盖推理策略和难度层次,导致模型在复杂推理任务中表现不足。此外,模型过度思考(overthinking)现象严重,影响推理效率和实际应用速度。如何系统性筛选出具有代表性、多样性且难度适中的推理示范,成为提升模型推理能力的关键。该问题的难点在于,推理轨迹的多样性和难度评估具有高度复杂性,且需要在保证训练效率的同时,兼顾模型的泛化能力。

核心创新

本研究提出多维筛选策略,结合推理策略多样性、主题分布、语义嵌入和难度评估,系统构建高质量推理数据集NaturalThoughts。创新点包括:1)基于推理策略多样性筛选,确保模型学习到丰富的推理路径;2)引入难度评估机制,优先训练复杂推理示范;3)结合System-1和System-2的混合蒸馏技术,提升推理速度与深度的平衡。这些创新显著改善了推理训练的样本效率和模型泛化能力,为大模型推理能力的提升提供了新路径。

方法详解

  • �� 从NaturalReasoning数据集中采样问题,利用DeepSeek-R1生成推理链和答案。• 采用多维筛选:
  • 按主题均匀采样,确保多样性;
  • 利用Llama-3.1-8B-Instruct嵌入进行密度聚类,采样分布均衡;
  • 根据推理策略多样性筛选,确保样本丰富;
  • 按难度指标(长度、语调、模型不一致)筛选复杂样本。
  • �� 结合System-1(答案)和System-2(推理链)进行混合蒸馏,设计随机和难度导向的采样策略。• 在训练中只优化推理轨迹和答案部分,避免问句干扰。• 通过多轮实验验证不同筛选策略对模型推理能力的影响。

实验设计

采用Llama-3.1-8B-Instruct和Qwen-2.5-7B-Instruct模型,分别在GPQA-Diamond、MMLU-Pro和SuperGPQA等基准上评估。训练规模从1k到500k样本,比较随机采样、策略筛选和混合蒸馏效果。指标包括准确率和推理速度,采用多随机种子确保结果稳健。实验还验证筛选多样性和难度对模型性能的提升作用,特别是在复杂推理任务中表现优越。

结果分析

筛选多样且难度适中的样本显著提升模型性能,尤其在GPQA-Diamond和MMLU-Pro上,性能提升达3-5个百分点。引入System-1/2混合蒸馏后,模型推理速度提升20%以上,过度思考现象明显减少。数据规模扩大至50万后,性能持续提升,验证了数据质量优于纯数量的结论。筛选策略中的推理策略多样性和模型不一致性指标效果最佳,验证了多样性和难度的关键作用。

应用场景

该方法可广泛应用于教育、科研、自动化决策等场景,提升模型在复杂推理任务中的表现。通过高效筛选和蒸馏,减少模型推理时间,增强实际应用中的响应速度和准确性。未来结合知识图谱、多模态信息,将推动智能系统在科学探索和工业自动化中的深度应用。

局限与展望

当前筛选策略依赖人工标注和模型判别,存在偏差和计算成本。模型在极端复杂推理任务中的表现仍有限,需结合知识增强技术。大规模训练资源消耗高,限制了普及推广。未来需优化自动化筛选机制,降低成本,提升极端任务的适应性。

通俗解读 非专业人士也能看懂

想象你在一家工厂里,生产不同的商品。每个工人(模型)都要按照说明书(推理轨迹)完成任务。有些说明书简单,容易完成;有些复杂,需要多次思考和尝试。工厂里有个老师(教师模型),他写了很多详细的说明书,工人们可以学习。为了让工人更快更好地完成任务,工厂管理者(研究者)会挑选出那些既详细又难度适中的说明书,让工人反复练习。这样,工人不仅学会了基本技能,还能应对复杂问题。研究发现,挑选多样且难度适中的说明书,能让工人变得更聪明、更快,效率也更高。这就像我们训练AI模型一样,通过精心筛选的推理示范,让它学会更复杂、更准确的推理能力,最终能在各种任务中表现出色。

简单解释 像给14岁少年讲一样

想象你在学校学数学,有时候老师会给你一些很难的问题,要你用很多步骤解答。有时候,老师会给你一些简单的问题,只需要直接回答。研究人员发现,如果你多练习那些既难又需要用不同方法解决的问题,你会变得更聪明、更擅长推理。就像你玩游戏时,挑战越大,你学得越快。为了训练AI模型,科学家们用一个“老师”模型写出很多推理过程,然后挑选出那些既复杂又有趣的例子,让AI学习。通过这样的方法,AI不仅能学会简单的推理,还能应对更难的问题。更酷的是,他们还让AI学会在回答问题时,既可以快速给出答案,也可以花时间仔细推理,找到最好的解决方案。这样,AI在未来可以更聪明、更快地帮助我们解决各种复杂问题,就像一个超级聪明的助手一样!

原文摘要

Recent work has shown that distilling reasoning traces from a larger teacher model via supervised finetuning outperforms reinforcement learning with the smaller student model alone (Guo et al. 2025). However, there has not been a systematic study of what kind of reasoning demonstrations from the teacher are most effective in improving the student model's reasoning capabilities. In this work we curate high-quality "NaturalThoughts" by selecting reasoning traces from a strong teacher model based on a large pool of questions from NaturalReasoning (Yuan et al. 2025). We first conduct a systematic analysis of factors that affect distilling reasoning capabilities, in terms of sample efficiency and scalability for general reasoning tasks. We observe that simply scaling up data size with random sampling is a strong baseline with steady performance gains. Further, we find that selecting difficult examples that require more diverse reasoning strategies is more sample-efficient to transfer the teacher model's reasoning skills. Evaluated on both Llama and Qwen models, training with NaturalThoughts outperforms existing reasoning datasets such as OpenThoughts, LIMO, etc. on general STEM reasoning benchmarks including GPQA-Diamond, MMLU-Pro and SuperGPQA.

cs.CL