QuestA: Expanding Reasoning Capacity in LLMs via Question Augmentation

TL;DR

QuestA通过引入部分解答增强RL训练中的问题难度调节,显著提升1.5B模型在数学推理任务中的性能。

cs.CL 🔴 高级 2025-07-18 47 次浏览
Jiazheng Li Hongzhou Lin Hong Lu Kaiyue Wen Zaiwen Yang Jiaxuan Gao Yi Wu Jingzhao Zhang
大规模语言模型 强化学习 问题增强 推理能力 算法创新

核心发现

方法论

本文提出QuestA方法,通过在训练过程中引入部分解答作为提示,减缓硬题训练难度,改善稀疏奖励问题。采用基于OpenR1-220K数据集的高难度问题筛选,结合逐步递减的提示比例,设计了多阶段课程学习策略。利用强化学习算法GRPO,结合问题增强技术,有效提升模型推理能力。核心在于通过部分解答引导模型逐步学习复杂推理路径,增强样本效率。实验中,QuestA在1.5B参数模型上实现了AIME24、AIME25、HMMT25等数学基准的最新SOTA,提升幅度达10%以上。

关键结果

  • QuestA在AIME24达72.50%(+10.73%),AIME25达62.29%(+12.79%),HMMT25达41.67%(+10.11%),显著优于未增强模型。通过对比标准RL训练,QuestA在pass@k指标上表现更稳健,尤其在高难度题目上效果更佳。
  • 在训练动态方面,QuestA模型训练速度快,奖励信号密集,避免entropy崩溃,模型输出多样性得到保持。多轮实验验证了部分解答引导的有效性,显著提高了模型的推理深度和泛化能力。
  • 消融实验显示,逐步递减提示比例(p=50%到25%)能进一步优化训练效率,缩短收敛时间,同时保持甚至提升模型性能。该方法对其他RL算法具有良好的兼容性和扩展性。

研究意义

本研究突破了传统RL在硬推理任务中的瓶颈,提出问题增强策略,有效扩展了大模型的推理能力。解决了稀疏奖励和样本效率不足的核心难题,为未来大规模推理模型的训练提供新思路。其在数学、编程等高复杂度任务中的优异表现,将推动AI在自动推理、数学证明等领域的应用落地,具有深远的理论和实践价值。

技术贡献

技术创新主要体现在引入部分解答作为提示的问答增强机制,结合多阶段课程学习,有效缓解稀疏奖励问题。提出的理论模型分析了问题难度与模型容量关系,证明了部分解答提升RL样本效率的数学基础。实现上,QuestA兼容多种RL算法,提供了完整的开源训练流程,推动了推理能力的持续提升。

新颖性

首次系统性将部分解答引入强化学习训练中,提出逐步递减提示比例的课程策略,显著改善硬推理任务中的训练效率和模型性能。区别于传统的监督微调或奖励调整方法,QuestA在模型推理深度和泛化能力方面实现了突破,填补了高难度推理训练中的空白。

局限性

  • 当前方法依赖高质量的部分解答数据,数据获取成本较高,且在极端复杂问题上仍存在一定局限性。模型在极端长尾问题上的泛化能力有待验证,部分问题的解答策略仍需优化。
  • 训练过程中对硬题筛选和提示比例调节较为依赖经验参数,缺乏完全自动化的调优机制,未来需引入自适应调节策略以提升鲁棒性。
  • 模型规模限制了推理深度的进一步扩展,未来需结合更大模型或多模态信息,突破当前性能瓶颈。

未来方向

未来将探索自动生成部分解答的技术,降低数据依赖,结合多模态信息提升推理能力。同时,计划将QuestA应用于更广泛的推理任务和领域,如科学计算、逻辑推理等,推动其在实际应用中的落地。还将研究自适应提示策略,优化训练流程,进一步缩短训练时间,提升模型泛化能力。

AI 总览摘要

随着大规模语言模型(LLMs)在推理任务中的表现不断突破,如何进一步扩展其推理深度成为核心难题。传统强化学习(RL)在训练中面临稀疏奖励和样本效率不足的挑战,尤其在高难度推理任务中效果有限。本文提出QuestA方法,通过引入部分解答作为提示,逐步减缓问题难度,改善模型的探索能力。该策略在数学推理任务中表现出色,显著优于标准RL训练,达到了AIME24、AIME25和HMMT25等基准的最新SOTA水平。实验结果显示,QuestA不仅提升了pass@1指标,还增强了模型在高k值上的表现,展现出更强的推理能力和泛化能力。这一创新为大模型在复杂推理中的应用提供了新思路,具有重要的理论和实践意义。未来,结合自动生成部分解答和多模态信息,将进一步推动模型推理能力的突破,拓展其在科学、工程等领域的应用潜力。

深度分析

研究背景

近年来,随着GPT、PaLM等大规模预训练模型的出现,推理能力得到了显著提升,但在高难度任务中仍受限于训练数据的多样性和奖励稀疏问题。传统RL方法如GRPO、DAPO在强化推理方面取得一定进展,但在复杂问题上收敛缓慢,效果有限。Supervised Fine-Tuning(SFT)虽能改善部分性能,但难以突破推理深度瓶颈。近年来,问题增强和多阶段训练策略逐渐成为研究热点,旨在通过结构化提示提升模型推理能力。

核心问题

核心问题在于如何在强化学习中有效扩展模型的推理深度,尤其在面对高难度、稀疏奖励的任务时。现有方法多依赖硬题训练,导致训练效率低下,模型容易陷入局部最优。难题筛选和提示设计缺乏系统性,难以实现高效学习。如何在保证训练速度的同时,提升模型的推理深度,成为亟待解决的关键问题。

核心创新

本文提出QuestA,创新点包括:1)引入部分解答作为提示,逐步引导模型学习复杂推理路径;2)设计多阶段递减提示比例的课程策略,平衡训练难度与效率;3)结合理论分析,证明部分解答增强能提升样本效率和探索能力。这些创新有效缓解稀疏奖励问题,推动模型在高难度推理任务中的表现突破。

方法详解

  • �� 选择高难度问题集(OpenR1-220K)筛选最难样本。• 利用深度推理模型Nemotron-1.5B采样多轮答案,筛除易题。• 设计逐步递减提示比例(p=50%到25%),在RL训练中引入部分解答。• 采用GRPO算法,结合问题增强策略,优化样本利用率。• 通过多轮筛选确保模型在硬题上的学习效果。• 理论分析部分,定义解集与模型容量集,证明部分解答能显著提升RL样本效率。

实验设计

在OpenR1-220K数据集基础上,结合Nemotron-1.5B和DeepScaleR-1.5B模型,进行多轮强化学习训练。采用pass@k指标评估模型推理能力,比较QuestA与传统RL方法的性能差异。通过不同提示比例和筛选策略,验证方法的有效性。实验还包括消融分析,探讨逐步递减策略对训练速度和性能的影响。所有训练在高性能GPU集群上完成,确保结果的可靠性。

结果分析

QuestA在AIME24、AIME25、HMMT25等数学基准上均实现了SOTA,提升幅度超过10%。在pass@1指标上,QuestA达72.50%、62.29%、41.67%,远优于未增强模型。训练动态显示,QuestA模型收敛更快,奖励密集,避免entropy崩溃。消融实验表明,逐步递减提示比例能进一步优化训练效率,显著缩短收敛时间。整体结果验证了部分解答引导在硬推理任务中的有效性。

应用场景

该方法适用于需要高深推理能力的自动问答、数学证明、逻辑推理等场景。可结合现有RL框架,提升模型在复杂任务中的表现。未来可扩展到科学计算、自动编程等领域,推动AI在专业领域的应用落地。通过优化训练流程,降低训练成本,提升模型的实用性和普适性。

局限与展望

目前依赖高质量的部分解答数据,数据采集成本较高。模型在极端复杂或长尾问题上的泛化能力仍有待验证。训练参数调节较为依赖经验,缺乏自适应机制。未来需结合自动生成技术,降低数据依赖,提升鲁棒性。模型规模限制也影响推理深度,需结合更大模型或多模态信息进行突破。

通俗解读 非专业人士也能看懂

想象你在学习一项复杂的手工艺,比如拼装一个复杂的模型。直接从零开始拼装很难,容易出错,也很慢。于是,你先看一些部分的示范,学习每个步骤的技巧,然后再自己动手。QuestA的方法也是这样,它在训练模型时,先给出问题的部分解答,让模型学习每个小步骤。这样,模型就像有了“指南针”,逐步掌握复杂推理的技巧。通过不断练习,模型变得越来越擅长解决难题,就像你逐渐变成拼装高手一样。这种逐步学习的方法,让模型在面对高难度问题时,能更快、更好地找到答案,就像你在拼装模型时,先学会拼装基础部分,再逐步完成整个作品一样。

简单解释 像给14岁少年讲一样

想象你在玩一个超级难的拼图游戏,一开始看着一堆乱七八糟的碎片,不知道从哪里开始。于是,你的朋友告诉你一些线索,比如“这个边缘的碎片在左边”,或者“这个颜色的碎片可以拼在一起”。这样,你就可以先拼出边框,慢慢填充里面的内容。QuestA也是这样,它在训练模型时,先给模型一些“线索”——就是问题的部分答案,让模型学会一步步解决复杂的难题。这样,模型就像变得更聪明了,能更快找到正确答案。就像你用线索拼拼图一样,模型用部分答案拼出完整的推理过程。最终,它变得非常擅长解决那些以前觉得太难的问题,就像拼图高手一样厉害!

原文摘要

Reinforcement learning (RL) has emerged as a central paradigm for training large language models (LLMs) in reasoning tasks. Yet recent studies question RL's ability to incentivize reasoning capacity beyond the base model. This raises a key challenge: how can RL be adapted to solve harder reasoning problems more effectively? To address this challenge, we propose a simple yet effective strategy via Question Augmentation: introduce partial solutions during training to reduce problem difficulty and provide more informative learning signals. Our method, QuestA, when applied during RL training on math reasoning tasks, not only improves pass@1 but also pass@k-particularly on problems where standard RL struggles to make progress. This enables continual improvement over strong open-source models such as DeepScaleR and OpenMath Nemotron, further enhancing their reasoning capabilities. We achieve new state-of-the-art results on math benchmarks using 1.5B-parameter models: 72.50% (+10.73%) on AIME24, 62.29% (+12.79%) on AIME25, and 41.67% (+10.11%) on HMMT25. Code, data and model are available at https://github.com/foreverlasting1202/QuestA.

cs.CL cs.AI