Training LLMs for Divide-and-Conquer Reasoning Elevates Test-Time Scalability

TL;DR

通过强化学习训练LLMs的分而治之(DAC)推理,提升其测试时可扩展性,超越传统链式思考。

cs.CL 🔴 高级 2026-02-03 44 次浏览
Xiao Liang Zhong-Zhi Li Zhenghao Lin Eric Hancheng Jiang Hengyuan Zhang Yelong Shen Kai-Wei Chang Ying Nian Wu Yeyun Gong Weizhu Chen
大规模语言模型 推理能力 强化学习 分而治之 可扩展性

核心发现

方法论

本文提出端到端的强化学习框架,将问题分解与解决融入训练过程。模型在每一步通过策略将复杂问题拆解为子问题,逐一解决后结合结果。采用奖励机制鼓励生成有效子问题组,提升模型的分治推理能力。该方法结合具体算法如PPO,优化分解策略,增强模型在复杂任务中的推理上限。实验中,模型在AIME、HMMT等数学竞赛数据集上,Pass@1提升8.6%,Pass@32提升6.3%,显示出显著性能优势。

关键结果

  • 在AIME 2024、2025、Beyond-AIME和HMMT-25等竞赛级基准上,经过DAC强化训练的模型在推理准确率上均优于传统链式思考(CoT),Pass@1平均提升8.6%,Pass@32提升6.3%。
  • 训练中引入子问题生成奖励机制,确保子问题的有效性和多样性,显著改善模型的推理深度和探索空间。
  • DAC训练不仅提升了推理性能,还增强了模型的可扩展性,使其在更复杂任务中表现出更高的潜力和更强的测试时能力。

研究意义

该研究突破了LLMs在复杂推理任务中的性能瓶颈,提出的DAC强化训练框架有效弥合了训练与推理间的差距,为未来大规模模型在数学、逻辑推理等领域的应用提供了理论基础和实践路径。其提升的可扩展性满足了实际场景中对高效、深度推理的需求,有望推动AI在科学研究、自动推理和智能决策等方面的广泛应用。

技术贡献

本文创新性地将分而治之策略融入端到端强化学习训练中,提出了问题分解与解决的联合优化机制。引入奖励机制引导模型生成高质量子问题组,显著提升模型的推理深度和探索能力。该方法区别于传统的后训练微调或提示工程,提供了理论上的性能上限提升和实际的可扩展性增强,为大模型推理能力的提升开辟新路径。

新颖性

首次将分而治之策略系统性融入强化学习训练框架,突破了仅在推理阶段使用DAC的限制,实现训练与推理的深度结合。相较于以往仅在推理时应用DAC的工作,本研究实现了模型推理能力的根本性提升,开创了基于强化学习的分而治之训练新范式。

局限性

  • 当前方法对训练资源需求较高,尤其是在大规模模型和复杂任务中,训练成本较传统微调更为昂贵。
  • 模型在极端复杂或未见过的任务中仍存在推理失败的风险,特别是在子问题生成不充分或奖励机制未能充分引导的情况下。
  • 未来需进一步优化奖励设计,提升模型在多样化任务中的泛化能力,并降低训练复杂度。

未来方向

未来将探索多任务、多模态场景下的DAC强化训练,结合自监督和迁移学习策略,提升模型的泛化能力。同时,研究更高效的奖励机制和子问题生成策略,以降低训练成本,增强模型在实际应用中的适应性。还计划结合人类反馈,优化推理路径的可解释性和可靠性,推动大模型推理能力的全面提升。

AI 总览摘要

当前大规模语言模型(LLMs)在链式思考(CoT)推理中表现出强大能力,但在更复杂任务中逐渐遇到瓶颈。传统的CoT依赖严格的顺序推理,限制了模型的测试时扩展性。为突破这一限制,本文提出一种端到端的强化学习(RL)训练框架,将分而治之(DAC)策略融入模型训练中,实现问题的自动分解与逐步解决。该方法通过奖励机制引导模型生成高质量子问题组,增强推理深度和探索空间。在数学竞赛数据集上的实验显示,经过DAC强化训练的模型在AIME和HMMT等基准上,Pass@1提升8.6%,Pass@32提升6.3%,明显优于传统CoT。这一创新不仅提升了模型的推理性能上限,也增强了其在复杂任务中的可扩展性。研究表明,将DAC策略系统性融入训练流程,是提升LLMs推理能力的有效途径,为未来科学、自动推理和智能决策提供了坚实基础。未来工作将聚焦多任务、多模态场景,优化奖励机制,降低训练成本,推动模型在实际应用中的广泛部署。

深度分析

研究背景

近年来,LLMs在自然语言理解和推理任务中取得突破,尤其通过链式思考(CoT)策略显著提升复杂问题的解决能力。代表性工作如Wei等提出的CoT prompting,极大改善了模型的推理深度。然而,在极端复杂任务(如数学奥林匹克、定理证明)中,单纯依赖CoT逐渐显示出局限性。部分研究尝试引入问题分解(如Tree-of-Thought、DeAR)以增强推理能力,但多仅在推理阶段应用,未能在训练中充分强化分而治之策略。现有方法在推理能力上虽有提升,但缺乏系统性训练机制,导致模型在面对新颖复杂问题时仍表现不足。本文的创新在于将分而治之策略融入端到端强化学习训练中,突破了传统方法的局限,为模型推理能力的持续提升提供新路径。

核心问题

尽管LLMs在标准推理任务中表现优异,但在面对极端复杂或多步骤推理问题时,性能受限,主要源于训练过程中缺乏对分而治之策略的系统性优化。传统的微调和提示工程难以充分激发模型的潜力,尤其是在多层次问题拆解和子问题解决的环节。测试时的推理策略虽能部分缓解,但未能从根本上提升模型的推理深度和探索空间。这种局限性限制了模型在科学研究、数学竞赛等高难度场景中的应用潜力,亟需一种能在训练中强化分解与合成能力的方法,以实现更高的推理上限和更强的测试时扩展性。

核心创新

本研究的核心创新在于将分而治之(DAC)策略系统性融入到强化学习训练框架中,具体表现为:

  • �� 设计问题分解策略,通过奖励机制引导模型生成有效子问题组,改善推理路径多样性;
  • �� 利用强化学习优化分解与合成过程,提升模型在复杂任务中的推理深度;
  • �� 结合具体算法如PPO,确保训练的稳定性和效果,显著超越传统微调和提示工程的性能极限。这一方法区别于以往仅在推理阶段应用DAC的工作,实现了训练与推理的深度结合,极大提升模型的潜在能力。

方法详解

  • �� 采用端到端的强化学习框架,将问题分解(policy分解子问题)与问题解决(逐一解决子问题)结合。
  • �� 在每次训练迭代中,模型根据策略将复杂问题拆解成子问题组,利用奖励机制评估子问题的有效性和多样性。
  • �� 设计奖励函数,鼓励生成多样且有用的子问题,确保子问题能支持最终答案的正确性。
  • �� 训练过程中,模型在生成子问题和解决方案时,逐步优化策略参数以最大化奖励。
  • �� 采用PPO算法进行策略优化,结合剪裁和多轮采样,确保训练的稳定性和效率。

实验设计

  • �� 采用AIME、Beyond-AIME、HMMT-25等数学竞赛数据集,评估模型推理能力。• 比较基线包括传统CoT和微调模型,指标为Pass@1和Pass@32。• 训练中设置子问题组大小Gd,征集子问题的最小数量Ns,采用400轮训练,batch size为256。• 通过不同子问题组数量和采样次数,分析模型在复杂推理任务中的表现。• 实验还包括不同训练策略(如冷启动、混合训练)对性能的影响。

结果分析

  • �� DAC强化训练模型在所有基准上均优于传统CoT,平均Pass@1提升8.6%,Pass@32提升6.3%。• 在极难子集上,性能提升尤为明显,验证了分而治之策略的有效性。• 训练过程中,模型逐步突破原有推理上限,展现出更强的探索和推理能力。• 实验还显示,结合子问题多样性和奖励机制,有助于提升模型的泛化能力和推理深度。

应用场景

  • �� 该方法适用于高难度数学、逻辑推理、科学问题解决等场景,特别是在需要多步骤推理和问题拆解的任务中。• 结合大规模模型和强化学习框架,可实现自动化推理路径优化,提升科研、教育和自动化决策的效率。

局限与展望

  • �� 训练成本较高,尤其在大模型和复杂任务中,资源消耗巨大。• 对奖励设计敏感,奖励机制不完善可能导致子问题生成偏差。• 在极端复杂或未见任务中仍存在推理失败风险,需进一步优化策略和模型结构。

通俗解读 非专业人士也能看懂

想象你在厨房做菜,面对一道复杂的菜谱。单纯按照步骤逐一操作,可能会很慢或出错。于是,你决定先把菜谱拆成几个小任务,比如切菜、调料、煮饭,然后逐个完成。每完成一个小任务,你都能更清楚下一步怎么做,最后组合起来就能做出美味的菜。这就像模型把复杂问题拆解成子问题,逐一解决,最后合成答案。这样的方法让整个过程更高效、更可靠。研究中,科学家用类似的策略训练AI,让它学会像厨师一样,把大问题拆成小问题,逐个攻破,最终解决复杂难题。

简单解释 像给14岁少年讲一样

想象你在玩一个超级难的拼图游戏,光靠一次性拼完非常困难。于是,你把拼图分成几个部分,每次只拼一部分,最后再把这些部分拼在一起。这样一来,不仅更容易完成,还能找到更好的拼法。科学家们用这个想法训练AI,让它学会把复杂的问题拆成小问题,一步步解决,然后合成最终答案。通过这种方法,AI变得更聪明,能解决以前难以攻克的难题,就像你用拆分拼图的方法,变得更厉害一样。

原文摘要

Large language models (LLMs) have demonstrated strong reasoning capabilities through step-by-step chain-of-thought (CoT) reasoning. Nevertheless, at the limits of model capability, CoT often proves insufficient, and its strictly sequential nature constrains test-time scalability. A potential alternative is divide-and-conquer (DAC) reasoning, which decomposes a complex problem into subproblems to facilitate more effective exploration of the solution. Although promising, our analysis reveals a fundamental misalignment between general-purpose post-training and DAC-style inference, which limits the model's capacity to fully leverage this potential. To bridge this gap and fully unlock LLMs' reasoning capabilities on the most challenging tasks, we propose an end-to-end reinforcement learning (RL) framework to enhance their DAC-style reasoning capacity. At each step, the policy decomposes a problem into a group of subproblems, solves them sequentially, and addresses the original one conditioned on the subproblem solutions, with both decomposition and solution integrated into RL training. Under comparable training, our DAC-style framework endows the model with a higher performance ceiling and stronger test-time scalability, surpassing CoT by 8.6% in Pass@1 and 6.3% in Pass@32 on competition-level benchmarks.

cs.CL