Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models
提出Composition-RL,通过自动组合多题提升LLM推理能力,实验显示在4B到30B模型中显著优于原始RL。
核心发现
方法论
本文提出Composition-RL框架,利用自动组合多题生成复杂验证提示,结合特定算法如GRPO进行RL训练。核心机制包括题目组合操作(Compose),递归构建多层次提示(Depth K),以及基于verifiable rewards的优化。通过在4B至30B模型上进行大规模实验,验证了组合提示在推理性能上的持续提升。采用Curriculum策略逐步增加组合深度,增强模型泛化能力。跨领域组合实验显示其在多任务、多域场景中的潜力。
关键结果
- 在多个数学和推理任务中,Composition-RL提升了模型的pass@1准确率,最大提升达21.4%,在30B模型中整体性能提升达10.5%。在跨域实验中,结合物理和数学题的组合显著优于单一任务训练,平均提升0.8%。通过逐步增加组合深度(Depth 1至Depth 3),模型性能持续改善,验证了Curriculum策略的有效性。实验还表明,组合提示能缓解训练中“太易”提示占比过高的问题,增强模型的推理复杂度。
研究意义
该研究突破了提示数据有限的瓶颈,提出利用组合策略充分挖掘已有提示资源,显著提升大规模语言模型的推理能力。其在数学、物理等多领域的成功应用,为未来多任务、多域模型训练提供新思路,推动AI在复杂推理任务中的实用化。模型在多样化任务中的优异表现,彰显其在教育、科研、工业智能等场景的广泛潜力。
技术贡献
技术创新主要体现在提出自动组合多题的Prompt生成机制(Compose操作),以及递归构建多层次组合(Depth K),结合强化学习(如GRPO)优化策略,实现对复杂推理任务的有效训练。引入Curriculum策略逐步增加组合深度,增强模型泛化能力。与传统单题训练相比,显著提高了模型的推理复杂度和跨任务迁移能力,提供了理论上的组合泛化保证。
新颖性
本研究首次系统性提出利用自动组合多题提示(Composition)增强大模型推理能力,结合强化学习优化框架,突破了提示数据有限和易题占比过高的瓶颈。与以往仅关注单题或硬例优先的策略不同,强调通过组合提升提示复杂度,开创了提示工程的新方向。
局限性
- 当前方法依赖预训练模型已有的提示资源,组合策略在极端复杂任务中可能面临泛化瓶颈,且组合深度增加带来计算成本上升。此外,跨域组合效果虽显著,但在某些特定任务中仍存在性能波动,未来需优化组合策略以适应更广泛的应用场景。
未来方向
未来将探索多模态、多任务多域的更大规模组合策略,结合元学习和自适应调节机制,提升模型对复杂推理任务的泛化能力。同时,研究如何在有限数据条件下自动生成高质量组合提示,以及优化组合深度与训练效率的平衡,将是重要方向。
AI 总览摘要
在大规模语言模型(LLMs)中,提示工程一直是提升推理能力的关键环节。传统方法依赖大量高质量提示,但收集和验证成本高昂,且易题比例逐渐升高,限制了训练效率。本文提出Composition-RL,通过自动组合多个基础题目,生成更复杂、更具挑战性的验证提示,有效缓解了“太易”提示占比过高的问题。该方法利用递归组合(Depth K)和Curriculum策略,逐步提升提示复杂度,在4B至30B模型上实现了显著性能提升,最大达21.4%的pass@1增长。跨领域实验显示,组合提示在多任务、多域场景中具有广泛适用性。实验结果表明,Composition-RL不仅提高了模型的推理能力,还增强了其泛化和迁移能力,为未来多任务、多域大模型训练提供了新思路。尽管如此,组合深度的增加带来了计算成本和泛化挑战,未来需优化组合策略以适应更复杂的应用需求。这项工作为提示工程和强化学习结合提供了新范式,推动大模型在复杂推理任务中的实用化进程。
深度分析
研究背景
近年来,随着GPT、BERT等大规模预训练模型的兴起,提示工程成为提升模型推理能力的重要手段。RLVR(Reinforcement Learning with Verifiable Rewards)通过结合提示和奖励机制,有效引导模型学习复杂推理。代表性工作包括Chain of Thought(Wei et al., 2022)和RLHF(Reinforcement Learning from Human Feedback),但受限于提示数据的质量和数量,模型性能提升逐渐遇到瓶颈。尤其在高难度任务中,硬提示和难题的采集成本高昂,易题比例逐步升高,导致训练效率下降。为了突破这一瓶颈,研究者开始探索提示的组合与扩展策略,旨在利用有限的提示资源实现更大范围的推理能力。
核心问题
当前提示训练面临两个主要挑战:一是高质量提示的稀缺,二是易题比例过高导致训练信号稀疏。随着模型能力提升,训练中“solve all”提示比例不断上升,导致有效样本逐渐减少,限制模型的进一步推理能力。如何在有限提示资源下,增强模型对复杂推理的学习能力,成为亟待解决的问题。此外,跨领域、多任务的推理能力也亟需提升,以满足实际应用多样化的需求。
核心创新
本文提出了三项核心创新:1)自动组合提示(Compose操作),将多个基础题目合成为复杂验证题,提升提示难度;2)递归多层组合(Depth K),逐步增加提示复杂度,增强模型推理深度;3)结合Curriculum策略,动态调整组合深度,优化训练过程。这些创新突破了传统单题训练的局限,使模型在复杂推理任务中表现更优,且能更好地迁移到多任务、多域场景。
方法详解
- �� 设计Compose操作,将两个题目通过提取答案中的数值、定义关系,构建复杂题目;
- �� 通过递归调用Compose,构建多层次(Depth K)组合,提升提示复杂度;
- �� 利用RL(如GRPO)优化策略,在组合提示上进行训练,最大化verifiable reward;
- �� 引入Curriculum策略,逐步增加组合深度,从Depth 1到Depth 3,促进模型逐级学习复杂推理;
- �� 融合跨领域题目(如物理与数学),实现多任务、多域训练,验证其泛化能力。
实验设计
采用多模型(4B-30B)在数学、物理等任务集上进行训练,比较原始RL与组合提示RL的性能。使用pass@1作为主要指标,结合不同组合深度和Curriculum策略,评估模型推理能力。实验还包括跨域组合效果和不同提示组合策略的对比分析。所有模型均在统一超参数下训练,验证其在标准评测集上的表现,确保结果的可靠性。
结果分析
组合提示显著优于原始提示,最大提升达21.4%,在30B模型中整体性能提升10.5%。逐步增加组合深度(Depth 1→3)带来持续性能增长,验证Curriculum策略有效。跨域实验中,结合物理与数学题的组合,模型在多任务评测中表现优异,平均提升0.8%。此外,组合策略缓解了“太易”提示比例过高的问题,增强了模型的推理深度和迁移能力。
应用场景
该方法适用于教育、科研、工业智能等场景,尤其在需要复杂推理和多任务处理的应用中。通过自动生成复杂提示,降低提示采集成本,提升模型在多样化任务中的表现。未来可结合自动提示生成和自适应调节,推动智能系统的自主学习和泛化能力。
局限与展望
当前方法依赖预训练模型已有提示,组合深度过大可能带来计算成本上升,且在极端复杂任务中泛化仍有限。跨域组合效果虽优,但在某些特定任务中表现不稳定。未来需优化组合策略,降低成本,增强泛化能力,拓展到更多复杂场景。
通俗解读 非专业人士也能看懂
想象你在厨房里做菜,手边有各种食材和调料。传统做菜时,只用一种食材或调料,味道可能单调。现在,你可以把不同的食材组合在一起,做出更丰富的菜肴。这个方法就像是把多个简单的题目组合成一个复杂的问题,让模型像厨师一样,学会处理更复杂的菜谱。通过不断尝试不同的组合,厨师(模型)变得更厉害,能做出各种新菜。这样,模型也能通过组合提示,变得更聪明,解决更难的问题,就像厨师变成了大厨一样。
简单解释 像给14岁少年讲一样
想象你在学校里学数学,老师给你一些题目练习。有时候题目太简单,你很快就能做出来,但这让你觉得没有挑战。于是,老师开始把两个题目结合起来,变成一个更难的题,比如先算一个问题,然后用它的答案去解决另一个问题。这样一来,你需要用更多的思考,才能找到答案。这个方法就像是把两个简单的任务合成一个大任务,让你变得更聪明,学会处理更复杂的问题。通过不断练习这样的组合题,你会发现自己变得更厉害,能应对各种难题,就像变成了数学高手一样!
术语表
Composition (组合)
将多个提示或题目合成为一个更复杂的问题,提升推理难度。/ Combining multiple prompts into a more complex question to enhance reasoning.
用于生成复杂验证提示,提升模型推理能力。
Verifiable Rewards (可验证奖励)
基于模型回答的正确性,给予明确的奖励信号,用于强化学习优化。/ Rewards based on the correctness of responses, guiding RL training.
在RLVR中用于衡量模型推理的准确性。
Compose操作
自动将两个题目中的答案和关系提取,构建新题的过程。/ Automatic process of combining two questions into a new, more complex question.
实现提示的自动组合,提升推理深度。
Curriculum策略
逐步增加任务难度或提示复杂度的训练策略。/ Progressive training approach that gradually increases task complexity.
用于优化模型学习路径。
Pass@k
模型在k次尝试中成功的概率指标。/ Probability that the model succeeds within k attempts.
评估模型推理能力的标准。
开放问题 这项研究留下的未解疑问
- 1 如何在极端复杂任务中保持组合策略的有效性,仍需探索更高效的组合算法和泛化机制。
- 2 跨域组合的最佳实践和理论基础尚不完善,未来需要系统性研究。
原文摘要
Large-scale verifiable prompts underpin the success of Reinforcement Learning with Verifiable Rewards (RLVR), but they contain many uninformative examples and are costly to expand further. Recent studies focus on better exploiting limited training data by prioritizing hard prompts whose rollout pass rate is 0. However, easy prompts with a pass rate of 1 also become increasingly prevalent as training progresses, thereby reducing the effective data size. To mitigate this, we propose Composition-RL, a simple yet useful approach for better utilizing limited verifiable prompts targeting pass-rate-1 prompts. More specifically, Composition-RL automatically composes multiple problems into a new verifiable question and uses these compositional prompts for RL training. Extensive experiments across model sizes from 4B to 30B show that Composition-RL consistently improves reasoning capability over RL trained on the original dataset. Performance can be further boosted with a curriculum variant of Composition-RL that gradually increases compositional depth over training. Additionally, Composition-RL enables more effective cross-domain RL by composing prompts drawn from different domains. Codes, datasets, and models are available at https://github.com/XinXU-USTC/Composition-RL.