Boosting LLM Exploration via Weak-Model Guidance in RLVR

TL;DR

提出弱模型引导的RLVR方法,通过外部前缀增强探索,提升推理覆盖率和多样性。

cs.CL 🔴 高级 2026-08-28 62 次浏览
Xingyu Shen Huishuai Zhang Peng Li Yinchun Wang Dongyan Zhao
强化学习 大语言模型 推理覆盖 探索策略 模型多样性

核心发现

方法论

本文基于GRPO(Group Relative Policy Optimization)算法,结合外部弱模型生成的部分推理轨迹作为前缀,训练目标模型完成剩余推理。通过引入不同模型生成的前缀,扰动目标模型的分布,缓解策略的早期过度自信和信息熵崩溃。采用基于信息熵的截断策略,自动选择最具探索潜力的前缀长度。实验证明在多个数学推理基准上,方法显著优于纯粹RLVR,尤其在pass@k指标上随着k的增加,性能提升更为明显。

关键结果

  • 在Qwen2.5-7B模型上,加入Gemma-2-2B生成的前缀后,pass@128从67.76%提升至70.71%,提升幅度达4.95%。在多个基准如AIME、MATH 500等上均取得一致性提升,尤其在大k值时效果更佳,表明推理覆盖范围显著扩大。
  • 引入外部前缀使策略熵在训练早期保持更高水平,延缓策略崩溃,增强探索能力。实验证明,使用不同模型生成的前缀,目标模型在推理轨迹多样性和覆盖率方面表现优越,验证了跨模型生成的扰动机制的有效性。
  • 通过信息熵分析和消融实验,发现即使弱模型生成的前缀质量不一定高,仍能有效促进目标模型探索。该方法无需复杂奖励设计或额外微调,具有较好的实用性和扩展性。

研究意义

该研究突破了RLVR中策略早期过度自信和多样性下降的瓶颈,为大模型推理能力的提升提供了新思路。通过引入跨模型生成的非参数扰动,有效扩展推理空间,增强模型的探索能力和泛化能力。这不仅丰富了强化学习在自然语言处理中的应用场景,也为未来多模型协作和多样性优化提供了理论基础。长远来看,该方法有望推动大规模语言模型在复杂推理任务中的性能突破,促进其在教育、科研和工业中的广泛应用。

技术贡献

本文提出了基于外部弱模型生成前缀的RLVR框架,结合信息熵动态调节策略,有效缓解策略的早期崩溃问题。创新点在于引入跨模型生成的非参数扰动机制,区别于传统的正则化或梯度调节,提供了新的探索激励。通过自动截断策略,确保前缀既能扰动模型,又不影响最终推理质量。实验证明,该方法在多个数学推理任务中显著提升pass@k指标,尤其在大k值时效果更优,展现出强大的推理覆盖能力。该技术为大模型的探索策略提供了新思路,具有广泛的适用性和扩展潜力。

新颖性

本研究首次系统性引入跨模型生成的前缀作为非参数扰动,突破了传统强化学习中仅依赖内部探索的局限。区别于知识蒸馏等方法,利用弱模型生成的多样性轨迹,激发目标模型的探索潜能。提出的基于信息熵的自动截断机制,确保扰动的有效性与稳定性。这一创新机制在提升推理覆盖和多样性方面表现出优越性,为大模型的探索策略提供了全新思路,填补了当前研究中关于多模型协作引导的空白。

局限性

  • 该方法依赖于弱模型生成的前缀质量,若弱模型表现极差或偏离目标任务,可能引入误导信息,影响最终性能。
  • 在极端复杂或偏门任务中,外部前缀的扰动效果有限,仍需结合其他探索策略优化。
  • 训练过程中引入多模型生成增加了计算成本,尤其在大规模模型场景下,效率仍需提升。

未来方向

未来将探索多模型融合策略,结合强化学习与模仿学习,进一步提升推理多样性。同时,优化前缀生成机制,提升弱模型的生成质量,减少误导信息。此外,考虑多任务和多模态场景的扩展,推动该方法在实际工业应用中的落地,特别是在教育、科研和自动推理系统中实现更广泛的应用。

AI 总览摘要

在大规模语言模型的推理训练中,策略的探索能力至关重要。现有的RLVR方法通过奖励信号引导模型学习高质量推理路径,但常常导致策略早期过度自信,信息熵迅速崩溃,从而限制了推理的多样性和覆盖范围。为解决这一问题,本文提出了一种基于弱模型生成前缀的外部引导策略。通过利用不同模型生成的部分推理轨迹作为前缀,扰动目标模型的生成分布,激发其探索未被充分挖掘的推理路径。该方法结合信息熵的动态调节机制,自动选择最具探索潜力的前缀长度,有效缓解了策略崩溃问题。实验在多个数学推理基准上验证了其优越性,尤其在pass@k指标上随着k的增加,性能提升更为明显,推理覆盖范围显著扩大。这一创新不仅丰富了强化学习在自然语言处理中的应用,也为多模型协作提供了新思路。未来,结合多模型融合和多任务场景,将推动大模型在复杂推理任务中的性能突破,拓展其在教育、科研和工业中的应用前景。

深度分析

研究背景

近年来,随着大规模预训练模型的发展,基于强化学习的微调策略(如RLHF、RLVR)成为提升模型推理能力的重要手段。代表性工作包括DeepSeek、GPT-5和Gemini等,显著改善了模型在数学推理和复杂任务中的表现。然而,现有方法普遍面临探索能力不足、策略早期崩溃的问题,导致推理路径多样性和覆盖率下降。尽管引入正则化和奖励设计有所缓解,但在大规模任务中仍难以根本解决模型过度自信和信息熵崩溃的核心难题。此背景下,如何利用多模型生成的多样性信息,作为非参数扰动,促进模型更广泛的探索,成为当前研究的热点。

核心问题

RLVR训练中,模型在优化高奖励路径时,容易陷入过度自信,导致策略信息熵快速下降,推理路径逐渐单一化。这不仅限制了模型的推理覆盖,也影响了其泛化能力。尤其在大k值的pass@k评估中,模型表现出明显的退化,反映出探索能力不足的问题。传统的正则化和奖励调节手段难以根本解决这一瓶颈,亟需新的机制引入多样性激励。如何在保证推理质量的同时,激发模型探索更多潜在路径,成为核心难题。

核心创新

本文提出了跨模型前缀引导的RLVR框架,创新点在于:1)利用不同模型生成的推理轨迹作为前缀,扰动目标模型的生成分布,增强探索;2)引入基于信息熵的自动截断策略,动态选择最具探索潜力的前缀长度;3)结合多模型生成的多样性,缓解策略早期崩溃,提升推理覆盖。该机制区别于传统正则化或知识蒸馏,强调非参数扰动和轨迹多样性,显著改善模型探索能力。

方法详解

  • �� 采用GRPO算法作为基础框架,结合外部弱模型生成的推理前缀,训练目标模型完成剩余推理。
  • �� 通过不同模型生成的部分推理轨迹作为前缀,扰动目标模型的生成分布,激发其探索潜能。
  • �� 使用信息熵动态调节策略,自动识别最具探索价值的前缀长度,避免过早策略收敛。
  • �� 设计混合训练策略,结合标准question-only RLVR和前缀补全RLVR,平衡探索与利用。
  • �� 在训练中引入多模型生成的前缀,利用信息熵差异进行自动截断,确保前缀既能扰动,又不影响最终推理质量。

实验设计

  • �� 采用Math训练集(7500题-答案对)和多个推理基准(AIME 2024/2025、MATH 500、Minerva、Olympiad)进行评估。
  • �� 比较基线为纯RLVR(GRPO)和引入不同模型前缀的变体。
  • �� 主要指标为pass@k,k从1到128,评估推理路径多样性和覆盖。
  • �� 超参数包括前缀生成概率p(0.2)、模型选择(Qwen2.5-7B、Gemma-2-2B等)和训练细节(学习率10^-6,批次大小1024等)。
  • �� 进行消融实验验证信息熵截断策略的有效性和不同模型前缀的影响。

结果分析

  • �� 引入外部前缀显著提升模型在所有基准上的pass@k表现,尤其在k值较大时效果更优。例如,Qwen2.5-7B模型在加入Gemma-2-2B前缀后,pass@128从67.76%提升至70.71%,提升4.95%。
  • �� 训练动态显示,策略熵在引入前缀后保持更高水平,延缓策略崩溃,增强探索能力。
  • �� 实验还揭示,即使弱模型生成的前缀质量不一定高,也能促进模型探索,验证了扰动机制的鲁棒性。

应用场景

  • �� 该方法适用于需要高推理覆盖率的自动问答、数学推理和复杂推理任务,可提升模型的多样性和泛化能力。
  • �� 在工业应用中,可用于增强模型的探索能力,改善模型在偏门或复杂场景下的表现,尤其适合教育、科研和自动推理系统。

局限与展望

  • �� 依赖于弱模型生成的前缀质量,若弱模型偏离任务目标,可能引入误导信息。
  • �� 训练过程中引入多模型计算成本较高,扩展到大规模场景时效率仍需优化。
  • �� 在极端复杂或偏门任务中,扰动效果有限,未来需结合其他探索策略提升鲁棒性。

通俗解读 非专业人士也能看懂

想象你在厨房做菜,厨师(模型)需要不断尝试不同的调料和做法,才能做出美味的菜肴。传统的方法让厨师只用自己熟悉的调料,结果菜品单一,缺乏创新。而这篇论文就像是给厨师提供一些来自不同厨师(弱模型)的小提示,让他尝试不同的调料组合。通过这些新奇的提示,厨师可以探索出更多不同的菜谱,避免陷入一成不变的套路。这样一来,菜肴的风味更丰富,味道也更受欢迎。这个方法让模型在推理时也能像厨师一样,尝试多样的路径,找到更全面、更创新的解决方案。

简单解释 像给14岁少年讲一样

想象你在玩一个解谜游戏,你平时只用一种方法解决问题,但有时候会遇到难题。这时,如果你能听听朋友(弱模型)给出的一些不同的建议,可能会发现新的解题思路。虽然这些建议不一定都完美,但它们能帮你跳出原来的思维框架,探索更多可能性。这个论文就像是让模型也听听“朋友”的建议,用不同的模型生成的部分推理作为线索,帮助它找到更多不同的解答路径。这样一来,模型就不再局限于自己原有的思路,而是能更全面、更聪明地解决问题,就像你在游戏中变得更厉害一样!

原文摘要

Reinforcement Learning with Verifiable Rewards (RLVR) significantly improves LLM reasoning but often causes a drop in policy entropy, leading to narrowed reasoning coverage and degraded pass@$k$ for large $k$. While existing methods mitigate this entropy collapse through algorithmic regularizations, cross-model non-parametric perturbation is also neglected. In this work, we propose a simple yet effective approach to preserve the generative diversity of LLMs during RLVR. Instead of relying solely on internal exploration, we force the target model to generate answers based on partial reasoning trajectories generated by a smaller, weaker language models. These unfamiliar prefixes effectively disrupt over-confidence and encourage the exploration of distinct reasoning paths. We empirically study the potential of outer prefixes, revealing the mechanism of the impact of distributional discrepancy to the exploration dynamics in RLVR training. Experiments across multiple mathematical benchmarks show that our method consistently outperforms vanilla RLVR. Notably, the performance gain becomes increasingly pronounced as $k$ scales up, demonstrating a substantial expansion of reasoning coverage. Furthermore, our approach efficiently mitigates entropy collapse without requiring additional SFT, intricate reward designs, or complex prompting.

cs.CL