Beyond Normalization: Rethinking the Partition Function as a Difficulty Scheduler for RLVR

TL;DR

提出PACED-RL,利用分区函数作为在线准确率信号,提升LLM分布匹配训练效率。

cs.CL 🔴 高级 2026-02-13 53 次浏览
Dohyung Kim Minbeom Kim Jeonghye Kim Sangmook Lee Sojeong Rhee Kyomin Jung
强化学习 GFlowNets 大规模语言模型 样本效率 分布匹配

核心发现

方法论

本文首先建立分区函数与每个提示的在线准确率之间的理论关系,利用GFlowNet训练过程中已产生的信息,将分区函数转化为每个提示的期望奖励信号。基于此,提出PACED-RL框架,包括利用准确率估计进行难度感知的提示选择,以及基于估计误差的重放机制。该方法通过复用已有信息,有效降低额外计算成本,提升样本效率。具体实现包括:• 通过修改Trajectory Balance损失,将分区函数Zϕ与在线准确率关联;• 利用Zϕ估算提示的准确率,指导难度调节;• 引入误差优先重放策略,强化对高误差样本的学习。实验在数学推理和代码生成任务中验证了该方法的优越性。

关键结果

  • 在AIME数据集上,PACED-RL在pass@1指标上比GRPO提升29.1%,比FlowRL提升40.0%;在pass@k指标上,最大提升达14.2%。在数学推理任务中,Qwen2.5-Math-7B模型通过PACED-RL在AIME24上达到了13.1%的性能,显著优于对比方法。
  • 在代码生成任务中,PACED-RL实现了训练速度的提升,达到了GRPO和FlowRL的0.49倍和0.42倍训练时间即可达到相应性能,验证了样本效率的提升。
  • 通过引入准确率估计误差优先重放,有效改善了模型对难题的适应能力,增强了探索能力和多样性,尤其在高难度任务中表现突出。

研究意义

该研究突破了传统归一化视角,将分区函数作为动态难度调节器,显著提升了LLM在推理和生成任务中的样本利用效率。通过理论联系实际,提出可复用的准确率估算机制,为未来大规模模型训练提供了新的思路,有助于解决模型泛化不足和探索有限的问题。该方法兼顾多样性与效率,为AI系统的自主学习和推理能力的提升奠定基础。

技术贡献

技术上,本文首次将GFlowNet的分区函数与在线准确率建立紧密联系,提出利用Zϕ作为提示难度的估算指标。创新性地引入难度感知的提示选择和估计误差优先重放机制,有效利用已有训练信息,降低额外计算负担。理论上,证明了Zϕ与提示准确率的关系,为分布匹配提供了新理论基础。实践中,显著提升了样本效率和模型多样性,推动了GFlowNet在LLM后训练中的应用边界。

新颖性

本研究的核心创新在于将GFlowNet的分区函数从单纯的归一化工具转变为动态难度信号,首次实现了利用该信号进行提示难度调节和重放优先级的机制。这在现有工作中尚未涉及,突破了传统分布匹配的局限,为模型训练中的样本效率和探索能力提供了新思路。

局限性

  • 该方法依赖于分区函数估算的准确性,若模型训练不稳定或数据偏差,可能导致估算偏差,影响效果。
  • 在极端复杂或高维任务中,准确率估算可能受到噪声干扰,限制其适用范围。
  • 当前实验主要在特定任务和模型规模下验证,泛化到更大规模或多模态任务仍需进一步验证。

未来方向

未来可探索将该机制扩展到多模态任务和更大规模模型,结合自监督信号进一步提升准确率估算的鲁棒性。同时,结合主动学习策略,动态调整提示难度,以实现更高效的自主学习体系。还可研究多任务、多目标场景下的分布匹配与难度调节的协同机制,推动AI系统的自主推理能力发展。

AI 总览摘要

近年来,深度学习模型在推理和生成任务中表现出巨大潜力,但其训练效率与多样性之间存在矛盾。传统的强化学习方法如PPO虽能增强推理能力,却导致输出过于集中,限制多样性。GFlowNets作为一种分布匹配框架,能在保持多样性的同时优化奖励分布,但其核心的分区函数一直被视为归一化工具,未被充分利用。本文提出PACED-RL,将分区函数转化为每个提示的在线准确率信号,突破了这一局限。通过理论证明分区函数与准确率的关系,作者设计了难度感知的提示选择和误差优先重放机制,显著提升样本利用效率。实验证明,在数学推理和代码生成任务中,PACED-RL在多个指标上优于现有方法,训练速度提升一倍以上。该方法不仅增强了模型的探索能力,还保持了输出的多样性,为大规模语言模型的高效训练提供了新思路。未来,结合多模态和多任务场景,PACED-RL有望推动自主推理和学习能力的进一步突破。

深度分析

研究背景

深度学习模型在自然语言处理中的应用不断扩大,尤其在推理和生成任务中表现出色。早期方法多依赖监督学习,难以应对复杂推理。强化学习(RL)引入奖励机制,提升模型推理能力,但存在输出多样性不足的问题。近年来,GFlowNets作为一种基于分布匹配的框架,逐渐成为研究热点,能在保持多样性的同时优化奖励分布。代表性工作如FlowRL,将分区函数作为归一化工具,推动了LLM后训练的发展。然而,分区函数的潜在信息未被充分挖掘,限制了样本效率和模型探索能力。

核心问题

当前的RL训练方法在提升推理性能的同时,牺牲了输出多样性,限制了模型的探索空间。GFlowNets虽能缓解这一问题,但其分区函数仅作为归一化工具,未能利用其潜在的丰富信息。此外,训练过程中缺乏有效的提示难度调节机制,导致样本利用率低,训练成本高。如何充分利用分区函数中的信息,实现动态难度调节和高效样本重用,成为亟待解决的核心问题。

核心创新

本文提出将GFlowNet的分区函数作为在线准确率信号,建立其与提示难度的理论联系,创新性地实现难度感知的提示选择。引入误差优先重放机制,强化对高误差样本的学习,提升样本效率。该方案突破了传统只作为归一化工具的限制,赋予分区函数新的功能,兼顾探索与多样性。技术上,结合Trajectory Balance损失,设计了可直接估算准确率的Zϕ模型,显著降低额外计算成本,提升训练效率。

方法详解

  • �� 通过修改Trajectory Balance损失,将分区函数Zϕ与每个提示的在线准确率联系起来;• 利用Zϕ估算提示的准确率,指导提示难度调节,优先采样中等难度问题;• 引入估计误差优先重放机制,存储高误差样本,增强模型对难题的适应能力;• 复用已有训练信息,无需额外推理或采样,降低计算负担;• 在数学推理和代码生成任务中进行大规模验证,调整超参数如β和重放缓冲区容量。

实验设计

采用DeepCoder和DeepScaleR数据集,基于Qwen系列模型,比较PACED-RL与GRPO、FlowRL等基线。指标包括pass@1和pass@k,训练速度和样本效率。设置β=0.05,重放缓冲区容量128,每步添加64样本。在多个任务中,评估模型性能变化,进行消融分析验证提示难度调节和重放机制的贡献。

结果分析

在AIME数据集上,PACED-RL在pass@1指标上比GRPO提升29.1%,比FlowRL提升40.0%;在pass@k指标上,最大提升达14.2%。在数学推理任务中,Qwen2.5-Math-7B模型通过PACED-RL在AIME24上达到了13.1%的性能,显著优于对比方法。训练速度方面,PACED-RL在相同性能水平下,训练时间比GRPO和FlowRL分别缩短一半以上。多任务评估显示,模型在探索多样性和复杂推理方面均优于传统方法,验证了样本效率和探索能力的提升。

应用场景

该方法适用于需要高效推理和多样性输出的应用场景,如自动问答、代码生成、数学推理等。通过动态调节提示难度,模型能更快适应新任务,减少训练成本。未来,结合主动学习和多模态输入,有望实现更智能的自主学习系统,推动AI在复杂推理和创造性任务中的应用。

局限与展望

该方法依赖于分区函数的准确估算,若模型训练不稳定或数据偏差,可能影响效果。高复杂度任务中,准确率估算可能受到噪声干扰,限制其适用范围。当前实验主要在特定任务和模型规模下验证,泛化到更大模型或多模态场景仍需验证。未来需优化估算鲁棒性,降低对超参数的敏感性。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,工厂每天生产不同的商品。传统方法是用一个固定的标准来衡量每个商品的质量,然后根据这个标准调整生产线,但这个标准只是一个简单的归一化工具,没有考虑商品的实际难度或质量变化。现在,研究人员发现,可以用一个特殊的“评分器”——其实就是工厂里的一个智能检测系统——来实时评估每个商品的质量。这个评分器不仅告诉你商品好坏,还能反映出生产难度。于是,他们用这个“评分器”来优先处理那些质量中等、最需要改进的商品,从而让整个生产过程更高效、更有趣。这个新方法让工厂既能快速提升产品质量,又能保持多样性,避免只生产一种商品。就像这个工厂用智能评分器不断调整生产策略一样,AI模型也能用这个新工具更聪明、更快地学习和推理。

简单解释 像给14岁少年讲一样

想象你在学校里参加一个考试,题目难度不一样。有些题太简单,你做得太快,学不到新东西;有些题太难,你根本做不出来,也没学到东西。理想的学习方法是选择那些难度刚好适合你的题目——既不会太简单,也不会太难。这个研究就像给AI设计了一个“聪明的老师”,能根据每个题目的难度,帮它挑选最合适的题目来练习。这个“老师”其实是用模型内部的一个特别的评分系统来判断题目的难度,然后优先让AI练习那些既有挑战,又能学到新知识的题目。这样,AI就能更快、更有效地学习新技能,而且还能保持多样性,不会只会一种类型的题目。就像你在学校里学得更快、更全面一样,AI也能变得更聪明、更厉害。

术语表

Partition Function (分区函数)

在统计学和机器学习中,用于归一化概率分布的函数,确保所有可能结果的概率和为1。在本文中,它还反映每个提示的在线准确率。

用来调整模型输出的概率分布,提升样本效率和多样性。

GFlowNets (流动网络)

一种基于分布匹配的生成模型,通过学习分区函数实现多样性采样,避免传统RL的模式崩溃。

作为后训练阶段优化LLM的工具,本文利用其分区函数的潜在信息。

Online Accuracy (在线准确率)

模型在训练过程中实时估算的任务正确率,用于动态调节训练难度。

通过分区函数Zϕ估算,指导提示选择和重放优先级。

Trajectory Balance (轨迹平衡)

一种训练GFlowNets的损失函数,确保模型生成的轨迹符合目标分布。

用于建立分区函数与准确率的关系。

Prioritized Replay (优先重放)

强化学习中根据样本误差大小优先采样,提高训练效率的方法。

本文结合准确率估计误差,优化样本重用。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂、多模态任务中保持准确率估算的鲁棒性仍需探索,尤其在高噪声环境下的表现尚不明确。
  • 2 未来应研究分区函数在多任务、多目标场景中的动态调节机制,以实现更广泛的适用性。

应用场景

近期应用

智能问答系统

利用PACED-RL提升模型在复杂问题中的推理速度和多样性,增强用户体验。

自动代码生成

通过动态调节提示难度,提高生成代码的正确率和多样性,降低开发成本。

远期愿景

自主学习AI系统

结合难度调节机制,推动AI自主探索未知领域,实现更高层次的推理与创造能力。

原文摘要

Reward-maximizing RL methods have shown to be capable of enhancing the reasoning performance of LLMs, but often lead to reduced generation diversity. Recent works address this issue by adopting GFlowNets, training LLMs to match a target distribution while jointly learning its partition function. In contrast to prior works that treat this partition function solely as a normalizer, we reinterpret it as a per-prompt expected-reward (i.e., online accuracy) signal, leveraging this unused information to improve sample efficiency. Specifically, we first establish a theoretical relationship between the partition function and per-prompt accuracy estimates. Building on this key insight, we propose Partition Function-Guided RL (PACED-RL), a post-training framework that leverages accuracy estimates to prioritize informative question prompts during training, and further improves sample efficiency through an accuracy estimate error-prioritized replay. Crucially, both components reuse information already produced during GFlowNet training, effectively amortizing the compute overhead into the existing optimization process. Extensive experiments across diverse benchmarks demonstrate strong performance improvements over GRPO and prior GFlowNet approaches, highlighting PACED-RL as a promising direction for a more sample efficient distribution-matching training for LLMs.

cs.CL cs.AI