Linking Process to Outcome: Conditional Reward Modeling for LLM Reasoning

TL;DR

CRM以条件概率连接步骤与结果;RL无验证器时AIME24达43.3%,显著优于PURE。

cs.LG 🔴 高级 2025-10-01 27 次浏览
Zheng Zhang Ziwei Shan Kaitao Song Yexin Li Kan Ren
条件奖励建模 过程奖励模型 LLM推理 信用分配 强化学习

核心发现

方法论

CRM将推理轨迹视为有限时域MDP,并令h(t)=Pr(z=t|z≥t)表示在此前步骤正确时,第t步首次进入错误状态的概率。通过链式法则,S(T)=∏t(1−h(t))表示最终正确概率;采用Potential-Based Reward Shaping,定义逐步奖励rt=log(1−h(t)),同时建模步骤依赖与最终结果。

关键结果

  • 在Best-of-N中,Qwen2.5-3B-Instruct于MATH500、N=32时CRM达56.6%,较最佳基线高1.4个百分点;LLaMA3.1-8B在GSM-Plus、N=32达69.1%。
  • 在Beam Search中,Qwen2.5-Math-7B于MATH500、N=100达64.07%,高于ORM的60.73%;Gaokao2023达48.40%,显示对域外任务仍具引导能力。
  • RL无验证器时,CRM在AIME24达43.3%,较PURE高16.7个百分点;在MATH500、Minerva Math、OlympiadBench等多数基准取得最高或近最高Pass@1。

研究意义

论文缓解了PRM长期存在的局部评分、结果脱钩和信用分配模糊问题。CRM让奖励具有统一概率语义,因此既能比较同一问题的候选轨迹,也能比较不同问题的样本。在缺少可验证答案的开放推理任务中,这为Best-of-N、搜索和RL提供了更稳定的信号,降低了奖励被表面模式操纵的风险。

技术贡献

核心贡献是把过程奖励写成条件失败概率的对数,而非独立步骤分类或相邻步骤排序。生存概率S(t)通过链式法则分解为∏(1−h(t)),最终结果与所有中间奖励严格相连;错误轨迹额外使用首次错误位置zi的概率p(zi)监督。损失LS、LW和Lz共同训练h(t),并以PBRS获得稠密奖励。

新颖性

与vanilla PRM的孤立分类、PQM的局部Q值排序、IPRM的结果对数和不同,CRM同时编码前缀条件依赖、首次错误事件和最终正确概率。其新意不只是增加结果标签,而是建立可验证的概率链,使每一步对结果的贡献拥有明确语义。

局限性

  • 训练依赖Math-Shepherd及其步骤标注,并需要首次错误位置zi;这类标注在非数学、开放式任务中昂贵且未必唯一。
  • 实验主要集中于数学推理和Qwen/LLaMA骨干,尚不能证明在代码、科学问答或长程工具调用中同样有效。
  • 概率模型假设错误状态可被识别且一旦进入便无法恢复;真实推理可能存在纠错与回溯。

未来方向

未来可研究可恢复错误、层级步骤和工具调用下的CRM,并扩展到代码、科学与多模态推理。还应比较不同错误位置标注策略、校准方法和参数高效训练,评估更大模型及真实在线RL中的计算成本与安全性。

AI 总览摘要

大语言模型的推理能力常依赖逐步生成,但传统Outcome Reward Model只在末尾评分,vanilla PRM则把每一步近似当作孤立分类任务。PQM关注邻近步骤排序,IPRM把结果写成过程奖励之和;这些方法仍难说明某一步如何导致最终正确或错误,因而可能出现奖励上升而准确率下降的reward hacking。

Zhang等提出Conditional Reward Modeling(CRM),把推理看成逐步接近正确答案、也可能首次进入不可恢复错误状态的过程。模型学习条件危险率h(t),并由链式法则得到正确生存概率S(T)=∏(1−h(t))。通过Potential-Based Reward Shaping,步骤奖励为rt=log(1−h(t));正确轨迹优化LS,错误轨迹同时优化LW和首次错误位置Lz。这样,奖励既依赖完整前缀,又显式连接终局结果。

实验覆盖Best-of-N、Beam Search和RLOO强化学习。CRM在MATH500、Qwen2.5-3B-Instruct的Best-of-32达到56.6%;Qwen2.5-Math-7B的Beam Search在MATH500、N=100达到64.07%。更突出的是,无验证器RL在AIME24达到43.3%,比PURE高16.7个百分点。结果表明,概率一致性改善了跨样本排序和信用分配,但其泛化仍受数学数据、首次错误标注及不可恢复错误假设限制。

深度分析

研究背景

推理增强经历了CoT、Best-of-N、Beam Search和RL的发展。DeepSeek-R1等系统利用可验证奖励取得进展,但依赖答案标签,难以扩展到开放任务。ORM提供终局信号,PRM提供步骤信号;Math-Shepherd、PQM和IPRM进一步细化过程评价,却仍未完整解决步骤依赖与结果对齐。

核心问题

给定问题x和步骤a1:T,奖励模型需要判断部分轨迹是否正在导向正确答案。孤立评分忽略前缀语境,局部排序不能跨样本比较,结果监督又难以回传到具体步骤,导致信用分配不清和reward hacking。

核心创新

CRM引入首次错误步z,并学习条件概率h(t)=Pr(z=t|z≥t)。第一,前缀条件化捕获时间依赖;第二,链式法则将所有步骤连接到S(T);第三,Lz定位首次错误,减少终局标签的模糊回传;第四,概率语义使不同轨迹分数可比较。

方法详解

  • �� 状态st=(x,a≤t−1),LLM为策略,状态转移由拼接步骤决定。
  • �� 建模错误累计概率W(t)、生存概率S(t)=1−W(t),及首次错误概率p(t)。
  • �� 用h(t)=p(t)/S(t−1)表达条件失败风险。
  • �� 由S(T)=∏t(1−h(t))推导rt=log(1−h(t)),采用PBRS且γ=1。
  • �� 正确样本使用LS=−logS(T);错误样本使用LW=−log(1−S(T))与Lz=−logp(zi)。

实验设计

奖励模型在Math-Shepherd上全参数微调,并与ORM、vanilla PRM、PQM、IPRM公平比较。Best-of-N使用GSM-Plus和MATH500;Beam Search使用MATH500与OOD数据Gaokao2023;RL使用Orz-Math-57k、Qwen2.5-Math-7B和token-level RLOO,评测六个数学基准。

结果分析

CRM在多个设置稳定领先。MATH500上Qwen2.5-Math-7B Beam Search由N=4的56.07%升至N=100的64.07%;Gaokao2023从39.83%升至48.40%。无VR RL中,CRM在AIME25为23.3%、AIME24为43.3%、AMC23为43.3%,整体优于PRM、PQM和PURE;CRM+VR多数任务进一步提升。

应用场景

CRM可直接用于候选答案重排、逐步Beam Search剪枝和无答案验证器RL。适合数学、代码或科学推理等难以持续获得人工或程序真值的场景,但需构造可靠的轨迹标签或错误位置信号,并控制推理成本。

局限与展望

方法需要Math-Shepherd式过程数据和首次错误位置,标注成本限制规模化。其“进入错误状态后不可恢复”的生存分析假设不完全符合真实推理。当前实验集中于数学基准,且完整参数微调成本较高;未来应加入回溯、工具调用、自动校准及更广领域验证。

通俗解读 非专业人士也能看懂

把解题想成一条工厂流水线。传统方法要么只检查最后产品是否合格,要么逐个检查工位,却不管前面工位发生了什么;有些方法只比较相邻工位的分数。这样,某个工位即使看起来很忙,也可能把错误零件送进后面。

CRM像一名持续追踪的质检员。它会根据已经经过的所有工位,估计当前工位把产品带入“无法修复错误”的风险。如果每个工位都降低风险,就把整条生产线成功交付的机会相乘。每一步的分数因此不是孤立印象,而是“在目前进度下,继续成功的机会”。

如果最后产品失败,CRM还会寻找第一个真正出错的工位;如果成功,则奖励整条线路保持正确。这样,工厂可以从许多候选线路中挑出最可靠的一条,也能训练工人少犯关键错误。实验中它在MATH500搜索和AIME24强化学习上明显优于多种旧方法,但目前主要在数学工厂中验证。

简单解释 像给14岁少年讲一样

想象你在游戏里解一道超难谜题。你每走一步,系统都要判断:这一步是在接近宝藏,还是已经走进死胡同?普通评分器常常只看最后有没有通关,或者把每一步单独打分,好像完全不知道你前面走过哪条路。

CRM像一个聪明的队友。它记得你之前所有操作,并计算“在目前路线下,下一步继续成功的概率”。如果某一步让成功机会下降,它会给出更低的分数;所有步骤的分数合起来,就对应整局通关的可能性。若你输了,它还努力找出第一个导致失败的关键操作,而不是把锅平均甩给所有步骤。

这有什么用?当你同时生成8、32或100条解题路线时,CRM能更好地挑出靠谱路线,也能在训练模型时告诉它哪里需要改进。论文中,MATH500搜索达到64.07%,AIME24训练达到43.3%,比PURE高16.7个百分点!不过它主要测试数学题,而且现实推理有时能回头修错,这一点还需要继续研究。

术语表

Conditional Reward Modeling(条件奖励建模)

根据此前完整步骤和最终结果含义计算当前奖励的模型。它用条件概率而非孤立标签描述推理进展。

论文提出的CRM框架。

Process Reward Model(过程奖励模型)

为中间推理步骤提供奖励的模型。它比只在结尾评分的ORM提供更密集反馈。

CRM对比的主要基线。

Hazard h(t)(条件错误风险)

此前步骤正确时,第t步首次进入错误状态的概率。其互补值1−h(t)表示当前步骤保持正确的概率。

CRM的核心预测量。

Survival probability S(t)(生存概率)

推理截至第t步尚未进入错误状态的概率。论文中S(T)代表最终达到正确答案的概率。

轨迹评分和损失计算。

Potential-Based Reward Shaping(基于势函数的奖励塑形)

用状态势函数差分把稀疏奖励转为稠密奖励,同时保持最优策略。CRM采用Φ(st)=logS(t)。

推导rt=log(1−h(t))。

Reward hacking(奖励投机)

模型提高评分却没有提高真实任务表现的现象。它通常源于奖励模型捕捉表面模式。

CRM鲁棒性分析。

开放问题 这项研究留下的未解疑问

  • 1 CRM如何处理可恢复错误、回溯和多个相互独立的错误状态?需要带有修正轨迹的因果数据与更灵活的状态模型。
  • 2 Math-Shepherd上的概率校准能否迁移到代码、科学问答和多模态任务?跨领域数据与统一评价仍不足。
  • 3 完整微调和逐步评分的成本如何降低?参数高效训练、蒸馏及在线缓存可能是方向。

应用场景

近期应用

数学候选答案重排

教育平台或推理服务可生成多条解答,再用CRM的S(T)排序,替代只看最终格式的ORM。前提是有Math-Shepherd式过程数据;预期可提升MATH500、GSM-Plus等任务的选择准确率。

搜索与训练引导

在Beam Search中用S(t)保留前缀,在RL中用rt提供稠密反馈。该方案尤其适合缺乏可验证答案的任务,并可减少表面冗长或模板化推理带来的奖励投机。

远期愿景

通用无验证器推理系统

若扩展到代码、科学研究和工具调用,CRM可能成为统一的过程—结果评价层。主要障碍是自动发现错误位置、处理回溯,以及证明概率在不同领域保持校准。

原文摘要

Process Reward Models (PRMs) have emerged as a promising approach to enhance the reasoning capabilities of large language models (LLMs) by guiding their step-by-step reasoning toward a final answer. However, existing PRMs either treat each reasoning step in isolation, failing to capture inter-step dependencies, or struggle to align process rewards with the final outcome. Consequently, the reward signal fails to respect temporal causality in sequential reasoning and faces ambiguous credit assignment. These limitations make downstream models vulnerable to reward hacking and lead to suboptimal performance. In this work, we propose Conditional Reward Modeling (CRM) that frames LLM reasoning as a temporal process leading to a correct answer. The reward of each reasoning step is not only conditioned on the preceding steps but also explicitly linked to the final outcome of the reasoning trajectory. By enforcing conditional probability rules, our design captures the causal relationships among reasoning steps, with the link to the outcome allowing precise attribution of each intermediate step, thereby resolving credit assignment ambiguity. Further, through this consistent probabilistic modeling, the rewards produced by CRM enable more reliable cross-sample comparison. Experiments across Best-of-N sampling, beam search and reinforcement learning demonstrate that CRM consistently outperforms existing reward models, offering a principled framework for enhancing LLM reasoning. In particular, CRM is more robust to reward hacking and delivers stable downstream improvements without relying on verifiable rewards derived from ground truth.

cs.LG