GenPRM: Scaling Test-Time Compute of Process Reward Models via Generative Reasoning

TL;DR

GenPRM通过生成推理扩展测试时计算能力,在ProcessBench上超越GPT-4o。

cs.CL 🔴 高级 2025-04-01 9 次浏览
Jian Zhao Runze Liu Kaiyan Zhang Zhimu Zhou Junqi Gao Dong Li Jiafei Lyu Zhouyi Qian Biqing Qi Xiu Li Bowen Zhou
生成推理 过程奖励模型 测试时扩展 数学推理 代码验证

核心发现

方法论

GenPRM通过生成推理和代码验证重新定义过程监督,将其视为生成任务而非判别任务。采用相对进展估计(RPE)和推理合成框架获取高质量标签。

关键结果

  • GenPRM在ProcessBench上以23K训练数据超越GPT-4o,1.5B模型超过GPT-4o,7B模型超过Qwen2.5-Math-PRM-72B。
  • GenPRM在数学推理任务中表现优异,特别是在复杂问题上表现出色。
  • GenPRM在政策模型优化中表现出色,显著提升模型性能。

研究意义

GenPRM为过程监督建立了新范式,结合生成推理和代码验证,解决了现有PRM的监督和扩展能力不足的问题,对学术界和工业界具有重要意义。

技术贡献

GenPRM通过生成推理和代码验证重新定义过程监督,提供了新的理论保证和工程可能性,显著提升了PRM的扩展能力。

新颖性

GenPRM首次将生成推理与代码验证结合,显著提升了过程监督模型的性能和扩展能力,相较于传统PRM具有根本创新。

局限性

  • GenPRM在处理极复杂推理任务时可能仍有局限,需进一步优化。
  • 模型训练数据量相对较少,可能影响泛化能力。

未来方向

未来工作可探索更大规模数据集上的应用,优化生成推理和代码验证的结合策略,提升模型的泛化能力和效率。

AI 总览摘要

近年来,大型语言模型(LLM)的进步使得利用过程奖励模型(PRM)作为验证器来增强LLM性能成为可能。然而,现有PRM在过程监督和扩展能力上存在局限。GenPRM通过生成推理和代码验证重新定义过程监督,显著提升了模型的性能。在ProcessBench和数学推理任务中,GenPRM表现出色,尤其是在复杂问题上。通过测试时扩展,GenPRM的1.5B模型超越了GPT-4o,7B模型超过了Qwen2.5-Math-PRM-72B。GenPRM为过程监督建立了新范式,结合生成推理和代码验证,解决了现有PRM的监督和扩展能力不足的问题,对学术界和工业界具有重要意义。未来工作可探索更大规模数据集上的应用,优化生成推理和代码验证的结合策略,提升模型的泛化能力和效率。

深度分析

研究背景

近年来,随着大型语言模型(LLM)的发展,过程奖励模型(PRM)作为验证器的潜力逐渐被发掘。然而,现有PRM在过程监督和扩展能力上存在局限,难以适应不同任务和模型。

核心问题

现有PRM依赖于标量值预测,未能充分利用LLM的生成能力,导致过程监督和扩展能力受限,难以在复杂任务中取得优异表现。

核心创新

GenPRM通过生成推理和代码验证重新定义过程监督,将其视为生成任务而非判别任务,显著提升了模型的性能和扩展能力。

方法详解

  • �� 生成推理:通过显式的思维链(CoT)推理和代码验证重新定义过程监督。
  • �� 相对进展估计(RPE):利用相对标准进行标签估计,提高标签准确性。
  • �� 推理合成框架:结合代码验证获取高质量过程监督推理数据。

实验设计

实验在ProcessBench和多个数学推理任务上进行,使用MATH数据集的23K训练数据。通过测试时扩展,GenPRM在多个基准上超越现有PRM。

结果分析

GenPRM在ProcessBench上以23K训练数据超越GPT-4o,1.5B模型超过GPT-4o,7B模型超过Qwen2.5-Math-PRM-72B。

应用场景

GenPRM可用于增强LLM在复杂推理任务中的性能,特别是在数学推理和政策模型优化中。

局限与展望

GenPRM在处理极复杂推理任务时可能仍有局限,需进一步优化。模型训练数据量相对较少,可能影响泛化能力。

通俗解读 非专业人士也能看懂

想象一个工厂,工人们需要完成一系列复杂的任务。GenPRM就像一个聪明的主管,它不仅能给出任务的完成情况,还能通过观察工人的工作步骤,给出改进建议。通过这种方式,工厂的效率大大提高,工人们也能更好地完成任务。这个主管不仅仅依赖于简单的评分系统,而是通过观察和分析每个步骤,确保每个环节都能顺利进行。

简单解释 像给14岁少年讲一样

想象你在玩一个复杂的游戏,GenPRM就像一个超级助手。它不仅能告诉你当前的得分,还能分析你每一步的操作,给出建议帮你更快通关。就像有个聪明的朋友在旁边,随时给你提示,让你在游戏中表现更好。是不是很酷?

术语表

生成推理 (Generative Reasoning)

通过生成模型进行推理和判断的过程,结合生成能力和推理能力。

用于重新定义过程监督,提升模型性能。

过程奖励模型 (Process Reward Model)

用于验证和增强LLM性能的模型,通过奖励机制指导模型优化。

作为验证器提升LLM在复杂任务中的表现。

代码验证 (Code Verification)

通过生成和执行代码来验证推理步骤的正确性,确保推理过程的准确性。

结合生成推理提高过程监督的准确性。

相对进展估计 (Relative Progress Estimation)

通过比较当前和下一状态的进展来估计标签的准确性,提高标签的可靠性。

用于获取高质量的过程监督标签。

思维链 (Chain-of-Thought)

通过显式的推理链条进行推理和判断,增强模型的推理能力。

结合代码验证提升生成推理的效果。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模的数据集上应用GenPRM以提升泛化能力?
  • 2 生成推理与代码验证的结合策略如何优化以提高效率?

应用场景

近期应用

数学推理任务

GenPRM可用于增强数学推理任务中的性能,特别是在复杂问题上。

远期愿景

通用人工智能

通过优化生成推理和代码验证,GenPRM有潜力推动通用人工智能的发展。

原文摘要

Recent advancements in Large Language Models (LLMs) have shown that it is promising to utilize Process Reward Models (PRMs) as verifiers to enhance the performance of LLMs. However, current PRMs face three key challenges: (1) limited process supervision and generalization capabilities, (2) dependence on scalar value prediction without leveraging the generative abilities of LLMs, and (3) inability to scale the test-time compute of PRMs. In this work, we introduce GenPRM, a generative process reward model that performs explicit Chain-of-Thought (CoT) reasoning with code verification before providing judgment for each reasoning step. To obtain high-quality process supervision labels and rationale data, we propose Relative Progress Estimation (RPE) and a rationale synthesis framework that incorporates code verification. Experimental results on ProcessBench and several mathematical reasoning tasks show that GenPRM significantly outperforms prior PRMs with only 23K training data from MATH dataset. Through test-time scaling, a 1.5B GenPRM outperforms GPT-4o, and a 7B GenPRM surpasses Qwen2.5-Math-PRM-72B on ProcessBench. Additionally, GenPRM demonstrates strong abilities to serve as a critic model for policy model refinement. This work establishes a new paradigm for process supervision that bridges the gap between PRMs and critic models in LLMs. Our code, model, and data will be available in https://ryanliu112.github.io/GenPRM.

cs.CL