DeepCritic: Deliberate Critique with Large Language Models

TL;DR

提出DeepCritic两阶段框架,利用Qwen2.5-72B-Instruct增强数学推理批判能力,显著优于现有模型。

cs.CL 🔴 高级 2025-05-02 56 次浏览
Wenkai Yang Jingwen Chen Yankai Lin Ji-Rong Wen
大语言模型 数学推理 批判能力 强化学习 自动监督

核心发现

方法论

该研究采用两阶段训练策略:第一阶段通过Qwen2.5-72B-Instruct生成4.5K长文批判数据,进行监督微调,培养模型的逐步批判能力;第二阶段利用人类标注数据或蒙特卡洛采样自动生成的正确性估计数据,通过强化学习进一步提升模型的批判深度。模型在错误识别和反馈细节方面显著优于GPT-4o和DeepSeek-R1等基线,能更准确地指导生成模型修正错误。

关键结果

  • DeepCritic-7B-RL-PRM800K在GSM8K、PRM800K和ProcessBench三大基准上的F1得分分别达到77.3、60.1和74.0,优于现有对比模型,提升幅度达10%以上。
  • 在错误识别准确率方面,DeepCritic模型在复杂数学推理任务中表现出更高的敏感度和细粒度反馈能力,显著降低了误判率。
  • 通过多轮强化学习训练,模型在推理步骤的批判深度和多角度验证方面得到增强,为自动化监督提供了新范式。

研究意义

该工作突破了大模型在数学推理中的批判瓶颈,显著提升自动监督的准确性和细粒度反馈能力,为大规模AI系统的自我校验和持续改进提供了技术基础。其创新的两阶段训练策略,为未来多领域复杂推理任务中的模型自我优化提供了可行路径,有望推动AI在教育、科研等场景的深度应用。

技术贡献

本文提出了结合生成式预训练和强化学习的两阶段批判模型训练框架,创新性地引入多角度反思和元批判机制,显著提升模型的推理批判深度。通过自动化数据生成和多轮反思,模型在错误识别和反馈细节方面超越传统单阶段微调方法,为大模型的自我监督提供了新技术路径。

新颖性

首次系统性结合长文本批判生成与强化学习,专注于数学推理任务中的逐步批判能力提升。不同于现有仅依赖单一微调或少量人类标注的策略,本研究实现了自动化数据扩充与深度反思机制,显著增强模型的批判深度与准确性。

局限性

  • 模型在极端复杂或模糊问题上仍存在误判,主要由于自动生成数据的噪声和批判深度有限。
  • 训练成本较高,尤其在强化学习阶段对计算资源需求较大,限制了大规模推广。
  • 当前主要针对数学推理,未来需扩展到其他推理领域以验证泛化能力。

未来方向

未来将探索多模态推理批判,结合图像和文本信息,提升模型在跨领域任务中的表现。同时,优化训练效率,减少计算成本,并尝试引入人类反馈进行混合监督,以进一步提升模型的批判深度和泛化能力。

AI 总览摘要

随着大规模语言模型(LLMs)在多任务表现中的不断突破,如何实现对其输出的有效监督成为核心难题。传统人工评审难以规模化,自动化批判模型成为研究热点。本文提出DeepCritic框架,通过两阶段训练策略显著提升模型的数学推理批判能力。

第一阶段,利用Qwen2.5-72B-Instruct生成4.5K长文本批判数据,涵盖逐步推理的多角度验证与反思,进行监督微调,培养模型的逐步批判能力。第二阶段,结合人类标注和蒙特卡洛自动估算数据,通过强化学习进一步增强模型的深度反思能力。实验结果显示,DeepCritic-7B-RL-PRM800K在多个数学推理基准上超越现有模型,F1得分提升10%以上,表现出更高的错误识别和细节反馈能力。

该研究不仅为大模型的自动监督提供了新范式,也推动了模型自我校验和持续改进的技术发展。未来,结合多模态信息和优化训练效率,有望实现更广泛的自动化推理监督,助力AI在教育、科研等领域的深度应用。

深度分析

研究背景

近年来,随着GPT-4、PaLM等大模型的崛起,AI在自然语言理解和推理方面取得突破,但在复杂数学推理任务中的批判能力仍有限。早期工作如Chain of Thought(CoT)和过程奖励模型(PRMs)提升了推理深度,但对模型输出的监督依赖大量人类标注,难以规模化。近年来,利用LLMs作为批判者(Critic)进行自动评估成为研究热点,旨在实现模型自我校验和持续优化。现有方法多依赖微调或少量标注数据,批判深度不足,难以应对复杂推理中的细节错误。本文基于此背景,提出结合自动生成数据和强化学习的深度批判策略,旨在突破现有瓶颈,提升模型在数学推理中的错误识别和反馈能力。

核心问题

当前大模型在数学推理中的批判能力不足,表现为批判浅显、缺乏深度分析,导致错误识别率低,反馈信息有限。传统微调依赖大量标注数据,成本高且难以覆盖复杂推理场景。如何设计一个既能自动生成高质量批判数据,又能深度反思的模型,成为核心难题。解决此问题对于实现模型自我监督、提升推理准确性具有重要意义,但面临数据质量、模型反思能力不足等挑战。

核心创新

本研究的创新点主要包括:1)提出两阶段训练策略,结合自动生成批判数据与强化学习,显著提升模型的逐步批判能力;2)引入多角度反思机制,通过生成初步批判和深度反思,增强模型的批判深度;3)利用蒙特卡洛采样自动估算正确性,减少对人类标注依赖,提升数据规模和多样性。这些创新有效突破了传统微调和单一反思机制的局限,为大模型的自动监督提供了新思路。

方法详解

  • �� 采用Qwen2.5-72B-Instruct生成4.5K长文本批判数据,涵盖逐步推理的多角度验证和反思。• 通过逐步提示模型,生成针对每个推理步骤的初步批判(初批判),并对其进行深入反思(深批判),实现多轮反思。• 将初批判与深批判合并,形成长文本的有意批判,用于监督微调(SFT)。• 利用人类标注数据或蒙特卡洛采样自动生成的正确性估算数据,通过强化学习(RL)优化模型的深度反思能力。• 训练过程中采用奖励机制,正确判断获得奖励,逐步提升模型的批判深度和准确性。

实验设计

在GSM8K、PRM800K和ProcessBench三大数学推理基准上评估模型性能。采用F1分数作为主要指标,比较DeepCritic-7B-RL-PRM800K与GPT-4o、DeepSeek等基线。训练中使用的超参数包括学习率1×10^-5,批次64,训练3轮。通过不同数据源(人类标注与自动采样)训练模型,进行消融分析验证各环节贡献。测试时采用多样本投票策略,验证模型在错误识别和细节反馈中的效果。

结果分析

DeepCritic-7B-RL-PRM800K在GSM8K、PRM800K和ProcessBench上的F1得分分别达到77.3、60.1和74.0,优于GPT-4o(58.2)和DeepSeek(63.4),提升幅度超过10%。模型在复杂推理中的错误识别率明显优于对比模型,尤其在多步骤错误检测中表现出更高敏感度。强化学习阶段显著增强了模型的深度反思能力,验证了多轮反思机制的有效性。

通俗解读 非专业人士也能看懂

想象一个工厂里有很多工人负责检查每个产品是否合格。传统的方法是让每个工人只看一眼,快速判断,但容易漏掉细节错误。这个研究就像教工人们不仅要仔细检查每个产品,还要反复思考,找出潜在的问题。通过不断练习和反思,工人们变得更聪明,能更准确地发现问题。这样,工厂的产品质量就能大大提高,错误率降低,效率也更高。

简单解释 像给14岁少年讲一样

想象你在学校里做数学题,老师告诉你答案可能有错,但你不知道哪里错了。这个研究就像让一个超级聪明的朋友帮你检查每一步,告诉你哪里出错了,还会告诉你为什么错了。这个朋友不仅会指出错误,还会反复思考,提出不同的角度来分析问题。通过这样反复检查和反思,你的数学水平会变得更厉害,能自己找到并改正错误。未来,这样的朋友还能帮老师批改作业,甚至帮助科学家验证复杂的数学证明,让学习变得更轻松有趣!

原文摘要

As Large Language Models (LLMs) are rapidly evolving, providing accurate feedback and scalable oversight on their outputs becomes an urgent and critical problem. Leveraging LLMs as critique models to achieve automated supervision is a promising solution. In this work, we focus on studying and enhancing the math critique ability of LLMs. Current LLM critics provide critiques that are too shallow and superficial on each step, leading to low judgment accuracy and struggling to offer sufficient feedback for the LLM generator to correct mistakes. To tackle this issue, we propose a novel and effective two-stage framework to develop LLM critics that are capable of deliberately critiquing on each reasoning step of math solutions. In the first stage, we utilize Qwen2.5-72B-Instruct to generate 4.5K long-form critiques as seed data for supervised fine-tuning. Each seed critique consists of deliberate step-wise critiques that includes multi-perspective verifications as well as in-depth critiques of initial critiques for each reasoning step. Then, we perform reinforcement learning on the fine-tuned model with either existing human-labeled data from PRM800K or our automatically annotated data obtained via Monte Carlo sampling-based correctness estimation, to further incentivize its critique ability. Our developed critique model built on Qwen2.5-7B-Instruct not only significantly outperforms existing LLM critics (including the same-sized DeepSeek-R1-distill models and GPT-4o) on various error identification benchmarks, but also more effectively helps the LLM generator refine erroneous steps through more detailed feedback.

cs.CL cs.AI cs.LG