CATPO: Critique-Augmented Tree Policy Optimization

TL;DR

CATPO通过树信息评分与批判修复,提升数学推理任务中的准确率,达37.5%。

cs.CL 🔴 高级 2026-06-07 46 次浏览
Ayush Singh Umang Goyal Ankur Dahiya
强化学习 树搜索 大语言模型 推理优化 批判修正

核心发现

方法论

本文提出的CATPO结合树结构的奖励传播、树信息评分和批判修复机制。通过定义树的有效性指标F(T),结合叶子多样性与策略-奖励的相关性,识别信息丰富的树。对全失败树进行批判引导修复,定位错误节点,生成自然语言批评, graft修正分支。最终利用归一化的树评分调整梯度贡献,集中训练资源。此方法在Qwen2.5-Math-1.5B模型上,显著提升在AIME24、MATH-500等四个数学推理基准的宏平均准确率至37.5%,优于TreeRPO和GRPO。

关键结果

  • 在四个基准测试中,CATPO平均提升1.9%(相较TreeRPO)和4.8%(相较GRPO),达到37.5%的宏平均准确率,特别在难度较高的AIME24和OlympiadBench表现优异。
  • 树信息评分F(T)与梯度范数呈显著正相关(Pearson r=0.54,p=4.1e-5),验证其作为梯度贡献代理的有效性。
  • 批判修复能显著改善死错树(F≈0)中的信息利用率,88.1%的修复树F值提升,验证其修复能力。

研究意义

该研究突破了树结构强化学习中对不信息树的低效处理问题,通过树级别的评分和修复机制,有效提升模型推理能力与样本利用率。为大规模语言模型在复杂推理任务中的训练提供了新思路,推动RLVR在学术与工业界的应用落地。其创新的树信息评分与批判修复机制,为未来树结构强化学习提供了理论基础和实践范例,有望在自动推理、问题解答等领域实现更高效的模型训练与推理性能。

技术贡献

本文提出的核心技术在于定义树信息评分F(T),结合叶子多样性与策略-奖励的相关性指标,零成本实现树级别的有效性评估。引入批判引导修复机制,定位并修正全失败节点,提升树的有用信息。最后,将归一化的树评分作为梯度加权因子,有效集中训练资源。此方法区别于传统的平面采样或全树采样,提供了树结构层面的信息筛选与修复策略,增强了树结构强化学习的样本效率与训练效果。

新颖性

该研究首次在树结构强化学习中引入树信息评分机制,结合自然语言批判修复,有效识别并修复死错树,显著提升训练效率和模型性能。相较于以往仅在样本层面筛选或单纯的树采样,创新性地在树级别进行信息评估与修复,填补了树结构RL中未诊断不良树的空白。

局限性

  • 批判修复依赖模型自身的批判能力,面对复杂或边界问题时,修复效果有限,可能无法解决所有死错树。
  • 在极端困难或超出模型能力范围的问题上,修复可能无法提升树的有效性,存在根本性局限。
  • 该方法在大规模应用中仍需考虑计算成本,尤其是在树深度和分支数较大时,计算负担增加。

未来方向

未来可结合外部专家知识或多模态信息增强批判修复效果,探索自适应树信息阈值,提升识别与修复的鲁棒性。同时,结合更高效的树采样策略,进一步降低训练成本,扩展到更复杂的推理任务和多任务场景,推动树结构强化学习的广泛应用。

AI 总览摘要

在大规模语言模型推理能力不断提升的背景下,强化学习中的树结构采样方法逐渐成为研究热点。传统方法如TreeRPO和GRPO虽能提供细粒度的奖励信号,但在训练过程中存在大量无用树的浪费,尤其是全错或全对的树结构。本文提出的CATPO通过引入树信息评分机制,有效识别出最具学习潜力的树结构,避免资源浪费。同时,针对全错树,采用自然语言批判引导修复,定位错误节点并 graft修正分支,从而恢复训练信号。最后,将树评分归一化后作为梯度加权因子,集中优化资源于最有价值的树。实验证明,该方法在Qwen2.5-Math-1.5B模型上,显著提升在四个数学推理基准的宏平均准确率至37.5%,优于现有的TreeRPO和GRPO。该研究不仅优化了树结构的利用效率,也为未来大模型的推理训练提供了新思路。未来工作将结合多模态信息和自适应阈值,进一步增强修复能力与训练效率,推动树结构强化学习在复杂推理任务中的应用落地。

深度分析

研究背景

近年来,随着大规模语言模型(LLMs)在自然语言处理中的突破,强化学习(RL)逐渐成为提升模型推理能力的重要手段。早期工作如RLHF通过人类偏好引导模型优化,但存在样本效率低、细粒度奖励难以获得的问题。树结构探索方法如TreeRPO和TreeRL通过多分支采样,提供更丰富的奖励信号,但在训练中未能区分有用与无用的树,导致计算资源浪费。近年来,研究者开始关注树的有效性评估与修复,试图提升样本利用率和训练效率。本文在此基础上,提出树信息评分与批判修复机制,旨在解决树结构中不信息树的低效问题,为树结构RL的实际应用提供新思路。

核心问题

现有树结构强化学习方法在训练过程中,未能有效识别和利用有信息的树,导致大量无效或低效的树结构浪费计算资源。特别是在复杂推理任务中,死错树(全失败)和死对树(全正确)占据大量采样,未能贡献有效梯度,影响模型性能提升。如何在保证训练效率的同时,筛选出最具潜力的树结构,成为亟需解决的问题。此外,死错树的训练信号难以利用,限制了模型的学习能力,亟需引入机制修复或重塑这些树结构。

核心创新

本文的核心创新在于引入树信息评分F(T),结合叶子多样性和策略-奖励的相关性,零成本评估树的学习潜力。对全失败树采用自然语言批判引导修复,定位错误节点并 graft修正分支,有效恢复训练信号。最后,将归一化的树评分作为梯度加权因子,集中训练资源于最有潜力的树。这一机制区别于传统的平面采样和全树采样,提供了树级别的筛选与修复策略,显著提升样本利用率和模型性能。

方法详解

  • �� 树采样:从模型策略中采样N叉树,深度D,生成多分支推理路径。
  • �� 树信息评分:定义F(T) = ˆp(1−ˆp) · (1−ρ²π,r),结合叶子成功率与策略-奖励相关性,评估树的潜在信息价值。
  • �� 树分类:根据F(T)值,将树划分为死正确、死错误、陈旧和有信息四类,采用不同策略处理。
  • �� 批判修复:对死错树定位最浅错误节点,生成自然语言批评, graft修正分支,重新评分和传播奖励。
  • �� 梯度加权:利用F(T)归一化后作为梯度贡献的权重,调整训练焦点。
  • �� 优化目标:在TREERPO基础上引入树信息加权,结合剪切的代理优势函数,进行策略优化。

实验设计

采用MATH数据集的训练集(7.5k题)进行训练,测试在MATH-500、OlympiadBench、MinervaMath和AIME24四个基准上。模型使用Qwen2.5-Math-1.5B,参数设置包括温度0.6、分支因子8、深度3、最大步长384。对比基线为GRPO和TreeRPO,评估指标为Pass@1(平均8次采样正确率)。通过调节阈值τlow、τhigh,验证树信息评分的有效性。还进行了梯度相关性分析和死错树修复效果验证,确保方法的有效性。

结果分析

实验结果显示,CATPO在四个基准上的宏平均准确率达到37.5%,优于TreeRPO(35.6%)和GRPO(32.7%),提升幅度分别为1.9%和4.8%。树信息评分F(T)与梯度范数显著相关(r=0.54),验证了其作为梯度贡献代理的有效性。批判修复显著改善死错树的训练信号,88.1%的死错树F值获得提升,验证了修复机制的实用性。这些结果表明,信息筛选与修复机制有效提升了树结构RL的训练效率和模型性能。

应用场景

该方法适用于需要高效推理与学习的自动问答、数学推理、逻辑推断等场景。特别适合大规模模型在复杂任务中的训练,能显著提升样本利用率和推理准确性。未来可结合多模态信息,扩展到多任务、多模态推理系统,推动智能系统的自主学习能力。

局限与展望

方法依赖模型自身的批判能力,面对复杂或边界问题时,修复效果有限。极端困难任务可能无法通过修复改善性能。计算成本在树深度和分支数较大时增加,限制了大规模应用。此外,修复机制对模型的依赖较强,未来需结合外部知识或多模态信息增强修复效果。

通俗解读 非专业人士也能看懂

想象你在做一道复杂的数学题,就像在一个迷宫中寻找出口。每次你尝试不同的路径(树的分支),有些路径明显走错了(死错树),浪费了时间。这个方法就像有个聪明的助手,能告诉你哪些路径更有希望(树信息评分),还会帮你修正错误的路(批判修复),让你更快找到正确的出口。通过不断评估和修正,整个过程变得更高效,最后你能更快解决难题。这就像在迷宫里,有个聪明的指南针,不仅指示方向,还能帮你修正错误,节省大量时间和精力。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏。每次你拼一部分,有些拼块拼错了(死错树),浪费了很多时间。这个方法就像有个聪明的朋友,能告诉你哪些拼图更重要(树信息评分),还会帮你修正错误的拼图(批判修复),让你更快完成拼图。它会评估每一块拼图的价值,优先处理那些能带来最大帮助的部分。如果发现某个拼图完全错了,它会帮你找到错误的地方,给出建议,然后帮你修正。这样,你就能用更少的时间,拼出完整的图,比以前快多了!

原文摘要

Reinforcement learning with verifiable rewards (RLVR) has become a dominant paradigm for improving the reasoning capabilities of large language models (LLMs). Recent tree-based methods such as TreeRPO extend flat trajectory sampling with tree-structured rollouts to obtain dense, step-level reward signals without a separate process reward model. However, not all trees are equally informative: trees where all leaves succeed, all leaves fail, or the policy already predicts the reward distribution contribute little to gradient updates, wasting compute. We introduce CATPO (Critique-Augmented Tree Policy Optimization), which diagnoses and addresses this waste at the tree level. CATPO first scores each tree via a tree informativeness score, F(T), combining leaf-outcome diversity with policy-reward decorrelation at zero extra compute. For dead-wrong trees where all branches fail, CATPO applies critique-guided healing: it locates the shallowest failure point, generates a natural-language critique, and grafts refined continuations to recover training signal. Finally, an informativeness-weighted loss scales each tree's gradient contribution by its normalized score, concentrating parameter updates on the most informative trees while preserving overall gradient magnitude. Experiments on Qwen2.5-Math-1.5B trained with the MATH dataset show that CATPO achieves 37.5% macro accuracy across four benchmarks (AIME24, MATH-500, OlympiadBench, and MinervaMath), improving over TreeRPO by 1.9% and GRPO by 4.8%.

cs.CL cs.LG