Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short

TL;DR

提出Reasoning Arena框架,通过动态路由和轨迹锦标赛提升推理模型性能,平均提升7.6%。

cs.LG 🔴 高级 2026-06-08 41 次浏览
Han Zhou Adam X. Yang Laurence Aitchison Anna Korhonen Albert Q. Jiang
强化学习 推理能力 奖励信号 轨迹锦标赛 大语言模型

核心发现

方法论

提出Reasoning Arena框架,结合可验证奖励和基于LLM的裁判系统,通过动态路由将非多样性奖励组分配至轨迹锦标赛。采用Bradley-Terry模型对不完整比较图进行拟合,减少计算复杂度。

关键结果

  • 在数学竞赛和代码生成任务中,Reasoning Arena平均提升7.6%,如AIME 2026任务中提升12.9%。
  • 训练效率提升27%-41%,生成计算减少近50%。
  • 通过非多样性组提取梯度信号,显著改善推理性能。

研究意义

该研究解决了RLVR中非多样性奖励组导致的梯度信号缺失问题,提出的框架不仅提升模型性能,还显著降低训练成本,对学术界和工业界具有重要意义。

技术贡献

首次将轨迹锦标赛与RLVR结合,通过动态路由和Bradley-Terry模型实现高效奖励估计,避免了传统方法的二次复杂度问题。

新颖性

首次在推理任务中将轨迹锦标赛作为非多样性组的奖励机制,并提出动态路由策略以优化奖励信号提取。

局限性

  • 框架依赖LLM裁判的质量,可能受模型偏差影响。
  • 动态路由策略需要额外的计算资源。
  • 在某些任务中可能无法完全替代传统奖励机制。

未来方向

未来可探索更高效的裁判模型和动态路由策略,同时扩展至更多推理任务领域。

AI 总览摘要

强化学习中的可验证奖励(RLVR)是提升大语言模型推理能力的主要方法,但其在非多样性奖励组中无法提供有效梯度信号。Reasoning Arena框架通过动态路由将这些组分配至轨迹锦标赛,利用LLM裁判比较推理轨迹,生成细粒度奖励信号。

实验表明,该框架在数学竞赛和代码生成任务中平均提升7.6%,并显著加速训练过程,减少近50%的生成计算。通过Bradley-Terry模型对不完整比较图进行拟合,框架避免了传统方法的二次复杂度问题。

该研究不仅解决了RLVR中的核心瓶颈,还为推理任务提供了新的奖励机制,对学术界和工业界的推理模型优化具有重要意义。未来可探索更高效的裁判模型和扩展应用场景。

深度分析

研究背景

近年来,大语言模型在推理任务中表现出色,强化学习中的可验证奖励(RLVR)成为提升模型性能的重要方法。然而,RLVR在非多样性奖励组中无法提供有效梯度信号,这导致计算资源浪费并限制了模型的进一步优化。

核心问题

RLVR依赖组内奖励差异提供梯度信号,但当所有轨迹奖励相同时,梯度信号完全丧失。这种非多样性组问题在训练初期和后期尤为严重,导致计算资源浪费和模型性能瓶颈。

核心创新

Reasoning Arena通过动态路由检测非多样性组,并将其分配至轨迹锦标赛。锦标赛通过LLM裁判比较轨迹推理质量,生成细粒度奖励信号。采用Bradley-Terry模型对不完整比较图进行拟合,显著降低计算复杂度。

方法详解

  • �� 动态路由:根据组内奖励差异决定奖励机制。
  • �� 轨迹锦标赛:比较组内轨迹推理质量,生成细粒度奖励。
  • �� Bradley-Terry模型:对不完整比较图进行拟合,估算轨迹强度。
  • �� 实验验证:在数学竞赛和代码生成任务中评估框架性能。

实验设计

实验使用Ministral-3-8B-Instruct模型,评估任务包括AIME数学竞赛和LiveCodeBench代码生成。对比基线包括RLVR、RLAIF和ArenaRL,采用平均通过率和训练效率作为主要指标。

结果分析

Reasoning Arena在数学竞赛任务中平均提升7.6%,如AIME 2026任务中提升12.9%。训练效率提升27%-41%,生成计算减少近50%。框架有效提取非多样性组的梯度信号,显著改善推理性能。

应用场景

该框架可用于数学竞赛、代码生成等推理任务,特别适合需要细粒度奖励信号的场景,如教育和自动化推理系统。

局限与展望

框架依赖LLM裁判质量,可能受模型偏差影响。此外,动态路由策略增加了计算复杂度,某些任务中可能无法完全替代传统奖励机制。

通俗解读 非专业人士也能看懂

想象一个厨师比赛,裁判只看最终菜品的好坏,但无法区分烹饪过程中的细节。Reasoning Arena就像一个新裁判,能比较厨师的每一步操作,比如切菜、调味等。即使最终菜品一样,裁判也能根据过程细节打分,帮助厨师改进技术。

简单解释 像给14岁少年讲一样

想象你和朋友玩游戏,大家都得分一样,但你觉得自己操作更酷。Reasoning Arena就像一个新裁判,能看操作过程,给更酷的操作加分!这样大家不仅比结果,还能比过程,是不是更公平?

术语表

RLVR (强化学习中的可验证奖励)

一种通过规则验证奖励信号的强化学习方法,用于训练推理模型。

用于生成组内奖励差异以优化模型。

Bradley-Terry模型

一种基于比较数据估算对象强度的统计模型。

用于轨迹锦标赛中奖励信号的拟合。

轨迹锦标赛

比较组内推理轨迹质量以生成奖励信号的方法。

用于非多样性奖励组的奖励生成。

动态路由

根据组内奖励差异选择奖励机制的策略。

用于区分多样性组和非多样性组。

非多样性奖励组

组内所有轨迹奖励相同的情况。

RLVR中导致梯度信号丧失的主要问题。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化LLM裁判的质量以减少偏差?
  • 2 是否可以扩展至更多非推理任务领域?

应用场景

近期应用

数学竞赛优化

帮助模型更好地解决复杂数学问题,提升竞赛成绩。

代码生成

优化代码生成模型的推理能力,减少错误。

远期愿景

自动化教育系统

开发基于推理优化的教育工具,提升学生学习效果。

原文摘要

Reinforcement learning with verifiable rewards (RLVR) has become a leading paradigm for improving the reasoning ability of large language models through outcome-based supervision. However, verifiable rewards frequently become uninformative at the group level: when all sampled traces of a given prompt receive identical rewards, group-relative advantage estimation provides no gradient signal, even though the traces may differ substantially in reasoning quality. We propose Reasoning Arena, an adaptive training framework that routes such non-diverse reward groups to a judge system instead of discarding them. Beyond examining the final answer, Reasoning Arena constructs trace tournaments, where reasoning traces are compared head-to-head to expose finer-grained preferences within the group, converting reasoning quality into rich relative reward signals. To make reward estimation efficient, rather than exhaustively comparing every pair, each new trace is evaluated against a small, dynamically updated pool of previously generated traces as anchors to efficiently establish a relative ranking. We then fit a Bradley-Terry model on the incomplete comparison graph, enabling scalable RL integration without quadratic pairwise comparisons. Empirical results demonstrate that Reasoning Arena consistently outperforms the RLVR baseline by 7.6% on average in competition mathematics and coding benchmarks. By converting otherwise wasted zero-advantage samples into useful gradient updates, our method accelerates training by 27% to 41%, saving nearly 50% of generation compute, and substantially improves overall reasoning performance.

cs.LG cs.AI cs.CL