Reward-Free Evolving Agents via Pairwise Validator

TL;DR

提出pairwise validator替代单一奖励,提升自我进化代理性能,匹配或超越全奖励基线。

cs.AI 🔴 高级 2026-07-16 35 次浏览
Minghao Liu Yu Wang Jiayun Wang Wei Wei
强化学习 自我进化 大规模语言模型 对比判断 奖励机制

核心发现

方法论

本文提出在自我进化循环中用冻结的LLM作为pairwise validator,替代传统的标量奖励。该验证器对父子候选项进行二元判定,判断哪个更优,避免了绝对评分的尺度校准难题。两种变体:Adaptive Focus保持原有验证集父节点选择,Soft Elo则用验证器判定结果驱动父节点选择,完全无奖励。将验证器集成到GEPA、ADRS、ShinkaEvolve等系统中,实验证明在多任务、多数据源(prompt和代码)上,性能与全奖励基线持平或超越,且跨模型验证器交换仍有效。

关键结果

  • 在十个任务(检索、指令跟随、数学、代码演化)中,方法在大部分设置下达到了或超过了全奖励基线,尤其在验证集有限(12-30例)时表现出更好的泛化能力,验证-测试差距减小。具体如Qwen3-8B模型在HotpotQA任务中,Adaptive Focus提升准确率至78.5%,Soft Elo在IFBench达到86.1%。
  • 在数学任务(AIME、LiveBench-Math)中,方法提升了部分模型的正确率(如Qwen3-8B在AIME从40%提升至60%),验证效果稳定,表明pairwise判定能有效替代奖励信号。
  • 消除奖励信号的影响,方法在不同模型和任务中表现一致,验证器的二元判定在减少标注成本、提升泛化方面具有潜力。

研究意义

该研究突破了奖励设计的瓶颈,降低了标注成本,增强了自我进化系统的适应性和鲁棒性。通过引入对比判定,模型可以在无需大量标签的情况下持续优化,推动自主学习和自动化AI系统的发展。这对于大规模应用场景中的自主优化、强化学习和模型演化具有深远影响,有望引领无标注或少标注环境下的AI创新。

技术贡献

技术上,提出基于冻结LLM的pairwise判定机制,作为无标注奖励的替代方案,集成到多种自我进化框架中。创新点包括:1)无需训练的二元判定模型,2)两种变体(Adaptive Focus和Soft Elo)实现不同程度的奖励剥离,3)跨模型、跨任务验证其鲁棒性。该方法提供了新颖的无奖励优化路径,拓展了自我进化和强化学习的理论边界。

新颖性

首次在自我进化代理中引入基于对比的pairwise validator,作为替代绝对奖励的机制,显著降低了标注成本。相较于传统的奖励模型或偏好学习,此方法无需训练额外模型,直接利用冻结LLM进行二元判定,简洁高效,具有较强的实用价值和推广潜力。

局限性

  • 验证器的判定质量依赖于示例的代表性和模型的判别能力,在复杂任务或模糊评价标准下可能表现不足。
  • 当前方法在极少验证样本(如12-30例)环境中效果较佳,但在大规模数据或高复杂度任务中仍需验证其扩展性。
  • 完全无奖励的Soft Elo在某些任务中可能导致收敛速度变慢或性能不稳定,未来需优化判定策略和融合机制。

未来方向

未来可探索多模态、多任务的验证器设计,结合自适应样本采样策略,提升判定的鲁棒性和泛化能力。同时,结合强化学习和对比学习理论,优化父子节点的选择与更新机制,推动无奖励自我进化的理论发展。此外,研究如何在更复杂的环境中实现多目标、多指标的对比判定,拓展应用场景。

AI 总览摘要

随着人工智能技术的不断发展,自我进化系统成为提升模型能力的重要途径。传统方法依赖于明确的奖励信号,然而高质量奖励的设计成本极高,尤其在复杂任务中更是如此。本文提出一种创新的方案,用冻结的语言模型作为pairwise validator,取代传统的标量奖励,进行父子候选的二元判定。这一机制极大简化了奖励设计难题,降低了标注成本,同时保持甚至提升了系统性能。

具体而言,作者在多个自我进化框架(如GEPA、ADRS、ShinkaEvolve)中集成了该验证器,设计了两种变体:Adaptive Focus,保持原有验证集父节点选择,仅替换判定门;Soft Elo,利用验证器判定结果驱动父节点选择,完全剥离奖励信号。实验证明,在多任务、多数据源(prompt和代码)环境下,该方法在大部分设置中达到了或超越了全奖励基线,验证了其有效性和鲁棒性。

此外,研究发现,基于对比的判定机制在减少标注成本、改善泛化方面具有显著优势。尤其在验证样本有限的情况下,验证-测试差距明显缩小,显示出强大的泛化能力。该技术的核心创新在于:无需训练额外模型,直接利用冻结模型进行二元判定,简洁高效,为未来无标注或少标注的自主学习提供了新路径。

尽管如此,方法在极端复杂任务或模糊评价标准下仍存在一定局限,未来需结合多模态、多目标判定策略,提升判定的鲁棒性和适应性。总体而言,该研究为无奖励自我进化提供了理论基础和实践方案,有望推动自主学习和模型演化的广泛应用。

深度解读

原文摘要

A self-evolving agentic loop repeatedly proposes a tweaked version of an agent (its prompt template or program) and accepts or rejects the change based on a per-iteration quality signal. Designing that signal is often the costly part of the project: a reliable scalar reward requires domain expertise and labeled examples that are themselves as expensive to assemble as the agent's underlying task. We propose replacing the scalar at the accept/reject gate with a pairwise validator: a frozen LLM that, given the parent and child candidate, returns a binary verdict on which is better. Pairwise judgment is generally easier and more stable than absolute scoring, due to its contrastive nature, which mitigates the need for strict scale calibration. The validator also requires no training of its own. We integrate the validator into three published self-evolving engines (GEPA, ADRS, ShinkaEvolve) and report two flavors: Adaptive Focus, which retains the engine's existing val-set parent selection, and Soft Elo, which lets the validator's verdicts drive parent selection so that val-set rewards drop as well. Across multiple agents and two artifact substrates (prompt and code), our method matches or exceeds the full-reward baseline on the majority of settings we evaluate, and the pattern survives a cross-family validator swap. The pairwise gate is thus a drop-in replacement for per-step reward design at competitive task accuracy without the labeling cost.

cs.AI