Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains

TL;DR

FARE使用迭代拒绝采样SFT方法,在推理领域超越70B+评估器。

cs.CL 🔴 高级 2025-10-21 36 次浏览
Austin Xu Xuan-Phi Nguyen Yilun Zhou Chien-Sheng Wu Caiming Xiong Shafiq Joty
自动评估 多任务学习 推理 大规模数据 强化学习

核心发现

方法论

本文提出了一种新的迭代拒绝采样监督微调(SFT)方法,用于训练推理评估器FARE。该方法通过2.5M样本的多任务数据集进行训练,涵盖五种评估任务。FARE家族包括8B和20B参数的模型,能够在多领域进行推理评估。

关键结果

  • FARE-20B在MATH任务中达到接近oracle的表现,作为推理时间重排序器表现优异。
  • 在RL训练中,FARE将下游模型性能提高了14.1%,超越字符串匹配验证器。
  • FARE-Code在测试用例质量评估中比gpt-oss-20B高65%。

研究意义

该研究通过大规模数据驱动的方法,解决了多任务、多领域评估的需求,为开源评估器设立了新标准。FARE不仅在静态基准测试中表现出色,还在实际应用中展示了其灵活性和有效性。

技术贡献

FARE通过简单的SFT方法在大规模数据上进行训练,避免了RL训练的复杂性和不稳定性。其在推理任务上的表现超越了许多更大规模的模型,展示了其在推理评估中的潜力。

新颖性

FARE首次在推理评估中使用大规模迭代拒绝采样SFT方法,显著提高了评估器的性能和适应性。

局限性

  • FARE在特定领域的表现可能受限于训练数据的多样性。
  • 对实时应用的计算需求较高。

未来方向

未来的研究可以探索FARE在更多领域的应用,并优化其计算效率以适应实时应用的需求。

AI 总览摘要

近年来,随着大型语言模型(LLM)的快速发展,自动评估器在模型开发周期中扮演着越来越重要的角色。然而,现有的评估器在多任务、多领域的评估中往往表现不佳,尤其是在推理任务中。为了解决这一问题,本文提出了一种新的迭代拒绝采样监督微调(SFT)方法,用于训练推理评估器FARE。

FARE通过2.5M样本的多任务数据集进行训练,涵盖五种评估任务,展示了其在多领域推理评估中的卓越性能。FARE家族包括8B和20B参数的模型,能够在推理任务中超越许多更大规模的模型,设立了开源评估器的新标准。

实验结果表明,FARE-20B在MATH任务中达到接近oracle的表现,并在RL训练中将下游模型性能提高了14.1%。此外,FARE-Code在测试用例质量评估中比gpt-oss-20B高65%。这些结果展示了FARE在推理评估中的潜力和灵活性。未来的研究可以进一步探索FARE在更多领域的应用,并优化其计算效率以适应实时应用的需求。

深度分析

研究背景

自动评估器在大型语言模型的开发中扮演着重要角色。近年来,随着模型规模的扩大和任务复杂性的增加,对多任务、多领域评估的需求也在不断增长。然而,现有的评估器在处理复杂推理任务时往往表现不佳,尤其是在需要大规模数据驱动的方法时。

核心问题

现有评估器在多任务、多领域的推理评估中表现不佳,尤其是在需要大规模数据驱动的方法时。如何在不增加计算复杂性的情况下提高评估器的性能,是一个亟待解决的问题。

核心创新

FARE通过大规模迭代拒绝采样SFT方法进行训练,显著提高了评估器的性能。该方法通过2.5M样本的多任务数据集进行训练,涵盖五种评估任务,展示了其在多领域推理评估中的卓越性能。

方法详解

  • �� 数据收集:收集2.5M样本的多任务数据集,涵盖五种评估任务。
  • �� 模型训练:使用迭代拒绝采样SFT方法进行训练,避免了RL训练的复杂性。
  • �� 性能评估:在多项基准测试和实际应用中评估FARE的性能。

实验设计

实验设计包括多个基准测试和实际应用场景。基准测试包括MATH任务和RL训练中的验证任务,实际应用包括推理时间重排序和测试用例质量评估。

结果分析

实验结果表明,FARE-20B在MATH任务中达到接近oracle的表现,并在RL训练中将下游模型性能提高了14.1%。此外,FARE-Code在测试用例质量评估中比gpt-oss-20B高65%。

应用场景

FARE可以应用于多任务、多领域的推理评估,尤其是在需要大规模数据驱动的方法时。其在推理任务中的卓越性能使其成为开源评估器的新标准。

局限与展望

FARE在特定领域的表现可能受限于训练数据的多样性。此外,其对实时应用的计算需求较高,需要进一步优化以适应更多应用场景。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。FARE就像一位经验丰富的厨师,他可以在不同的菜肴中快速判断出食材的质量和搭配是否合适。无论是简单的沙拉还是复杂的多道菜晚餐,FARE都能通过大量的经验和数据,快速做出正确的判断。这就像是他在每次做菜时都能从过去的经验中学习,并不断改进自己的厨艺。

简单解释 像给14岁少年讲一样

嘿,小伙伴!想象一下你在玩一个超级复杂的游戏,里面有很多关卡和任务。FARE就像是你的游戏助手,帮你判断哪个任务更重要,哪个关卡需要特别注意。它就像是一个超级聪明的朋友,总是能给你最好的建议,让你在游戏中无往不利!是不是很酷?

术语表

FARE (基础自动推理评估器)

一种用于多任务推理评估的模型家族,使用迭代拒绝采样SFT方法进行训练。

在本文中,FARE用于评估多领域的推理任务。

SFT (监督微调)

一种通过监督学习进行模型微调的方法,通常用于提高模型的特定任务性能。

本文使用SFT方法训练FARE评估器。

RL (强化学习)

一种机器学习方法,通过奖励机制来训练模型进行决策。

本文讨论了RL在评估器训练中的应用。

MATH任务

一种用于评估数学推理能力的基准测试。

FARE在MATH任务中表现优异,接近oracle。

推理时间重排序

一种在推理过程中对模型输出进行重新排序的方法,以提高最终结果的准确性。

FARE在推理时间重排序中表现出色。

开放问题 这项研究留下的未解疑问

  • 1 如何在不增加计算复杂性的情况下进一步提高FARE的性能?
  • 2 FARE在特定领域的表现是否会受到训练数据多样性的限制?

应用场景

近期应用

多任务评估

FARE可用于多任务、多领域的推理评估,尤其是在需要大规模数据驱动的方法时。

远期愿景

实时应用

通过优化计算效率,FARE有望在更多实时应用中发挥作用,如自动驾驶和智能助手。

原文摘要

Finetuning specialized generative evaluators has emerged as a popular paradigm to meet the increasing demand for scalable evaluation during both training and test-time. However, recent work has largely focused on applying new methodology, such as reinforcement learning (RL), to training evaluators, shying away from large-scale, data-driven development. In this work, we focus on data scaling, curating a set of 2.5M samples spanning five unique evaluation tasks (pairwise, step-level, reference-free and reference-based verification, and single rating) and multiple domains focused on reasoning evaluation. With our data, we train Foundational Automatic Reasoning Evaluators (FARE), a family of 8B and 20B (with 3.6B active) parameter evaluators, with a simple iterative rejection-sampling supervised finetuning (SFT) approach. FARE-8B challenges larger specialized RL-trained evaluators and FARE-20B sets the new standard for open-source evaluators, surpassing specialized 70B+ evaluators. Beyond static benchmarks, we evaluate FARE in real-world tasks: As inference-time rerankers, FARE-20B achieves near-oracle performance on MATH. As verifiers in RL training, FARE improves the downstream RL-trained model performance by up to 14.1% vs. string-matching verifiers. When initialized from FARE, a continually-finetuned FARE-Code outperforms gpt-oss-20B by 65% on evaluating test-case quality.

cs.CL cs.AI cs.LG