核心发现
方法论
本文提出了一种新的迭代拒绝采样监督微调(SFT)方法,用于训练推理评估器FARE。该方法通过2.5M样本的多任务数据集进行训练,涵盖五种评估任务。FARE家族包括8B和20B参数的模型,能够在多领域进行推理评估。
关键结果
- FARE-20B在MATH任务中达到接近oracle的表现,作为推理时间重排序器表现优异。
- 在RL训练中,FARE将下游模型性能提高了14.1%,超越字符串匹配验证器。
- FARE-Code在测试用例质量评估中比gpt-oss-20B高65%。
研究意义
该研究通过大规模数据驱动的方法,解决了多任务、多领域评估的需求,为开源评估器设立了新标准。FARE不仅在静态基准测试中表现出色,还在实际应用中展示了其灵活性和有效性。
技术贡献
FARE通过简单的SFT方法在大规模数据上进行训练,避免了RL训练的复杂性和不稳定性。其在推理任务上的表现超越了许多更大规模的模型,展示了其在推理评估中的潜力。
新颖性
FARE首次在推理评估中使用大规模迭代拒绝采样SFT方法,显著提高了评估器的性能和适应性。
局限性
- FARE在特定领域的表现可能受限于训练数据的多样性。
- 对实时应用的计算需求较高。
未来方向
未来的研究可以探索FARE在更多领域的应用,并优化其计算效率以适应实时应用的需求。
AI 总览摘要
近年来,随着大型语言模型(LLM)的快速发展,自动评估器在模型开发周期中扮演着越来越重要的角色。然而,现有的评估器在多任务、多领域的评估中往往表现不佳,尤其是在推理任务中。为了解决这一问题,本文提出了一种新的迭代拒绝采样监督微调(SFT)方法,用于训练推理评估器FARE。
FARE通过2.5M样本的多任务数据集进行训练,涵盖五种评估任务,展示了其在多领域推理评估中的卓越性能。FARE家族包括8B和20B参数的模型,能够在推理任务中超越许多更大规模的模型,设立了开源评估器的新标准。
实验结果表明,FARE-20B在MATH任务中达到接近oracle的表现,并在RL训练中将下游模型性能提高了14.1%。此外,FARE-Code在测试用例质量评估中比gpt-oss-20B高65%。这些结果展示了FARE在推理评估中的潜力和灵活性。未来的研究可以进一步探索FARE在更多领域的应用,并优化其计算效率以适应实时应用的需求。
深度分析
研究背景
自动评估器在大型语言模型的开发中扮演着重要角色。近年来,随着模型规模的扩大和任务复杂性的增加,对多任务、多领域评估的需求也在不断增长。然而,现有的评估器在处理复杂推理任务时往往表现不佳,尤其是在需要大规模数据驱动的方法时。
核心问题
现有评估器在多任务、多领域的推理评估中表现不佳,尤其是在需要大规模数据驱动的方法时。如何在不增加计算复杂性的情况下提高评估器的性能,是一个亟待解决的问题。
核心创新
FARE通过大规模迭代拒绝采样SFT方法进行训练,显著提高了评估器的性能。该方法通过2.5M样本的多任务数据集进行训练,涵盖五种评估任务,展示了其在多领域推理评估中的卓越性能。
方法详解
- �� 数据收集:收集2.5M样本的多任务数据集,涵盖五种评估任务。
- �� 模型训练:使用迭代拒绝采样SFT方法进行训练,避免了RL训练的复杂性。
- �� 性能评估:在多项基准测试和实际应用中评估FARE的性能。
实验设计
实验设计包括多个基准测试和实际应用场景。基准测试包括MATH任务和RL训练中的验证任务,实际应用包括推理时间重排序和测试用例质量评估。
结果分析
实验结果表明,FARE-20B在MATH任务中达到接近oracle的表现,并在RL训练中将下游模型性能提高了14.1%。此外,FARE-Code在测试用例质量评估中比gpt-oss-20B高65%。
应用场景
FARE可以应用于多任务、多领域的推理评估,尤其是在需要大规模数据驱动的方法时。其在推理任务中的卓越性能使其成为开源评估器的新标准。
局限与展望
FARE在特定领域的表现可能受限于训练数据的多样性。此外,其对实时应用的计算需求较高,需要进一步优化以适应更多应用场景。
通俗解读 非专业人士也能看懂
想象你在厨房里做饭。FARE就像一位经验丰富的厨师,他可以在不同的菜肴中快速判断出食材的质量和搭配是否合适。无论是简单的沙拉还是复杂的多道菜晚餐,FARE都能通过大量的经验和数据,快速做出正确的判断。这就像是他在每次做菜时都能从过去的经验中学习,并不断改进自己的厨艺。
简单解释 像给14岁少年讲一样
嘿,小伙伴!想象一下你在玩一个超级复杂的游戏,里面有很多关卡和任务。FARE就像是你的游戏助手,帮你判断哪个任务更重要,哪个关卡需要特别注意。它就像是一个超级聪明的朋友,总是能给你最好的建议,让你在游戏中无往不利!是不是很酷?
术语表
FARE (基础自动推理评估器)
一种用于多任务推理评估的模型家族,使用迭代拒绝采样SFT方法进行训练。
在本文中,FARE用于评估多领域的推理任务。
SFT (监督微调)
一种通过监督学习进行模型微调的方法,通常用于提高模型的特定任务性能。
本文使用SFT方法训练FARE评估器。
RL (强化学习)
一种机器学习方法,通过奖励机制来训练模型进行决策。
本文讨论了RL在评估器训练中的应用。
MATH任务
一种用于评估数学推理能力的基准测试。
FARE在MATH任务中表现优异,接近oracle。
推理时间重排序
一种在推理过程中对模型输出进行重新排序的方法,以提高最终结果的准确性。
FARE在推理时间重排序中表现出色。
开放问题 这项研究留下的未解疑问
- 1 如何在不增加计算复杂性的情况下进一步提高FARE的性能?
- 2 FARE在特定领域的表现是否会受到训练数据多样性的限制?
应用场景
近期应用
多任务评估
FARE可用于多任务、多领域的推理评估,尤其是在需要大规模数据驱动的方法时。
远期愿景
实时应用
通过优化计算效率,FARE有望在更多实时应用中发挥作用,如自动驾驶和智能助手。
原文摘要
Finetuning specialized generative evaluators has emerged as a popular paradigm to meet the increasing demand for scalable evaluation during both training and test-time. However, recent work has largely focused on applying new methodology, such as reinforcement learning (RL), to training evaluators, shying away from large-scale, data-driven development. In this work, we focus on data scaling, curating a set of 2.5M samples spanning five unique evaluation tasks (pairwise, step-level, reference-free and reference-based verification, and single rating) and multiple domains focused on reasoning evaluation. With our data, we train Foundational Automatic Reasoning Evaluators (FARE), a family of 8B and 20B (with 3.6B active) parameter evaluators, with a simple iterative rejection-sampling supervised finetuning (SFT) approach. FARE-8B challenges larger specialized RL-trained evaluators and FARE-20B sets the new standard for open-source evaluators, surpassing specialized 70B+ evaluators. Beyond static benchmarks, we evaluate FARE in real-world tasks: As inference-time rerankers, FARE-20B achieves near-oracle performance on MATH. As verifiers in RL training, FARE improves the downstream RL-trained model performance by up to 14.1% vs. string-matching verifiers. When initialized from FARE, a continually-finetuned FARE-Code outperforms gpt-oss-20B by 65% on evaluating test-case quality.