Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation

TL;DR

本研究提出预算依赖的LLM评估框架,分析7个预算水平(64-4096 tokens)对4个模型在3个推理基准上的影响,发现模型排名随预算变化而逆转,强调预算条件下的评估必要性。

cs.AI 🔴 高级 2026-08-12 84 次浏览
Rodrigo Guedes de Souza Alison R. Panisson
大规模语言模型 模型评估 推理能力 预算依赖 模型融合

核心发现

方法论

本文系统性地研究了在不同生成预算(64至4096 tokens)下,四个开源和商业LLMs在三个推理任务(GSM8K、MATH-500、GPQA)上的表现。采用逐步增加生成长度的方式,评估每个模型在每个任务上的准确率,利用McNemar检验统计模型排名的逆转现象。通过构建每个样本的oracle集成,分析模型互补性,并训练预算感知的路由器(基于XGBoost)进行模型选择。研究中还控制了截断率,确保非截断样本的可靠性。

关键结果

  • 在不同预算水平,模型表现出现非单调变化(3%-19%的样本表现为性能随预算增加反而下降),且此现象具有模型特异性(不同模型的重叠率低至6%-14%)。
  • 模型排名在所有基准上随预算变化而逆转。例如,在GSM8K中,70B的LLaMA-3.3在256 tokens时表现最佳(62.4%准确率),而在4096 tokens时,20B的GPT-OSS表现优越(94.8%),差异极其显著(p<0.001)。
  • oracle分析显示,模型互补性在预算受限时最强(最高达+27.8个百分点),在较宽松预算下逐渐减弱,表明不同模型在不同预算下解决不同样本的能力差异显著。
  • 引入预算感知的路由器(基于XGBoost)能在跨域任务中捕获14.1%的oracle性能差距,显著优于传统基于文本特征的模型选择方法。该路由器在中等预算(如1024 tokens)表现最佳,但在极端预算(64或4096 tokens)效果有限。

研究意义

本研究揭示了模型评估中一个被忽视的重要维度——生成预算。传统评估假设模型排名稳定,但实际中,模型在不同预算条件下表现差异巨大,甚至出现逆转。这意味着,单一的性能指标不能全面反映模型的能力,特别是在资源受限的实际应用场景中。研究强调了引入预算条件的多维评估体系,有助于更合理地选择和部署模型,推动模型融合和动态调度技术的发展,具有深远的理论和实践意义。

技术贡献

本文首次系统性地分析了不同生成预算对大模型性能的影响,提出了预算依赖的模型排名逆转现象。引入了行为分类(始终正确、单调递增、非单调、始终错误)和模型互补性指标,结合oracle集成,量化模型在不同预算下的互补潜力。创新性地设计了预算感知的模型路由器(基于XGBoost),利用预算特征显著提升跨域模型选择效果。研究还通过控制截断率,验证了非单调行为的真实性,为未来模型调度和评估提供了新思路。

新颖性

本研究首次系统性揭示了大模型在不同生成预算下的性能逆转现象,强调了预算条件对模型排名的决定性作用。与以往只关注模型架构或训练策略不同,本文从推理资源的角度出发,提出了预算依赖的评估框架和模型路由机制,填补了模型性能随推理预算变化的研究空白,推动了模型评估的多维度发展。

局限性

  • 尽管控制了截断率,但在极端预算(如64 tokens)下,模型仍大量截断,可能影响性能评估的准确性,特别是在模型间的比较中存在偏差。
  • 实验只在三个推理基准上进行,尚未覆盖更复杂或多模态任务,未来需要验证该现象的普遍性。
  • 预算感知路由器虽提升了模型选择效果,但在跨域迁移时表现有限,说明模型-预算关系具有较强的领域依赖性,需进一步研究泛化机制。

未来方向

未来可探索多模态、多任务场景下的预算依赖行为,结合模型内部信号(如logit分布、隐藏状态)优化模型调度策略。此外,研究如何在有限资源环境(如移动端、边缘设备)中动态调整预算,以实现性能与效率的最佳平衡,也是重要方向。还应结合强化学习等技术,学习更鲁棒的预算调度策略,推动模型在实际应用中的自适应能力。

AI 总览摘要

在人工智能快速发展的今天,大规模语言模型(LLMs)已成为推动自然语言处理技术革新的核心力量。传统的模型评估体系通常假设模型在不同推理条件下的性能表现具有稳定性,然而这一假设在实际应用中逐渐被挑战。本文由Guedes de Souza和Panisson提出,系统性地研究了在不同生成预算(从64到4096 tokens)条件下,四个代表性模型在三项推理任务中的表现变化。研究发现,模型排名在不同预算水平上会发生逆转,表现出非单调的性能变化,尤其在资源受限或超长推理场景中更为明显。这一现象揭示了模型能力的复杂性,也强调了在模型部署和评估时考虑预算条件的重要性。

通过构建行为分类体系,作者发现约3%-19%的样本在预算增加时性能反而下降,表现出“过度思考”的行为,且此行为具有模型特异性,难以通过简单的样本筛除解决。更令人震惊的是,模型排名在所有基准上都存在显著逆转。例如,在GSM8K任务中,70B的LLaMA-3.3在256 tokens时表现最佳(准确率62.4%),而在4096 tokens时,20B的GPT-OSS表现优越(准确率94.8%),差异极其显著(p<0.001)。

为了最大化模型的潜在能力,作者引入了oracle集成分析,发现模型在有限预算下的互补性最强,最高可达+27.8个百分点,表明不同模型在不同样本上的优势互补极大。基于此,研究设计了预算感知的模型路由器(XGBoost),利用预算特征显著提升跨域模型选择效果,捕获了14.1%的oracle性能差距。这一机制在中等预算(如1024 tokens)表现尤为优异,但在极端预算下效果有限,反映出模型-预算关系的领域依赖性。

研究的核心贡献在于揭示了模型性能的预算依赖性,挑战了传统单一性能指标的合理性。提出的行为分类、模型互补性分析和预算感知路由器,为未来模型评估、调度和融合提供了理论基础和技术路径。这不仅丰富了大模型的理解,也为实际部署中资源有限的场景提供了科学依据。未来工作将聚焦于多模态、多任务环境中的预算行为、模型内部信号的利用以及动态预算调度策略的优化,推动大模型在复杂、多变环境中的智能适应能力。

深度分析

研究背景

近年来,随着Transformer架构的不断优化和大规模预训练技术的发展,LLMs在自然语言理解和生成任务中取得了突破性进展。代表性模型如GPT系列、LLaMA、Qwen等在多个基准上展现出优异性能。早期研究主要关注模型架构创新、训练数据规模和微调策略,旨在提升模型的整体能力。然而,随着模型规模的扩大和应用场景的多样化,评估体系逐渐暴露出局限性。传统的评估方法通常在固定的推理长度或资源条件下进行,忽略了实际应用中资源限制对模型表现的影响。近年来,test-time compute scaling(如Chain-of-Thought prompting、搜索增强、预算强制机制)成为研究热点,试图在推理过程中动态调整计算资源以优化性能。与此同时,关于“过度思考”现象的研究揭示,更多推理步骤不一定带来更高准确率,甚至可能引入噪声,导致性能下降。这些研究共同推动了对模型推理行为的深入理解,但尚未系统性分析在不同生成预算下模型表现的变化规律,尤其是模型排名的逆转现象。本论文填补了这一空白,系统性地探讨了预算条件对模型性能的影响,为模型评估和调度提供了新的视角。

核心问题

核心问题在于,现有模型评估体系假设模型性能在不同推理条件下具有一致性,然而实际中,模型在不同生成长度(即token预算)下的表现差异巨大,甚至出现逆转。这一现象严重影响模型的实际应用效果,尤其在资源受限环境(如移动端、边缘设备、实时系统)中,模型的性能表现极易受到预算限制的影响。具体而言,模型在较短预算下可能表现平平,但在较长预算中表现优异,反之亦然。这种不稳定性使得单一的性能指标无法全面反映模型的能力,也阻碍了模型的合理调度和融合。更复杂的问题在于,模型在不同预算下的行为具有高度非线性和样本依赖性,导致模型排名在不同条件下频繁逆转,影响模型选择的可靠性。解决这一问题,要求我们重新设计评估体系,将预算作为重要参数,建立预算条件下的模型性能曲线,从而实现更科学、更全面的模型评价体系。

核心创新

本研究的创新点主要体现在以下几个方面:

1. 发现模型在不同生成预算下的性能逆转现象,挑战了传统的模型稳定性假设,为模型评估引入了预算依赖的新维度。

2. 构建行为分类体系,将每个样本在不同预算下的正确性轨迹划分为始终正确、单调递增、非单调(过度思考)和始终错误,为理解模型推理行为提供了细粒度的分析工具。

3. 利用oracle集成分析,量化模型在不同预算下的互补性,揭示模型在资源受限时的协同潜力。

4. 设计了预算感知的模型路由器(基于XGBoost),通过学习预算特征显著提升跨域模型选择效果,验证了预算作为调度信号的有效性。这一机制为未来动态模型调度提供了技术基础。

方法详解

  • �� 选择代表性模型:包括LLaMA-3 8B、Qwen-3 32B、LLaMA-3.3 70B和GPT-OSS 20B,确保参数规模覆盖较大范围。• 任务设计:采用GSM8K、MATH-500和GPQA三项推理基准,涵盖从基础数学到高阶科学问题,确保评估的多样性。• 生成预算设定:在7个不同的最大token数(64至4096)下,逐步评估每个模型在每个任务上的表现,确保数据的全面性。• 评估指标:采用精确匹配(exact match)作为正确性判定,结合截断信息,区分截断和非截断样本,确保评估的可靠性。• 样本分析:构建每个样本在不同预算下的正确性轨迹,分类为始终正确、单调递增、非单调和始终错误。• 统计检验:利用McNemar检验分析模型排名逆转的显著性,确保结论的统计学严谨性。• 模型互补性分析:通过oracle集成,计算不同模型在不同预算下的性能差异,量化模型互补潜力。• 预算感知路由:训练基于XGBoost的分类器,利用文本特征和预算信息预测模型正确率,实现样本的动态调度。

实验设计

  • �� 数据集:使用GSM8K(1319个小学数学题)、MATH-500(500个竞赛级数学题)和GPQA(198个研究生科学题),覆盖不同难度层级。• 模型:包括开源的LLaMA-3 8B、Qwen-3 32B、LLaMA-3.3 70B,以及商业模型GPT-OSS 20B,确保参数规模多样。• 评估策略:在7个预算水平下,采用贪婪解码(T=0)进行推理,确保输出的确定性。• 样本处理:通过正则表达式提取答案,采用严格的精确匹配评分,统计正确率。• 截断控制:分析截断率对性能的影响,确保非截断样本的可靠性。• 行为分类:根据正确性轨迹,将样本划分为不同行为类别,分析非单调行为的比例和分布。• 统计检验:利用McNemar检验模型排名变化的显著性。• oracle集成:构建每个样本的最优模型组合,评估模型互补性。• 路由器训练:利用文本特征和预算信息训练XGBoost分类器,进行模型选择。

结果分析

  • �� 样本行为分析显示,非单调(过度思考)样本在不同模型中比例高达25.8%,且多为模型特异性,难以通过样本筛除解决。• 模型排名在所有基准上随预算变化而逆转,统计学上显著(p<0.01),例如在GSM8K中,70B模型在256 tokens时表现最佳(62.4%),而在4096 tokens时,20B模型表现更优(94.8%)。• oracle分析表明,模型互补性在有限预算下最强,最高达+27.8个百分点,说明不同模型在不同样本上的优势互补极大。• 预算感知路由器(基于XGBoost)在跨域任务中捕获了14.1%的oracle性能差距,显著优于传统文本特征选择方法,尤其在中等预算(如1024 tokens)表现突出。• 实验还验证了截断率对性能的影响,控制后非单调行为依然存在,说明过度思考是真实的推理失误。

应用场景

  • �� 立即应用:在模型部署中引入预算感知的调度机制,根据任务复杂度和资源限制动态选择模型,提高推理效率和准确率。• 资源有限环境:在移动端、边缘设备或实时系统中,合理设定预算,优化模型性能与计算成本的平衡。• 多模型融合:结合oracle分析,设计多模型集成策略,提升整体推理能力。• 长期愿景:发展智能调度系统,结合强化学习和模型内部信号,实现自适应预算管理,推动大模型在复杂场景中的广泛应用。

局限与展望

  • �� 由于模型在极低预算(如64 tokens)下大量截断,性能评估可能偏向于截断行为而非真实推理能力,影响结论的普适性。• 实验仅覆盖三项推理任务,尚未验证在多模态、多任务或更复杂场景中的表现,未来需扩展验证范围。• 预算感知路由器在跨域迁移中效果有限,说明模型-预算关系具有较强的领域依赖性,需研究更鲁棒的迁移策略。• 计算成本较高,尤其在大模型和多预算水平下的评估,未来需优化评估流程和算法效率。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,工厂里有许多不同的机器(模型),每台机器都能完成某种任务。工厂的生产线需要根据订单的复杂程度和时间限制(就像模型的生成预算)来选择合适的机器。有时候,选择一台机器只用少量原料(少的tokens),它可能完成得很快,但质量不一定最好;而用更多原料(更多tokens)可能让它做得更好,但也可能让它迷失在细节中,反而出错。这就像模型在生成内容时,给它的“时间”越长,表现不一定越好,反而可能出现“过度思考”的情况,导致答案变差。

研究发现,不同的机器在不同的原料用量下,表现会发生逆转。有的机器在短时间内表现优异,但在长时间后反而变差;而有的机器则在长时间后表现更佳。这就像在工厂里,有的机器在短时间内就能完成任务,有的则需要更长时间,但最终效果更好。科学家们用一种叫做“oracle”的方法,模拟最理想的机器组合,发现不同机器在不同时间段各有优势,合理搭配可以大大提高效率。

为了让工厂更智能,他们还设计了一套“调度员”,可以根据订单的内容和时间限制,自动选择最合适的机器。这套系统通过学习各种订单的特征,预测哪台机器最适合当前任务。实验结果显示,这样的调度系统能比单纯选择最大机器(最强模型)多出大约14%的效率,尤其在中等时间预算下表现最佳。这项研究告诉我们,在实际中,合理利用资源、动态调度比盲目追求“更长时间”更重要,也为未来智能调度和模型融合提供了新思路。

术语表

Token (标记)

在自然语言处理中,Token是文本的最小单位,通常是词或字符,模型通过生成Token来输出内容。

论文中提到的最大生成Token数限制影响模型输出长度。

模型排名 (Model Ranking)

在特定任务和条件下,不同模型的性能排序,用于比较模型优劣。

研究中分析了模型在不同预算下的排名变化。

McNemar检验

一种统计检验方法,用于比较两个分类模型在配对样本上的性能差异是否显著。

用来检验模型排名逆转的统计显著性。

oracle集成

假设可以选择每个样本的最佳模型,从而达到理论上的最大性能。

用以量化模型互补性和潜在提升空间。

模型互补性 (Model Complementarity)

不同模型在不同样本上的优势互补,组合后性能优于单一模型。

通过oracle分析揭示模型在不同预算下的互补潜力。

预算感知路由器 (Budget-aware Router)

一种基于模型性能和预算特征动态选择模型的调度系统。

通过XGBoost实现模型选择,提升跨域性能。

截断 (Truncation)

模型生成超出最大Token数时提前终止,可能影响评估的真实性。

控制截断率以确保性能评估的可靠性。

非单调行为 (Non-monotone Behavior)

模型在增加生成预算时,性能反而下降的现象。

揭示模型在推理中的“过度思考”问题。

行为分类 (Behavior Classification)

将模型样本在不同预算下的表现轨迹划分为不同类别。

分析模型在不同预算条件下的行为特征。

模型互补性指数 (Model Complementarity Index)

衡量不同模型在样本上的优势互补程度。

通过oracle集成评估模型组合潜力。

模型调度 (Model Scheduling)

根据任务特征和资源限制动态选择合适模型的策略。

研究中提出的预算感知调度系统。

开放问题 这项研究留下的未解疑问

  • 1 当前研究主要集中在推理任务,未来需验证预算依赖现象在生成摘要、对话等多模态任务中的普遍性和表现差异。
  • 2 模型在极端预算(如64 tokens)下的表现受截断影响较大,如何设计更鲁棒的评估指标仍是未解难题。
  • 3 模型内部信号(如logit分布、隐藏状态)在预算调度中的作用尚未充分探索,结合内部信息可能带来更优的调度策略。
  • 4 跨域迁移中,预算-性能关系表现出明显的领域依赖性,如何实现更强的泛化能力是未来研究重点。
  • 5 在实际应用中,如何动态调整预算以兼顾效率和准确性,尤其在实时系统和边缘设备中,仍需深入探索。

应用场景

近期应用

动态模型调度系统

在实际部署中,根据任务复杂度和资源限制,利用预算感知路由器实现模型的动态选择,提升推理效率和准确率。

资源受限环境优化

在移动端或边缘设备上,合理设定推理预算,平衡模型性能与计算成本,确保系统的实时响应。

多模型融合策略

结合oracle分析,设计多模型集成方案,充分利用模型互补性,提升整体推理能力。

远期愿景

智能自适应调度系统

未来发展基于强化学习的模型调度策略,实现对不同任务和预算的自适应优化,推动大模型在复杂环境中的广泛应用。

多模态多任务预算管理

结合多模态信息和多任务学习,设计统一的预算管理框架,提升模型在多样化场景中的表现和效率。

原文摘要

Standard evaluation of large language models assumes stable model rankings across inference conditions. We challenge this assumption by varying the token generation budget, i.e., the maximum tokens a model may produce, across seven levels (64--4,096), evaluating four models on three reasoning benchmarks (56,476 inferences). We report four findings: (i) 3--19% of items exhibit non-monotone behavior (accuracy decreasing with more budget), even after controlling for truncation, and this phenomenon is model-specific (cross-model overlap: 6--14%). (ii) Model rankings reverse across budgets on all benchmarks ($p {<} 0.01$, McNemar). (iii) Oracle analysis reveals model complementarity up to $+27.8$pp, most pronounced at constrained budgets. (iv) A budget-aware router captures 14.1% of the oracle gap cross-domain; budget features help within-domain ($+1.6$ to $+5.7$pp) but are domain-specific and hurt transfer ($-1.2$pp). These results argue for budget-conditioned evaluation protocols.

cs.AI cs.CL

参考文献 (16)

Chain of Thought Prompting Elicits Reasoning in Large Language Models

Jason Wei, Xuezhi Wang, Dale Schuurmans 等

2022 21008 引用 查看解读 →

GPQA: A Graduate-Level Google-Proof Q&A Benchmark

David Rein, Betty Li Hou, Asa Cooper Stickland 等

2023 3129 引用 查看解读 →

Routing to the Expert: Efficient Reward-guided Ensemble of Large Language Models

Keming Lu, Hongyi Yuan, Runji Lin 等

2023 160 引用 查看解读 →

The Llama 3 Herd of Models

Abhimanyu Dubey, Abhinav Jauhri, Abhinav Pandey 等

2024 17740 引用 查看解读 →

Large Language Model Routing with Benchmark Datasets

Tal Shnitzer, Anthony Ou, M'irian Silva 等

2023 185 引用 查看解读 →

Measuring Mathematical Problem Solving With the MATH Dataset

Dan Hendrycks, Collin Burns, Saurav Kadavath 等

2021 6120 引用 查看解读 →

Dynabench: Rethinking Benchmarking in NLP

Douwe Kiela, Max Bartolo, Yixin Nie 等

2021 596 引用 查看解读 →

Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters

C. Snell, Jaehoon Lee, Kelvin Xu 等

2024 2050 引用 查看解读 →

Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs

Xingyu Chen, Jiahao Xu, Tian Liang 等

2024 555 引用 查看解读 →

Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models

Yang Sui, Yu-Neng Chuang, Guanchu Wang 等

2025 436 引用 查看解读 →

LLM-Blender: Ensembling Large Language Models with Pairwise Ranking and Generative Fusion

Dongfu Jiang, Xiang Ren, Bill Yuchen Lin

2023 671 引用 查看解读 →

Judging LLM-as-a-judge with MT-Bench and Chatbot Arena

Lianmin Zheng, Wei-Lin Chiang, Ying Sheng 等

2023 10455 引用 查看解读 →

NLP Evaluation in trouble: On the Need to Measure LLM Data Contamination for each Benchmark

Oscar Sainz, Jon Ander Campos, Iker García-Ferrero 等

2023 399 引用 查看解读 →

Holistic Evaluation of Language Models

Percy Liang, Rishi Bommasani, Tony Lee 等

2023 1937 引用

Training Verifiers to Solve Math Word Problems

K. Cobbe, Vineet Kosaraju, Mo Bavarian 等

2021 10081 引用 查看解读 →

s1: Simple test-time scaling

Niklas Muennighoff, Zitong Yang, Weijia Shi 等

2025 1395 引用 查看解读 →