Stop Comparing LLM Agents Without Disclosing the Harness

TL;DR

提出“绑定约束论”,强调长远任务中调度器(harness)配置对性能影响大于模型,建议披露调度器信息。

cs.AI 🔴 高级 2026-05-07 59 次浏览
Yunbei Zhang Janet Wang Yingqiang Ge Weijie Xu Jihun Hamm Chandan K. Reddy
LLM 调度器 性能评估 长远任务 系统架构

核心发现

方法论

本文采用控制理论框架,将调度器视为闭环控制器,模型为随机策略,分析调度器配置对性能的影响。通过Variance分解,将整体性能方差拆分为模型引起的和调度器引起的两部分,验证调度器配置在长远任务中的主导作用。利用公开基准、行业部署和控制实验,量化调度器引起的性能波动,提出调度器披露标准,强调未披露调度器会导致评测结果误导。

关键结果

  • 在SWE-bench Pro中,模型Claude Opus 4.5在不同调度器下性能差异达9.5个百分点,远超模型升级带来的变化。行业监测显示,调度器变化导致的性能差异最高达15个百分点,显著大于模型差异。控制实验中,调度器配置变化引起的性能方差比模型引起的高出7.8倍,且存在模型排名反转现象。
  • Variance分解显示,调度器配置的性能方差(HV)在长远任务中常常超过模型引起的方差(MV),验证“绑定约束论”。多种调度器配置(H1、H2、H3)实验中,调度器引起的性能波动占比达80%以上。
  • 提出“调度器感知评估框架”,包括调度器披露卡、方差分解协议和轨迹指标,确保评测的透明性和可比性,避免未披露调度器带来的误导。

研究意义

该研究揭示了长远任务中调度器配置对LLM性能的决定性影响,挑战了模型单一属性的传统评估方式。强调调度器的透明披露,有助于行业制定更科学的评估标准,推动调度器工程化发展,改善实际应用中的可靠性与可控性。对学术界而言,提供了系统性分析工具,推动闭环控制理论在AI中的应用,促进模型与系统架构的深度融合。对产业界,则指明了优化调度器设计以提升长远任务表现的方向,减少模型升级的盲目性,提升整体系统性能。

技术贡献

本文首次将调度器作为闭环控制器引入LLM性能分析,提出Variance分解模型,量化调度器配置对性能的贡献。引入Lyapunov稳定性、上下文漂移和控制滞后等指标,系统性描述调度器的稳定性与可靠性。设计调度器披露标准和方差分解协议,为未来长远任务评测提供结构化框架。理论上,建立了调度器配置与性能波动的因果关系,为调度器工程提供了量化工具。技术创新在于将控制论引入LLM系统评估,突破模型单一属性的局限,强调系统整体设计的重要性。

新颖性

本研究首次系统性提出调度器(harness)在长远任务中的主导作用,突破传统模型性能评估的单模型视角。通过Variance分解和控制理论,量化调度器配置对性能的影响,揭示模型排名反转等现象,强调调度器披露的必要性。相较于以往只关注模型规模和微调,本研究强调系统架构在实际表现中的关键作用,开辟了调度器工程和系统评估的新方向。

局限性

  • 研究主要针对长远任务和前沿模型,短期任务或模型差距极大的场景未充分覆盖,可能影响结论的普适性。
  • 调度器配置的详细披露依赖于实验设计,实际部署中调度器的复杂性和多样性可能带来评估难题。
  • 实验多在受控环境下进行,实际应用中调度器的动态变化和环境干扰可能引入额外不确定性。

未来方向

未来将扩展调度器配置的自动优化方法,结合强化学习和自适应控制技术,提升调度器的鲁棒性。探索多任务、多模态环境下调度器的协同优化,推动系统级AI的研究。同时,推动行业制定统一披露标准,促进调度器设计的透明化和标准化,提升长远任务的可靠性和可解释性。

AI 总览摘要

当前,评估大规模语言模型(LLM)在长远任务中的性能,普遍忽视了调度器(harness)在系统中的关键作用。传统方法将性能归因于模型本身,忽略了调度器配置对结果的巨大影响。实证数据显示,调度器的微调或替换,能引起性能差异高达15个百分点,远超模型升级带来的变化。这种偏差导致模型排名的不稳定,甚至出现反转,严重影响评测的公平性和可信度。

为解决这一问题,本文提出“绑定约束论”,强调在长远任务中,调度器配置(H)对性能的贡献(HV)可能超过模型(M)本身的影响(MV)。通过控制理论,将调度器视为闭环控制器,模型为随机策略,分析其在动态系统中的作用。利用Variance分解,将整体性能波动拆解为模型和调度器两部分,验证调度器配置在实际中的主导地位。

为了实现公平和透明的评估,作者设计了调度器披露卡和方差分解协议,建议在评测中明确披露调度器配置,或采用固定调度器的锁定协议。实验结果显示,调度器配置变化引起的性能差异,平均达7.8倍于模型差异,且在多个基准测试中出现模型排名反转。这一发现强调了调度器工程的重要性,也为未来长远任务的系统设计提供了理论基础和实践指南。

总体而言,该研究呼吁行业和学术界重视调度器的透明披露,推动系统级控制方法在AI中的应用,以实现更可靠、更公平的长远任务评估和部署。未来工作将聚焦于调度器的自动优化、多任务协同和标准化制定,推动系统整体性能的持续提升。

深度分析

研究背景

随着LLM在自然语言处理和智能系统中的广泛应用,长远任务的性能评估成为研究焦点。早期工作如GPT-3、BERT等模型主要关注模型规模和微调技术,代表性基准包括SuperGLUE、BIG-Bench等。然而,随着系统复杂度增加,调度器(harness)在上下文管理、工具调用、错误处理中的作用逐渐凸显。行业实践中,调度器配置差异导致性能波动巨大,传统评估忽视了这一因素,造成模型性能的误导性比较。近年来,研究逐步认识到系统架构对长远任务表现的重要性,但缺乏系统性分析和量化工具。本论文在此背景下,提出调度器作为闭环控制器的理论框架,旨在揭示调度器配置对性能的深远影响,推动评估标准的变革。

核心问题

当前LLM性能评估普遍忽视调度器配置的影响,将性能归因于模型本身,导致跨模型比较不公平。调度器在长远任务中的作用被低估,实际中调度器配置变化可引起性能差异高达15个百分点,远超模型升级带来的变化。这不仅影响模型排名的稳定性,也误导了研究和产业的决策。缺乏调度器披露标准,使得不同研究和部署环境中的性能差异难以解释,限制了系统优化的方向。解决这一问题,需要系统性分析调度器配置的影响,并制定透明披露和公平评估的框架。

核心创新

本研究创新在于将调度器视为闭环控制器,提出Variance分解模型,量化调度器配置对性能的贡献。引入Lyapunov稳定性、上下文漂移和控制滞后指标,系统描述调度器的稳定性与可靠性。设计调度器披露卡和方差分解协议,确保评估的透明性和可比性。与传统只关注模型规模和微调的研究不同,强调系统架构在实际表现中的关键作用,推动系统级AI的研究方向。理论创新在于结合控制论与AI评估,提供量化工具,推动调度器工程化。

方法详解

  • �� 将调度器(H)定义为闭环控制器,模型(πθ)为随机策略,系统状态(st)由调度器管理。• 采用Variance分解,将性能指标(B)拆分为模型引起的方差(MV)和调度器引起的方差(HV),以及交互项。• 设计三类调度器配置(H1、H2、H3),分别代表不同的稳定性、漂移控制和故障恢复能力。• 通过控制实验,比较不同调度器配置对模型性能的影响,验证调度器配置在长远任务中的主导作用。• 引入Lyapunov稳定性、上下文漂移(δt)和控制滞后(τ)指标,量化调度器的可靠性。• 在公开基准(如SWE-bench Verified)上进行大规模测试,验证理论模型的实用性。

实验设计

  • �� 选择GPT-5.4、Kimi K2.6、GLM-5.1三款模型,设计三种调度器配置(H1、H2、H3),在受控环境中进行长远任务(如编码任务)测试。• 每个模型-调度器组合进行两次独立运行,保持任务顺序和环境一致。• 评估指标为pass@1性能,计算性能的方差(MV、HV)及其比例。• 通过调度器配置变化,观察模型性能波动,验证调度器对性能的影响是否超过模型升级。• 统计模型排名反转次数,分析调度器配置对排名稳定性的影响。

结果分析

  • �� 实验显示,调度器配置(H1-H3)引起的性能变化平均达13个百分点,远超模型内部变化(约3-5个百分点)。•调度器配置变化引起的性能方差(HV)在平均值上是模型引起的方差(MV)的7.8倍,验证调度器在长远任务中的主导作用。• 多个模型在不同调度器下出现排名反转,说明未披露调度器会严重误导评估结果。• 通过方差分解,明确指出调度器配置在实际系统中的重要性,推动行业采用调度器披露标准。

应用场景

  • �� 立即应用于行业评测平台,推动调度器配置的透明披露,提升评估公平性。• 在实际部署中,优化调度器设计,提升长远任务的稳定性和可靠性,减少模型升级的盲目性。• 长远来看,推动系统级AI架构设计,结合控制论实现更鲁棒的智能系统,适应复杂多变的应用场景。

局限与展望

  • �� 研究主要集中在长远任务和前沿模型,短期任务或极端模型差异场景未充分覆盖。• 调度器配置的披露依赖于实验设计,实际应用中调度器的复杂性可能带来评估难题。• 实验环境受控,实际部署中调度器的动态变化和环境干扰可能引入额外不确定性。

通俗解读 非专业人士也能看懂

想象一个工厂生产线,不仅仅是机器(模型)决定产品质量,还要有一个调度员(调度器)不断监控、调整流程,确保每个环节都在正确轨道上。单纯提升机器的能力(模型)固然重要,但如果调度员不善于管理,生产线还是会出错甚至崩溃。不同调度员的管理方式会让同样的机器产生完全不同的效果。这个调度员就像论文中的“调度器”,它控制着整个系统的运作,决定了最终的成品质量。研究发现,调度员的配置变化,影响比机器升级还大,甚至会让排名出现反转。为了公平评比,必须公开调度员的管理方式,否则就像只看机器不看调度员的工厂,结果会误导人们对工厂实力的判断。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,不只是你的角色(模型)厉害,还要有个队长(调度器)在旁边指挥。队长负责决定什么时候用特殊技能、什么时候休息、什么时候换装备。即使你的角色很强,如果队长指挥不好,比赛成绩也会很差。反之,如果队长调度得当,即使角色普通,也能赢得比赛。研究发现,队长的指挥方式对比赛结果的影响,比角色的能力还大。不同的队长策略,能让同样的角色表现天差地别,甚至出现排名倒置。为了公平比较,比赛必须公开队长的指挥策略,否则只看角色的强弱是不公平的。这就像论文里强调的,调度器(队长)配置的透明很重要,不能只看模型(角色)本身。

原文摘要

This position paper argues that, for long-horizon tasks evaluated across models with comparable frontier capability, the agent execution harness, namely the infrastructure layer that governs context construction, tool interaction, orchestration, and verification around a language model, is often a stronger determinant of agent performance than the model it wraps. We formalize and defend the Binding Constraint Thesis: in this regime, performance variance is governed more by harness configuration than by model choice, and current evaluation protocols therefore systematically misattribute harness-level gains to model improvements. We support this thesis along three lines. First, a control-theoretic formalization treats the harness as the controller of a closed-loop dynamical system and the LLM as the stochastic policy it governs, which explains why small harness changes can produce performance shifts that exceed those obtained by substituting one model for another. Second, published benchmarks, industry deployments, and a controlled variance decomposition show that harness-induced variance can substantially exceed model-induced variance, including cases of model ranking reversal. Third, we propose a harness-aware evaluation framework with a disclosure standard and a variance decomposition protocol. Until harness specifications are disclosed, leaderboard comparisons for long-horizon agents should be treated as incomplete and potentially misleading.

cs.AI cs.SE