ParEvalLayer: When Partial LLM-Agent Evaluations Support a Decision

TL;DR

ParEvalLayer用覆盖与Bootstrap判定部分评测是否足以决策;三项基准在15%–25%任务量达到完整评测结论。

cs.AI 🟡 进阶级 2026-08-04 20 次浏览
Wei-Jung Huang Bonan Shen
LLM智能体评测 部分评测 早停 Bootstrap 基准报告

核心发现

方法论

ParEvalLayer读取两个智能体在相同任务上的成对结果,并依据预先设定的阈值δ、任务顺序、分组覆盖、错误率与预算规则输出四种动作:promote、reject、continue、abstain。核心统计量是差值均值Δ̂_b,使用对观测差值重采样的Bootstrap尾概率检验不确定性,同时防止未覆盖关键任务组。

关键结果

  • 在主要策略、δ=0个百分点、错误率α=0.05、覆盖失败γ=0.05、弃权率η=0.25下,AppWorld、OSWorld-Verified和tau-bench在仅观察15%–25%任务结果后即可达到与完整记录相同的比较结论。
  • 不同基准差异显著:SWE-bench Verified需要90%任务量;SWE-bench Lite在95%任务量时仍有过多未决比较;Terminal-Bench即使使用95%墙钟时间预算,也无法把未决率降到可报告水平。
  • 数据规模包括SWE-bench Lite的552个有向比较、Verified的156个、AppWorld的306个、OSWorld-Verified的56个和tau-bench的12个;正向结论数量随δ=0、5、10个百分点分别下降。

研究意义

论文把“提前得到一个分数”改写为“当前证据是否支持一个明确决定”。这对昂贵、易失败且需要人工检查的智能体评测尤其重要。它要求报告同时公开规则、任务覆盖、预算和未决比例,避免选择容易样本后制造虚假确定性,也避免只报告少数简单比较而掩盖整体不可判定性。

技术贡献

技术上,ParEvalLayer将任务级配对差值、分层覆盖和Bootstrap尾检验组合成可追溯的决策层。分组最低覆盖数为r_g(b)=max{1,min{n_g,⌊k_b n_g/N⌋}};当覆盖满足且Δ̂_b>δ、R_promote≤0.05时提升,否则在Δ̂_b≤δ且R_reject≤0.05时拒绝。其充分预算还要求FPR、FRR≤α、覆盖失败≤γ、abstain≤η。

新颖性

与任务子集压缩或排名保持方法不同,ParEvalLayer不追求构造最小测试集,而判断正在进行的双系统比较能否报告。它把continue和abstain视为正式输出,并在完整记录回放中同时评估错误、覆盖和未决率,形成面向报告的证据契约。

局限性

  • 实验依赖公开的已完成任务记录,回放目标不等同于真实在线早停;反复查看同一运行还需要时间一致的序贯边界。
  • SWE-bench、AppWorld等数据存在系统筛选、共享任务重叠和配置差异;tau-bench仅有12个有向比较,泛化结论有限。
  • Bootstrap只刻画观测任务差值的不确定性,不能自动解决任务顺序偏差、运行间波动或基准本身的代表性问题。

未来方向

未来可研究时间一致的置信序列、主动且公平的任务选择、成本—准确率联合预算,以及跨版本、跨脚手架的在线验证。还应扩大到更多带资源和失败轨迹的基准,并把人类检查成本、重复运行方差与分布漂移纳入决策记录。

AI 总览摘要

大型语言模型智能体的完整评测往往耗费API预算、运行时间、沙箱资源和人工检查成本。评测进行到一半时,团队通常已经有一个“部分分数”,但这个分数未必代表完整结论:早期任务可能集中于某个仓库、难度层或应用领域,便宜任务优先也会造成样本偏差。更危险的是,一个只在简单比较上做决定的规则,看似准确,却可能让大多数比较保持沉默。

Huang与Shen提出ParEvalLayer,将评测执行和报告决策分开。它接收两个系统在共享任务上的配对结果,按预先选择的改进阈值、任务组覆盖、Bootstrap不确定性、错误率和预算规则,输出promote、reject、continue或abstain。对观测差值D_i=Y_i,A−Y_i,B求均值,并以Bootstrap尾概率判断结果是否足够远离阈值;同时要求仓库、难度、应用组或领域等关键切片达到最低覆盖量。

在完整公共记录回放中,AppWorld、OSWorld-Verified和tau-bench在15%–25%任务量时即可复现完整评测结论;SWE-bench Verified却需要90%,SWE-bench Lite在95%时仍有过多未决比较,Terminal-Bench的95%墙钟预算也不够。论文的核心信息不是所有基准都能早停,而是部分报告必须同时说明规则、预算、覆盖和未决率。

深度分析

研究背景

智能体基准从单一总分逐渐转向任务级结果、成本、可靠性和环境轨迹。SWE-bench、AppWorld、OSWorld-Verified与tau-bench提供了多系统共享任务记录;HAL等基础设施改善了执行与日志记录。但任务子集研究通常关注是否保持排行榜,而不是当前两个系统是否已经足以作出有阈值的比较。

核心问题

部分分数不能自动证明结论稳定。早期任务可能遗漏关键仓库、难度、应用或领域;成本排序还会系统性改变样本。若只统计已决定案例,规则可以通过拒绝处理困难比较来获得虚假的高准确率。因此需要同时控制错误、覆盖和未决率。

核心创新

ParEvalLayer的创新包括:一,将配对任务结果转换为四动作报告;二,用预先固定的δ、预算和分组覆盖约束避免事后调参;三,用Bootstrap尾概率检验观测差值;四,以完整记录回放验证promote/reject是否正确;五,把continue和abstain保留为可审计结果,而非强行二分类。

方法详解

  • �� 输入:任务ID、系统ID、结果、任务组及成本或时间。
  • �� 配对:在共享可用任务集T上计算D_i=Y_i,A−Y_i,B与Δ_full=N^{-1}ΣD_i。
  • �� 预算:观察比例b对应S_b,计算Δ̂_b=|S_b|^{-1}ΣD_i。
  • �� 覆盖:对每个组要求r_g(b)=max{1,min{n_g,⌊⌈bN⌉n_g/N⌋}}个任务。
  • �� 不确定性:Bootstrap重采样差值,R_promote=P(Δ̂*_b≤δ),R_reject=P(Δ̂*_b>δ)。
  • �� 决策:覆盖不足则continue/abstain;满足覆盖后,按Δ̂_b、尾概率和预算输出四种动作。

实验设计

作者对已完成公共记录做completed-record replay,隐藏后续任务并在多个预算点应用固定策略。数据包括SWE-bench Lite/Verified、AppWorld、OSWorld-Verified、tau-bench;Terminal-Bench单独用于墙钟时间检查。主要参数为δ=0、5、10个百分点,Bootstrap尾阈值0.05,错误率与覆盖目标0.05,弃权目标0.25。

结果分析

δ=0时,AppWorld、OSWorld-Verified和tau-bench在15%–25%任务量达到完整结论。SWE-bench Verified需90%;SWE-bench Lite在95%仍过多未决;Terminal-Bench在95%时间预算也如此。结果说明可早停性主要由任务结构、系统差异、覆盖要求和资源排序共同决定,而非由单一百分比决定。

应用场景

评测服务可在每个预算点生成带阈值、覆盖状态、差值、尾概率和动作的记录。模型发布、脚手架A/B测试、软件修复代理筛选、企业内部成本控制和持续集成评测,都可据此决定继续运行、晋级、淘汰或明确声明证据不足。

局限与展望

公开回放不能完全模拟在线评测中的重复查看、任务失败、配置变化和真实停止过程。任务记录还可能存在选择偏差,且不同基准的分组粒度并不一致。未来应引入序贯置信边界、主动抽样、运行间方差、资源公平性和分布漂移测试,并扩大到更多任务类型。

通俗解读 非专业人士也能看懂

把一次智能体评测想成比较两家餐厅。你不应只在前25道容易做的菜上尝味道,就宣布一家整体更好,因为菜单后面可能还有海鲜、甜点和地方菜。ParEvalLayer像一位提前写好规则的评委:它先检查每类菜是否都尝过,再比较两家平均差多少,并估计这个差距会不会只是偶然。

如果证据足够,它会说“推荐A”;如果A没有达到规定优势,就说“暂不推荐A”;如果菜还没尝够,就要求继续;如果时间用完仍无法判断,就承认“无法决定”。这样,评委不能只挑简单菜来显示高准确率,也不能把没尝过的类别藏起来。

研究发现,有些菜单只需尝15%–25%就能得出与全部品尝相同的结论,但SWE-bench Verified需要90%,另一些菜单即使尝到95%仍不够。重点不是永远少做工作,而是让每次提前结论都说明尝了什么、规则是什么,以及还有多少问题没有答案。

简单解释 像给14岁少年讲一样

想象你在学校测试两个游戏队伍谁更强。你看了前几局,A队领先,于是很想马上宣布冠军。但如果前几局都是A队最擅长的地图,后面还有没玩过的地图,结论就可能翻车!ParEvalLayer就是一个提前写好规则的裁判。

它会先问:每种地图都出现了吗?A队领先的分数够不够规定的差距?这个领先会不会只是运气?它用Bootstrap反复“重新抽取已看到的比赛”,看看结论是否稳定。然后只有四种选择:A确实更好、A没有更好、再玩几局,或者时间到了仍不能判断。

实验很有意思:在AppWorld、OSWorld-Verified和tau-bench里,看15%–25%的任务就能得到和完整比赛一样的判断;SWE-bench Verified却要看到90%。SWE-bench Lite看到95%还可能无法决定。

所以,半场比分不是最终答案。真正靠谱的报告还要写清楚比赛规则、看过哪些地图、用了多少预算,以及还有多少对决没有结论。这样大家知道的是“证据支持什么”,而不是被一个漂亮但片面的数字带偏。

术语表

ParEvalLayer(部分评测决策层)

读取任务级配对结果并判断当前证据是否足以作出比较。它输出promote、reject、continue或abstain。

论文提出的核心框架。

Paired difference(配对差值)

同一任务上系统A与B结果之差,公式为D_i=Y_i,A−Y_i,B。它控制任务难度差异,直接衡量相对改进。

所有阈值判断的基础。

Bootstrap tail(Bootstrap尾概率)

从已观察差值中有放回重采样,估计均值跨过阈值的概率。它无需为差值指定参数分布。

用于promote和reject的不确定性检查。

Task-group coverage(任务组覆盖)

要求每个关键任务组至少出现规定数量的样本。该规则防止早期结果只代表狭窄切片。

覆盖不足时禁止最终决策。

Completed-record replay(完整记录回放)

把已完成公开评测伪装成逐步停止,并在各预算点隐藏后续结果。部分决策随后与完整记录结论比较。

论文的主要实验协议。

开放问题 这项研究留下的未解疑问

  • 1 真实在线重复查看同一运行时,Bootstrap阈值如何转化为时间一致的序贯保证,论文尚未验证。
  • 2 主动选择任务能否降低成本而不引入样本偏差,尤其在任务难度和系统能力相关时,仍缺少系统研究。
  • 3 公开记录回放能否代表真实失败、重试、成本波动和分布漂移环境,尚需前瞻性部署实验。

应用场景

近期应用

智能体A/B评测

评测平台可接入任务结果流,在达到分组覆盖后计算配对差值和Bootstrap尾概率。平台不仅显示部分分数,还报告晋级、淘汰、继续或弃权,并公开未决比例。

持续集成中的代理回归测试

软件修复或浏览器代理每次更新后,可在共享任务上使用固定δ和预算规则。若结果稳定优于旧版本即可提前停止,否则自动增加任务或标记证据不足。

远期愿景

可审计的智能体评测标准

未来基准报告可把阈值、任务顺序、覆盖、资源预算、错误率和弃权率作为标准元数据,使不同实验室的早停结论可复核、可比较。

原文摘要

LLM-agent evaluations often produce task outcomes long before the full benchmark run is complete. A partial score is tempting to report, but it does not show whether the observed tasks support the same conclusion as the completed evaluation. Early tasks can omit important parts of a benchmark, running cheaper tasks first can distort the observed sample, and a rule that decides only easy pairs can appear accurate while leaving many comparisons unresolved. We introduce ParEvalLayer, a decision layer that reads paired outcomes for two agent systems and a comparison policy chosen in advance. For each partial run, it records whether the tested agent system is better by the required amount, is not better by that amount, needs more evidence, or should abstain. We evaluate ParEvalLayer by replaying completed public benchmark data as if each evaluation had stopped earlier. At each point, ParEvalLayer applies the policy using only the outcomes observed so far; if it reaches one of the two comparison judgments, we check whether that judgment matches the completed data for the same system pair. With the main comparison rule, three of the public benchmarks reach the same decision as the completed evaluation after observing only 15% to 25% of task outcomes. Other benchmarks require more task outcomes. This variation shows why a partial score alone is not enough: reports should also state the decision rule and how many comparisons remain without a decision.

cs.AI