HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

TL;DR

引入HarnessOpt-Bench基准,评估5个前沿大型语言模型在昂贵且随机的全流程 harness 优化中的表现,揭示模型差异和潜在提升空间。

cs.AI 🔴 高级 2026-08-07 133 次浏览
Varun Ursekar Apaar Shanker Yash Maurya Shehab Yasser Vijay S. Kalmath Veronica Chatrath Yuan Xue
人工智能 大模型 自动化优化 基准测试 系统工程

核心发现

方法论

本文提出HarnessOpt-Bench基准框架,设计了端到端的 harness 优化流程,结合可信执行环境(TEE)确保评估的公平性与可追溯性。优化器(LLM)在固定预算内,接收目标代理的种子 harness 和评估反馈,经过多轮编辑后,提名最终候选 harness。候选 harness 在未见的测试集上,通过归一化增益指标进行评分,确保模型的泛化能力。实验中,评估了包括Claude、GPT-5.6系列和Kimi在内的五个前沿模型,使用共享编码 harness和其原生 harness,覆盖4个下游任务,共计111次评分运行。整个流程由可信执行环境(如VERO)严格控制,限制模型调用、资源使用和候选版本存档,确保评估的公正性和可复现性。

关键结果

  • 模型之间的差异明显,模型选择对优化效果影响大于 harness 设计,模型差异平均达0.142的归一化增益,而 harness 设计差异为0.079。不同模型在同一 harness 下的表现差异显著,模型进步(如GPT-5.6的不同版本)带来持续性能提升,最高提升达0.49。原生 harness未必优于共享 harness,且不同任务和种子设置下,性能提升幅度差异巨大。实验还显示,优化器模型的搜索策略(如探索的宽度)与性能提升正相关,广泛探索能带来更大增益。
  • 研究还发现,优化器模型的能力仍有较大提升空间,当前模型在复杂任务中的表现受限,尤其在噪声较大或评估昂贵的场景中,模型难以准确诊断失败点,导致潜在改进未能充分实现。模型版本的持续迭代(如GPT-5.6的不同版本)显示出性能逐步提升,但仍未达到理想的极限。实验还揭示,模型在不同 harness 设计中的敏感性,某些模型在特定 harness 下表现优异,而在其他 harness 中表现平平,说明 harness 设计对模型性能影响显著。
  • 该工作为 harness 优化提供了统一的评估平台,明确了模型在自动化系统中的潜在能力和局限,为未来开发更智能、更高效的自动优化算法奠定了基础。通过严格的评估协议和可信执行环境,确保了结果的可比性和可追溯性,为后续研究提供了标准化的参考框架。
  • 此外,研究强调了探索宽度与性能提升的关系,鼓励未来在搜索策略、诊断机制和资源管理方面进行深入探索。研究还提出,模型能力的提升不仅依赖于模型本身,还与 harness 设计、搜索策略和评估环境密切相关,未来应在多方面共同优化。
  • 最后,本文指出当前方法在处理高噪声和昂贵评估场景时仍面临挑战,未来工作应关注提升模型诊断能力、降低评估成本和增强泛化能力,以实现更全面的自动化 harness 优化。

研究意义

本研究首次系统性地评估了前沿大型语言模型在昂贵且随机的 harness 优化任务中的表现,填补了该领域缺乏统一评估标准的空白。通过引入HarnessOpt-Bench,建立了一个可重复、可比的评估体系,为未来自动化系统的研发提供了量化指标。研究揭示模型在系统级优化中的潜力与局限,推动了智能系统自主改进的理论与实践发展。该工作不仅丰富了AI系统工程的理论基础,也为工业界提供了实用的工具和方法,有助于推动智能代理的自主学习与适应能力的提升。特别是在复杂、多工具、多目标的实际应用场景中,HarnessOpt-Bench为模型选择、策略优化和系统调优提供了科学依据,具有重要的学术和产业价值。

技术贡献

本文的主要技术贡献包括:第一,提出HarnessOpt-Bench基准框架,定义了端到端的 harness 优化流程,结合可信执行环境确保评估的公平性和可追溯性。第二,设计了多任务、多模型的评估体系,涵盖4个下游任务,提供了丰富的实验数据和基线比较。第三,系统性分析了不同模型(如Claude、GPT-5.6、Kimi)在相同和原生 harness 下的表现差异,揭示模型选择对优化效果的影响。第四,提出了探索宽度与性能关系的量化指标,验证了广泛探索有助于性能提升。第五,提供了详细的实验分析,揭示了当前模型在昂贵评估场景中的能力瓶颈,为未来改进提供方向。

新颖性

该研究的创新点在于:首次提出针对昂贵且随机的 harness 优化任务的标准化评估框架,打破了以往多模型、多任务、缺乏统一协议的局限。引入可信执行环境(TEE)确保评估的公正性和可追溯性,提升了实验的可信度。通过系统性比较不同模型和 harness 设计,揭示了模型选择的重要性和潜在提升空间。提出探索宽度与性能关系的量化指标,为优化策略提供了新的理论基础。这些创新为自动化系统的研发提供了标准化的评估工具,推动了系统级自动优化技术的发展。

局限性

  • 当前方法在处理高噪声和昂贵评估场景时仍存在局限,模型难以准确诊断失败原因,导致潜在改进未能充分实现。
  • 实验中所用的模型和 harness 设计较为有限,未来需要扩展到更多模型和更复杂的系统环境,以验证其普适性。
  • 在资源限制和评估成本方面,当前方案仍存在一定的瓶颈,尤其是在大规模工业应用中,如何降低成本、提升效率仍需探索。

未来方向

未来工作应关注提升模型在高噪声环境中的诊断能力,开发更高效的评估机制以降低成本,同时探索多模态、多工具融合的 harness 设计。此外,应扩展到更复杂的实际应用场景,如多任务、多目标优化,推动自动化系统的自主学习能力。研究还可以结合强化学习和元学习技术,提升模型的泛化和适应能力,最终实现更智能、更自主的系统优化框架。

AI 总览摘要

在人工智能快速发展的背景下,构建具有自主学习和优化能力的系统成为研究热点。大型语言模型(LLMs)作为核心组件,其性能不仅取决于模型本身的参数,还受到 surrounding harness(提示、工具、控制流、记忆和调度代码)的影响。不同的 harness 设计会导致模型能力的显著差异,如何自动化优化 harness 成为提升系统整体性能的关键路径。

然而,缺乏统一的评估标准和测试平台限制了该领域的深入发展。为此,本文提出了HarnessOpt-Bench,一个专门针对昂贵且随机的 harness 优化任务的基准框架。该框架结合可信执行环境(TEE),确保在有限预算内对候选 harness 进行公平、可追溯的评估。优化器(通常为LLM)在接收目标代理的种子 harness和评估反馈后,经过多轮编辑,最终提名一个候选 harness。该候选在未见的测试集上,通过归一化增益指标进行评分,确保模型的泛化能力。

实验中,作者评估了包括Claude、GPT-5.6系列和Kimi在内的五个前沿模型,使用共享编码 harness和其原生 harness,覆盖4个不同的下游任务,共计111次评分运行。结果显示,模型之间的差异明显,模型选择对优化效果影响大于 harness 设计,且不同任务和种子设置下性能波动巨大。研究还发现,探索宽度(即搜索的广度)与性能提升呈正相关,广泛探索能带来更大增益。

这些发现表明,尽管当前模型在昂贵评估场景中仍有能力差距,但通过系统化的优化策略和评估框架,模型性能有望持续提升。HarnessOpt-Bench为未来自动化系统的研发提供了标准化的评估工具,推动了系统级自动优化技术的发展。未来,研究将集中在提升模型诊断能力、降低评估成本,以及扩展到更复杂的多任务、多目标场景中,助力智能系统的自主学习与适应能力的全面提升。

深度解读

原文摘要

As LLMs are increasingly deployed within agentic systems, their capabilities depend not only on the model weights but also on the harness: the prompts, tools, control flow, memory, and orchestration code surrounding them. This makes automated harness optimization -- the iterative and evaluation-guided improvement of a harness by an AI system -- both an important route to improving AI systems and a demanding capability for AI systems themselves. Yet the community lacks a common protocol for measuring how well frontier LLMs perform at this task. We introduce HarnessOpt-Bench, a benchmark for end-to-end harness optimization under expensive and stochastic evaluation. An optimizer, an LLM paired with a coding harness, receives a target agent's seed harness, graded evaluation feedback, and a fixed target-evaluation budget. It edits the harness and nominates a final candidate, which is scored by its normalized gain over the seed on a held-out test partition that remains inaccessible throughout search. A trusted execution environment enforces the evaluation boundary, meters target-agent resource use, and preserves candidate versions for audit. We evaluate 5 frontier LLMs as optimizers both under a shared coding harness and under their native harnesses across 4 downstream tasks, over 111 scored runs. Experiment results show that optimizer models separate more than the coding harnesses they act through, native harnesses are not consistently superior, and gains vary substantially across tasks and seed regimes. These results establish harness optimization as a measurable and discriminative capability with large space for improvement.

cs.AI cs.CL cs.LG

参考文献 (20)

BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent

Zijian Chen, Xueguang Ma, Shengyao Zhuang 等

2025 155 引用 ⭐ 高影响力 查看解读 →

Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces

Mike A. Merrill, Alexander G Shaw, Nicholas Carlini 等

2026 313 引用 ⭐ 高影响力 查看解读 →

GAIA: a benchmark for General AI Assistants

G. Mialon, Clémentine Fourrier, Craig Swift 等

2023 1075 引用 ⭐ 高影响力 查看解读 →

A Self-Improving Coding Agent

M. Robeyns, M. Szummer, Laurence Aitchison

2025 35 引用 查看解读 →

Gödel Agent: A Self-Referential Agent Framework for Recursive Self-Improvement

Xunjian Yin, Xinyi Wang, Liangming Pan 等

2024 17 引用

Program Synthesis with Large Language Models

Jacob Austin, Augustus Odena, Maxwell Nye 等

2021 4233 引用 查看解读 →

RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement

Fanqing Meng, Lingxiao Du, Qiguang Chen 等

2026 3 引用 查看解读 →

Evaluating Large Language Models Trained on Code

Mark Chen, Jerry Tworek, Heewoo Jun 等

2021 10945 引用 查看解读 →

VeRO: A Harness for Agents to Optimize Agents

Varun Ursekar, Apaar Shanker, Veronica Chatrath 等

2026 4 引用 查看解读 →

Automated Design of Agentic Systems

Shengran Hu, Cong Lu, Jeff Clune

2024 257 引用 查看解读 →

KernelBench: Can LLMs Write Efficient GPU Kernels?

Anne Ouyang, Simon Guo, Simran Arora 等

2025 198 引用 查看解读 →

Mathematical discoveries from program search with large language models

B. Romera-Paredes, M. Barekatain, Alexander Novikov 等

2023 1155 引用

Trace is the Next AutoDiff: Generative Optimization with Rich Feedback, Execution Traces, and LLMs

Ching-An Cheng, Allen Nie, Adith Swaminathan

2024 55 引用 查看解读 →

AlphaEvolve: A coding agent for scientific and algorithmic discovery

Alexander Novikov, Ngân V˜u, Marvin Eisenberger 等

2025 721 引用 查看解读 →

GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning

Lakshya A. Agrawal, Shangyin Tan, Dilara Soylu 等

2025 287 引用 查看解读 →

Large Language Models as Optimizers

Chengrun Yang, Xuezhi Wang, Yifeng Lu 等

2023 1009 引用 查看解读 →

Stop Comparing LLM Agents Without Disclosing the Harness

Yunbei Zhang, Janet Wang, Yingqiang Ge 等

2026 7 引用 查看解读 →

LLM-AutoDiff: Auto-Differentiate Any LLM Workflow

Li Yin, Zhangyang Wang

2025 20 引用 查看解读 →

SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

Carlos E. Jimenez, John Yang, Alexander Wettig 等

2023 3260 引用 查看解读 →

MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering

Jun Shern Chan, Neil Chowdhury, Oliver Jaffe 等

2024 330 引用 查看解读 →