HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?

TL;DR

HarnessDev评估LLM创建和改进执行基础设施的能力,显示在写作和机器学习实验中表现优于人类参考。

cs.SE 🔴 高级 2026-09-01 4 次浏览
Yuhao Wu Jingyuan Zhang Jiajun Shi Xinping Lei Qingshui Gu Yuxuan Zhang Zexuan Wang Chen He Chen Huang Maojia Song Zhiyuan Zeng Shaowen Wang Jinkai Liu Yunfeng Shi Jiaheng Liu Shen Yan Wenhao Huang Ge Zhang Wenxuan Zhang
LLM 执行基础设施 自动化 机器学习 性能评估

核心发现

方法论

HarnessDev通过两个阶段评估LLM的执行基础设施开发能力:创建和进化。在创建阶段,模型从一个弱的种子开始,构建完整的执行系统。在进化阶段,模型从自己创建的基础设施出发,通过下游执行反馈不断改进。评估指标包括任务成功率和执行代币成本。

关键结果

  • 在写作和机器学习实验中,生成的基础设施与或超过人类参考,但在代码和搜索任务中仍显不足。
  • 进化阶段的性能提升不稳定,仅部分转移到未见任务上。
  • 实验表明,性能提升强烈依赖于执行基础设施的模型,跨模型转移有限。

研究意义

该研究通过引入HarnessDev基准,首次系统性地评估了LLM在创建和改进执行基础设施方面的能力。这一能力对于从研究原型到实际应用的过渡至关重要,尤其是在需要持续开发的领域。

技术贡献

HarnessDev提供了一种新的评估框架,专注于可运行基础设施的构建和维护,而非单一任务输出。它强调了模型在执行系统中的角色,并通过两个阶段的评估揭示了模型在不同任务中的表现差异。

新颖性

HarnessDev首次将评估重点从任务输出转向可运行基础设施,填补了现有评估方法的空白,提供了新的视角来理解LLM的系统构建能力。

局限性

  • 生成的基础设施在代码和搜索任务中表现不佳,显示出与成熟人类工程系统的差距。
  • 进化阶段的性能提升不稳定,难以在未见任务中保持一致表现。

未来方向

未来研究可探索如何提高进化阶段的稳定性,以及如何增强模型在不同执行基础设施中的跨模型转移能力。

AI 总览摘要

随着智能体从研究原型转向实际应用,其能力越来越依赖于模型外部的执行基础设施,即所谓的智能体框架。HarnessDev通过两个阶段评估LLM在创建和改进这种基础设施方面的能力。在创建阶段,模型从一个弱的种子开始,构建完整的执行系统。在进化阶段,模型从自己创建的基础设施出发,通过下游执行反馈不断改进。

实验结果显示,生成的基础设施在写作和机器学习实验中表现优于人类参考,但在代码和搜索任务中仍显不足。进化阶段的性能提升不稳定,仅部分转移到未见任务上。实验还表明,性能提升强烈依赖于执行基础设施的模型,跨模型转移有限。

该研究首次系统性地评估了LLM在创建和改进执行基础设施方面的能力,为理解模型在执行系统中的角色提供了新的视角。这一能力对于从研究原型到实际应用的过渡至关重要,尤其是在需要持续开发的领域。未来研究可探索如何提高进化阶段的稳定性,以及如何增强模型在不同执行基础设施中的跨模型转移能力。

深度分析

研究背景

随着智能体从研究原型转向实际应用,其能力越来越依赖于模型外部的执行基础设施。现有的评估方法主要关注任务输出,而忽视了执行基础设施的开发和改进能力。

核心问题

智能体框架的开发和改进是一个复杂的问题,涉及到执行循环、工具使用、上下文管理、故障恢复和结果验证等多个方面。

核心创新

HarnessDev通过两个阶段评估LLM在创建和改进执行基础设施方面的能力,首次将评估重点从任务输出转向可运行基础设施。

方法详解

  • �� 创建阶段:模型从一个弱的种子开始,构建完整的执行系统。
  • �� 进化阶段:模型从自己创建的基础设施出发,通过下游执行反馈不断改进。
  • �� 评估指标:任务成功率和执行代币成本。

实验设计

实验使用六个创建者LLM,涵盖四个领域和五个下游基准,总计2,207个独特的下游实例。评估包括任务成功率和执行代币成本。

结果分析

生成的基础设施在写作和机器学习实验中表现优于人类参考,但在代码和搜索任务中仍显不足。进化阶段的性能提升不稳定,仅部分转移到未见任务上。

应用场景

该研究为理解LLM在执行系统中的角色提供了新的视角,尤其是在需要持续开发的领域。

局限与展望

生成的基础设施在代码和搜索任务中表现不佳,显示出与成熟人类工程系统的差距。进化阶段的性能提升不稳定,难以在未见任务中保持一致表现。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你有一个食谱(智能体框架),它告诉你如何准备和烹饪食材(执行任务)。如果你改变食谱中的步骤(调整框架),即使食材(模型权重)不变,菜肴的味道(任务表现)也会大不相同。HarnessDev就像一个厨师评估系统,评估你能否从头开始创建一个食谱,并在尝试新菜时不断改进它。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你需要建造一个基地来保护自己。这个基地就是你的智能体框架。HarnessDev就像一个游戏评测系统,评估你能否从零开始建造一个基地,并在敌人攻击时不断改进它。即使你的角色(模型)没有变化,基地的设计也会影响你的游戏表现!

术语表

LLM (大型语言模型)

一种能够生成和理解自然语言的大型机器学习模型。

在论文中用于创建和改进执行基础设施。

HarnessDev (框架开发)

一个评估LLM创建和改进执行基础设施能力的基准。

用于评估模型在不同任务中的表现。

执行基础设施

管理执行循环、工具使用、上下文管理、故障恢复和结果验证的软件系统。

智能体能力的关键组成部分。

创建阶段

模型从一个弱的种子开始,构建完整的执行系统。

HarnessDev的第一个评估阶段。

进化阶段

模型从自己创建的基础设施出发,通过下游执行反馈不断改进。

HarnessDev的第二个评估阶段。

开放问题 这项研究留下的未解疑问

  • 1 如何提高进化阶段的稳定性,尤其是在未见任务中的表现。
  • 2 如何增强模型在不同执行基础设施中的跨模型转移能力。

应用场景

近期应用

智能体框架开发

帮助工程师创建和改进智能体框架,提高任务执行效率。

远期愿景

自动化系统设计

通过自动化创建和改进执行基础设施,减少对人类工程师的依赖。

原文摘要

As agents move from research prototypes to deployed tools, their capability increasingly depends on model-external execution infrastructure, commonly termed the agent harness. Changing this harness while holding model weights fixed can substantially alter task performance. Current agent evaluations typically report downstream performance under a chosen harness, leaving a model's ability to develop the harness itself comparatively underexplored. We introduce HarnessDev, a benchmark that shifts the unit of evaluation from task outputs to runnable infrastructure. HarnessDev covers two stages. In Creation, the agent starts from a minimal seed and a small number of cases, then builds a complete execution system. In Evolution, it starts from its own created harness and iteratively revises it using downstream execution feedback, with the goal of improving benchmark performance. We then evaluate each constructed harness on capability (task success on held-out benchmarks) and efficiency (execution-token cost). The reported Creation results cover six creator LLMs, four domains, and five downstream benchmarks totaling 2,207 unique downstream instances, with hidden evaluation tasks withheld from development. We find that generated harnesses remain substantially behind mature human-engineered references on code and on search and research, while matching or exceeding the selected references on writing and machine-learning experimentation, with large variation in execution cost. Evolution produces some performance gains, but they are unstable and transfer only partially to held-out tasks. Experiments with a fixed runtime model further show that the gains depend strongly on the model executing the harness, indicating limited transfer across models.

cs.SE cs.CL