HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution

TL;DR

HarnessBank通过语义基因库搜索和门控验证实现代理工具自我进化,性能提升5.1%-15.4%。

cs.CL 🔴 高级 2026-07-15 4 次浏览
Xiaotian Luo Dizhan Xue Fengxingyu Wang Chuanrui Hu Yafeng Deng
大语言模型 代理工具 自我进化 语义搜索 性能验证

核心发现

方法论

HarnessBank是一种代理工具自我进化框架,结合任务代理和进化代理,通过迭代故障诊断、工具生成和进化验证来优化代理性能。框架维护一个高性能工具的语义基因库,并引入门控工具筛选机制以提高筛选效率。

关键结果

  • 在七个代理基准测试中,HarnessBank的性能提升范围为5.1%到15.4%,证明了其在不同模型上的自我进化能力,而不是依赖于通用的最优工具。
  • 跨模型实验验证了改进来自于模型特定的自我进化过程,而非通用最优工具。
  • 门控工具筛选机制有效降低了评估大量后代工具的成本。

研究意义

HarnessBank通过自动化进化代理工具,解决了传统手工工程难以扩展的问题。它为代理性能提升提供了新的路径,减少了搜索崩溃和任务特定过拟合的风险,具有广泛的学术和工业应用价值。

技术贡献

与现有方法相比,HarnessBank提供了结构化的探索和验证机制,避免了贪婪搜索导致的崩溃。它通过语义基因库和门控筛选机制,确保了工具进化的可靠性和多样性。

新颖性

HarnessBank首次提出了语义基因库和门控验证机制,区别于现有的贪婪搜索方法,提供了更可靠的代理工具进化路径。

局限性

  • 在某些任务上,工具进化可能过度依赖特定的训练数据,导致测试集上的性能提升有限。
  • 门控筛选机制在某些情况下可能无法完全过滤掉无效工具。

未来方向

未来研究可以探索如何进一步优化工具进化过程中的筛选机制,并扩展到更多的应用领域,以提高代理的适应性和鲁棒性。

AI 总览摘要

HarnessBank是一种创新的代理工具自我进化框架,旨在解决现有方法中贪婪候选选择和噪声自反馈导致的搜索崩溃和任务特定过拟合问题。通过引入语义基因库和门控工具筛选机制,HarnessBank能够有效筛选高质量工具,降低评估成本,并在七个代理基准测试中实现了5.1%到15.4%的性能提升。

该框架通过任务代理和进化代理的结合,实现了迭代故障诊断、工具生成和进化验证。语义基因库保存了不同语义坐标的高性能工具,支持工具的重新发明、重组和筛选。门控工具筛选机制通过四个顺序门有效过滤掉无效工具,确保了工具进化的可靠性。

HarnessBank的创新在于其结构化的探索和验证机制,避免了贪婪搜索导致的崩溃。它为代理性能提升提供了新的路径,减少了搜索崩溃和任务特定过拟合的风险,具有广泛的学术和工业应用价值。未来研究可以探索如何进一步优化工具进化过程中的筛选机制,并扩展到更多的应用领域,以提高代理的适应性和鲁棒性。

深度分析

研究背景

大语言模型(LLMs)已经从被动文本生成器发展为能够解决长期任务的自主代理的推理核心。代理工具是围绕LLM的可执行框架,将其转化为任务执行代理。现有工作通常单独优化工具组件,如提示、工具、内存或工作流。

核心问题

现有的代理工具开发通常依赖于手工工程,难以随着模型、工具和应用环境的快速演变而扩展。贪婪搜索方法容易导致搜索崩溃和任务特定过拟合,难以验证性能提升。

核心创新

HarnessBank通过语义基因库和门控工具筛选机制,提供了结构化的探索和验证路径。语义基因库保存了不同语义坐标的高性能工具,支持工具的重新发明和重组。门控工具筛选机制通过四个顺序门有效过滤掉无效工具。

方法详解

  • �� 任务代理执行当前工具下的环境任务。
  • �� 进化代理分析执行轨迹,诊断故障机制,生成后代工具。
  • �� 语义基因库保存高性能工具,支持工具的重新发明和重组。
  • �� 门控工具筛选机制通过四个顺序门有效过滤掉无效工具。

实验设计

实验在七个领域进行,包括Terminal-Bench-2和EvoAgentBench中的五个基准测试。所有实验仅进化工具,冻结基础模型。主要指标是每个任务的成功率(Pass@1),平均每个任务三次尝试。

结果分析

在七个代理基准测试中,HarnessBank的性能提升范围为5.1%到15.4%。跨模型实验验证了改进来自于模型特定的自我进化过程,而非通用最优工具。门控工具筛选机制有效降低了评估大量后代工具的成本。

应用场景

HarnessBank可以用于自动化代理工具开发,减少手工工程的成本,提高代理在不同应用领域的适应性和鲁棒性。它在学术和工业界具有广泛的应用价值。

局限与展望

在某些任务上,工具进化可能过度依赖特定的训练数据,导致测试集上的性能提升有限。门控筛选机制在某些情况下可能无法完全过滤掉无效工具。未来研究可以探索如何进一步优化工具进化过程中的筛选机制。

通俗解读 非专业人士也能看懂

想象一个厨房,厨师需要根据不同的食材和菜谱来调整烹饪工具。传统方法就像厨师手动调整工具,而HarnessBank就像一个智能助手,能够自动分析菜谱和食材,推荐最佳工具组合。这样不仅节省了时间,还提高了菜品的质量。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,需要不断升级你的装备才能打败更强的敌人。HarnessBank就像一个智能助手,帮你自动分析游戏中的弱点,推荐最佳装备组合。这样你就能轻松升级,打败敌人!是不是很酷?

术语表

大语言模型 (LLM)

一种能够生成和理解自然语言的人工智能模型。

用于代理的推理核心。

代理工具

围绕LLM的可执行框架,将其转化为任务执行代理。

包括提示、工具接口、控制循环等。

语义基因库

保存高性能工具的数据库,支持工具的重新发明和重组。

用于工具进化过程中的筛选和保存。

门控工具筛选

通过四个顺序门有效过滤掉无效工具的机制。

用于提高工具筛选的效率和可靠性。

进化代理

分析执行轨迹,诊断故障机制,生成后代工具的代理。

与任务代理结合实现工具自我进化。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化工具进化过程中的筛选机制,以提高代理的适应性和鲁棒性。
  • 2 在更多应用领域扩展工具进化框架的可能性。

应用场景

近期应用

自动化代理工具开发

减少手工工程的成本,提高代理在不同应用领域的适应性和鲁棒性。

远期愿景

广泛应用于学术和工业界

HarnessBank在学术和工业界具有广泛的应用价值,能够提高代理性能。

原文摘要

Large Language Models (LLMs) have enabled capable agents across diverse applications. Beyond the foundation model, the performance of an agent is governed by the surrounding agent harness, including prompts, tools, control loops, etc. Automatically evolving this harness offers a promising pathway to agent improvement, yet existing approaches typically rely on greedy candidate selection and noisy self-generated feedback, rendering their gains susceptible to search collapse, task-specific overfitting, and poor verifiability. To tackle these challenges, we introduce HarnessBank, a trustworthy agent-harness self-evolution framework that pairs a task agent with a separate evolver agent for iterative failure diagnosis, harness generation, and evolution verification. HarnessBank maintains a Harness Gene Bank composed of high-performing harnesses of different semantic coordinates. Those harnesses are reinvented, recombined, screened, and selected during the self-evolution procedure. Moreover, we propose a Gated Harness Screening mechanism to efficiently filter high-quality harnesses and reduce the cost of evaluating numerous offspring harnesses. Across seven agent benchmarks, HarnessBank produces consistent performance improvements from 5.1% to 15.4%. Cross-model experiments further verify that the improvements come from the model-specific self-evolving process, instead of a universally optimal harness. Our code will be publicly available upon acceptance.

cs.CL