EvoHarnessBench: Can Your Agents Keep Pace with an Evolving Harness?

TL;DR

EVOHARNESSBENCH评估代理在不断发展的工具、技能、代理环境中表现,揭示性能下降与适应性不足。

cs.MA 🔴 高级 2026-09-03 1 次浏览
Zixuan Ke Vaidehi Patil Haizhou Shi Yang Li Ye Liu Sarath Shekkizhar Anurag Koul Jiayu Wang Xuan Phi Nguyen Semih Yavuz Mohit Bansal Shafiq Joty
强化学习 持续学习 代理系统 工具演化 技能适应

核心发现

方法论

EVOHARNESSBENCH通过17个多阶段工具流来评估代理在工具、技能和代理的演化中表现。使用两种评估模式:部署评估和自适应评估,分别测试代理在工具扩展中的保留能力和适应新能力的能力。

关键结果

  • 结果1:工具扩展导致性能下降,部署评估中工具、技能、代理的表现分别下降12.1%、13.8%、46.4%。
  • 结果2:自适应评估中,技能适应性下降最大(-3.3%),工具次之(-2.2%),代理最小(-1.2%)。
  • 结果3:保留与适应存在矛盾,保留早期能力不一定提高对新能力的适应。

研究意义

该研究揭示了在不断变化的工具环境中,代理系统面临的挑战。它强调了在工具、技能和代理演化过程中,保持先前能力与适应新能力之间的平衡对于构建高效代理系统的重要性。

技术贡献

EVOHARNESSBENCH首次将工具演化作为非平稳性源头,系统地评估代理在外部工具扩展中的表现,提供了新的评估框架和工具。

新颖性

EVOHARNESSBENCH是首个将工具、技能和代理的演化作为评估重点的基准,区别于传统的任务流非平稳性。

局限性

  • 局限1:工具扩展导致的遗忘现象在不同环境下表现不一致,可能需要更细致的适应策略。
  • 局限2:自适应评估的收益在不同阶段和环境中不稳定。

未来方向

未来研究可以探索更有效的自适应策略,以提高在工具演化中的性能,并研究如何更好地平衡保留与适应。

AI 总览摘要

现代基于LLM的代理系统依赖于工具、技能和专家代理的组合,这些组合不断变化,影响代理的观察和执行能力。EVOHARNESSBENCH通过17个多阶段工具流,系统地评估代理在工具、技能和代理演化中的表现。研究发现,工具扩展会导致性能下降,尤其是在技能和代理方面。自适应评估显示,虽然积累的经验可以在某些情况下提高性能,但在不同阶段和环境中表现不一致。研究强调了在工具演化中保持先前能力与适应新能力之间的平衡的重要性。未来的研究方向包括探索更有效的自适应策略,以提高代理在不断变化的工具环境中的表现。

深度分析

研究背景

在现代人工智能领域,代理系统不仅依赖于模型和提示,还依赖于工具、技能和专家代理的组合。这些组合不断变化,影响代理的观察和执行能力。现有的持续学习基准通常将非平稳性放在任务流中,而保持工具组合不变。

核心问题

核心问题在于代理能否在工具、技能和代理不断演化的环境中保持其能力。随着新工具的引入,代理需要在更大的工具池中操作,这可能导致遗忘现象。

核心创新

EVOHARNESSBENCH通过将工具演化作为非平稳性源头,首次系统地评估代理在外部工具扩展中的表现。它构建了17个多阶段工具流,包含802个任务,520个工具,42个技能和62个代理。

方法详解

  • �� 使用17个多阶段工具流评估代理表现
  • �� 部署评估:测试代理在工具扩展中的保留能力
  • �� 自适应评估:测试代理在新能力引入时的适应能力
  • �� 评估工具、技能和代理的演化对代理表现的影响

实验设计

实验设计包括使用EVOHARNESSBENCH中的17个工具流,评估代理在工具、技能和代理演化中的表现。使用两种评估模式:部署评估和自适应评估,分别测试代理在工具扩展中的保留能力和适应新能力的能力。

结果分析

实验结果表明,工具扩展会导致性能下降,尤其是在技能和代理方面。自适应评估显示,虽然积累的经验可以在某些情况下提高性能,但在不同阶段和环境中表现不一致。

应用场景

EVOHARNESSBENCH可用于评估和改进代理在不断变化的工具环境中的表现,适用于需要持续学习和适应的复杂系统,如自动驾驶和智能家居。

局限与展望

研究的局限性在于工具扩展导致的遗忘现象在不同环境下表现不一致,可能需要更细致的适应策略。此外,自适应评估的收益在不同阶段和环境中不稳定。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,厨房里有各种各样的工具和食材。随着时间的推移,你的厨房里不断增加新的工具和食材。你需要学习如何使用这些新工具来做出更好的菜肴,同时还要记住如何使用旧工具。EVOHARNESSBENCH就像是在测试你在这种不断变化的厨房环境中,能否继续做出美味的菜肴,并适应新的工具和食材。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,游戏中有很多关卡,每个关卡都有不同的工具和技能。随着游戏的进行,你会解锁新的工具和技能,但也要记住之前学过的东西。EVOHARNESSBENCH就像是在测试你在这个游戏中,能否在解锁新技能的同时,不忘记之前的技能。

术语表

工具演化

指工具、技能和代理在系统中不断变化和扩展的过程。

在EVOHARNESSBENCH中,工具演化是非平稳性的来源。

部署评估

测试代理在工具扩展中的保留能力,不进行自适应学习。

用于评估代理在工具扩展中的直接表现。

自适应评估

测试代理在新能力引入时的适应能力,允许自适应学习。

用于评估代理在工具演化中的适应能力。

遗忘现象

指代理在工具扩展后,之前解决任务的能力下降。

在工具演化中,遗忘现象是一个主要挑战。

持续学习

指代理在不断变化的环境中,持续学习和适应的能力。

EVOHARNESSBENCH测试代理的持续学习能力。

开放问题 这项研究留下的未解疑问

  • 1 如何在工具演化中更好地平衡保留与适应?现有方法在不同环境中的表现不一致。
  • 2 如何设计更有效的自适应策略,以提高在工具演化中的性能?

应用场景

近期应用

智能家居

在智能家居中,系统需要不断适应新设备和功能,以提高用户体验。EVOHARNESSBENCH可以帮助评估和改进这种适应能力。

远期愿景

自动驾驶

自动驾驶系统需要在不断变化的道路和交通环境中保持高效。EVOHARNESSBENCH的研究可以为这种系统的持续学习和适应提供指导。

原文摘要

Modern LLM-based agents operate through a harness of tools, reusable skills, and specialist agents that shapes what they observe and what they can do. In practice, this harness continually evolves as new capabilities are added. We introduce EVOHARNESSBENCH, a benchmark for evaluating agents under controlled harness evolution across three axes (tools, skills, and agents). Unlike existing continual-learning benchmarks for agents, which typically place non-stationarity (i.e., what changes over time) in the task stream while keeping the harness fixed, EVOHARNESSBENCH places non-stationarity in the externally supplied harness itself. It contains 17 multi-stage harness streams constructed deterministically from verifier-based benchmarks, comprising 802 tasks, 520 tools, 42 skills, and 62 agents. We evaluate two complementary settings corresponding to the central challenges of harness evolution: deployment evaluation, which isolates retention of previously accessible competence as the harness expands, and self-evolving adaptation evaluation, which tests whether accumulated experience remains useful as new capabilities are introduced. Our results reveal three persistent gaps. First, harness expansion alone can degrade performance on previously solved tasks, producing harness-induced forgetting. Second, gains from self-evolving adaptation remain inconsistent across stages of harness evolution, capability axes, and environments. Third, retention and adaptation can pull in different directions: preserving earlier competence does not necessarily improve adaptation to newly introduced capabilities, and vice versa. These results establish harness evolution as a distinct challenge for building agents that can keep pace with an evolving harness while preserving previously effective behavior.

cs.MA cs.CL