EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer

TL;DR

EvoAgentBench通过能力转移评估代理自我进化,涵盖四个领域,揭示自动方法的局限性。

cs.AI 🔴 高级 2026-07-06 26 次浏览
Xingze Gao Chuanrui Hu Hongda Chen Pengfei Yao Zhao Wang Yi Bai Zhengwei Wu Yunyun Han Xiaofeng Cong Jie Gui Yafeng Deng Teng Li
人工智能 自我进化 能力转移 基准测试 长时任务

核心发现

方法论

EvoAgentBench通过从代理执行中提取能力,构建领域特定的能力图,评估代理在四个领域的自我进化能力。每个测试任务都有经过验证的训练侧能力支持,确保能力转移的有效性。

关键结果

  • Anchor方法在所有模型中实现了正向转移,Qwen3.5-397B的平均增益为10.5%。
  • 自动方法如Memento在某些设置中表现不佳,甚至导致性能下降。
  • 能力内容在不同模型家族间具有可转移性,Anchor方法在所有测试单元中均表现出正向增益。

研究意义

该研究通过引入EvoAgentBench,提供了一种新的评估代理自我进化的方法,填补了现有基准测试无法有效评估能力转移的空白。这对于提高代理的可靠性和效率具有重要意义。

技术贡献

EvoAgentBench通过能力图实现了对代理自我进化的细粒度诊断,区别于传统的任务准确性比较。它为自动方法提供了一个诊断参考,帮助识别能力提取和路由中的问题。

新颖性

EvoAgentBench首次将能力转移作为评估代理自我进化的核心,区别于以往的任务或记忆基准测试。它通过能力图实现了跨任务的程序级转移测量。

局限性

  • 自动方法在某些设置中表现不稳定,可能导致负向转移。
  • 当前自动方法在所有设置中均未能实现持续的正向增益。
  • 能力提取和路由的准确性依赖于人工标注。

未来方向

未来的研究可以探索更精确的自动能力提取和路由方法,以及如何在更广泛的领域中应用EvoAgentBench。

AI 总览摘要

EvoAgentBench是一个用于评估代理自我进化的新基准测试,专注于能力转移。现有的评估方法通常无法有效隔离和测量这种能力转移。EvoAgentBench通过在四个领域中提取和标准化能力,构建能力图来实现这一目标。

在实验中,EvoAgentBench展示了能力内容在不同模型家族间的可转移性,尤其是在Anchor方法中表现出色。然而,自动方法如Memento和ReasoningBank在某些设置中表现不佳,甚至导致性能下降。

该研究的意义在于它为代理自我进化提供了一种新的评估框架,能够更好地诊断经验编码和能力路由中的问题。这对于提高代理在长时任务中的可靠性和效率具有重要意义。未来的研究可以进一步优化自动能力提取和路由方法。

深度分析

研究背景

随着大模型在长时任务中的应用增加,代理自我进化的重要性日益凸显。现有的基准测试通常关注单次任务解决或信息记忆,而忽略了程序级的能力转移。EvoAgentBench通过能力图实现了对代理自我进化的细粒度诊断。

核心问题

现有的评估方法无法有效隔离和测量代理的能力转移。任务基准测试仅测试单次任务解决,记忆基准测试则关注信息保留,而非程序复用。

核心创新

EvoAgentBench通过从代理执行中提取能力,构建领域特定的能力图,实现了跨任务的程序级转移测量。每个测试任务都有经过验证的训练侧能力支持。

方法详解

  • �� 从代理执行中提取能力,标准化为操作单元
  • �� 构建领域特定的能力图,连接共享程序的任务
  • �� 确保每个测试任务都有训练侧能力支持
  • �� 使用多种模型和框架进行实验验证

实验设计

在528/267的训练/测试分割中,使用两种框架和三种模型进行实验。结果显示,Anchor方法在所有模型中实现了正向转移,而自动方法在某些设置中表现不佳。

结果分析

Anchor方法在所有测试单元中均表现出正向增益,Qwen3.5-397B的平均增益为10.5%。自动方法如Memento在某些设置中表现不佳,甚至导致性能下降。

应用场景

EvoAgentBench可用于评估代理在长时任务中的自我进化能力,帮助开发更可靠和高效的智能代理。

局限与展望

自动方法在某些设置中表现不稳定,可能导致负向转移。能力提取和路由的准确性依赖于人工标注,未来需要探索更精确的自动方法。

通俗解读 非专业人士也能看懂

想象一个工厂,工人们在不同的生产线上工作。每条生产线都有特定的步骤和工具。EvoAgentBench就像是一个新的管理系统,它不仅记录每个工人的工作步骤,还能提取出哪些步骤是可以重复使用的。这样,当有新的订单进来时,工厂可以更快地完成生产,因为他们知道哪些步骤可以直接使用,而不是从头开始。这个系统帮助工厂提高了效率,减少了错误。

简单解释 像给14岁少年讲一样

想象你在玩一个很复杂的游戏,每次过关都要重新学一遍技能。EvoAgentBench就像一个超级攻略,它能帮你记住哪些技能可以在不同关卡中重复使用。这样你就不用每次都从头学起,可以更快地通关!不过,有时候攻略也会出错,所以我们还在努力改进它,让它变得更聪明。

术语表

能力转移 (Ability Transfer)

从一个任务中学到的技能或知识应用到另一个任务中的过程。

在EvoAgentBench中用于评估代理的自我进化能力。

能力图 (Ability Graph)

一种图结构,节点代表任务,边表示共享的可复用能力。

用于连接共享程序的任务,实现程序级转移测量。

自我进化 (Self-Evolution)

代理通过学习和应用过去的经验来提高未来任务表现的过程。

EvoAgentBench的核心评估目标。

自动方法 (Automatic Methods)

无需人工干预的能力提取和路由方法。

在实验中与Anchor方法进行对比。

负向转移 (Negative Transfer)

能力转移导致任务表现下降的现象。

在某些自动方法中观察到的现象。

开放问题 这项研究留下的未解疑问

  • 1 如何提高自动方法的能力提取和路由准确性?
  • 2 在更广泛的领域中应用EvoAgentBench的挑战是什么?

应用场景

近期应用

智能代理优化

通过评估和优化代理的自我进化能力,提高其在长时任务中的表现。

远期愿景

通用人工智能

通过能力转移实现更高效的学习和适应,推动通用人工智能的发展。

原文摘要

Agent self-evolution in long-horizon LLM systems is largely procedural: useful experience is not merely stored information, but reusable procedures for searching, debugging, and verification. Yet current evaluations do not isolate this form of transfer. Agent benchmarks test single-episode task solving; memory benchmarks target information retention rather than procedural reuse. We introduce EvoAgentBench, a benchmark for agent self-evolution via Ability-guided transfer across four agentic domains: web research, algorithmic reasoning, software engineering, and knowledge work. EvoAgentBench extracts trace-grounded Abilities from agent executions, canonicalizes them into operational units, and builds domain-specific Ability Graphs linking tasks that share procedural overlap. By design, every test task is backed by verified training-side Ability support. Across a 528/267 train/test split, two scaffolds, and three backbones, curated Ability content transfers reliably across model families, but no current automatic method sustains positive gain in all settings. EvoAgentBench shifts self-evolution evaluation from aggregate accuracy comparison to fine-grained diagnosis of experience encoding, routing, and uptake. The benchmark is publicly available at https://huggingface.co/datasets/EverMind-AI/EvoAgentBench.

cs.AI