EXG: Self-Evolving Agents with Experience Graphs

TL;DR

EXG通过经验图实现自进化代理,在线任务性能提升150%,离线效率提高45.7%。

cs.AI 🔴 高级 2026-05-18 26 次浏览
Yuxin Jin Siyuan Zhang Hanchen Wang Lu Qin Ying Zhang Wenjie Zhang
自进化代理 经验图 大语言模型 代码生成 推理优化

核心发现

方法论

EXG通过经验图将代理的成功和失败案例结构化为节点,并通过关系边连接任务关联、语义相似性和错误修正。它支持在线实时经验重用和离线作为外部记忆模块。

关键结果

  • 在线实验中,EXG在代码生成任务的pass@1提高150%,pass@2提高30%。
  • 离线实验中,EXG减少了45.7%的LLM调用,推理延迟降低30.5%。
  • 消融实验表明经验图的语义边和修正边显著提升了任务性能。

研究意义

EXG解决了现有代理行为静态的问题,提供了一个统一框架来组织和重用经验。这种方法不仅提高了任务解决质量,还显著降低了计算成本,为大规模部署提供了可能。

技术贡献

EXG首次提出经验图作为自进化代理的核心机制,整合了在线和离线的经验重用,同时提供了模块化的插件设计,支持现有代理架构的无缝集成。

新颖性

EXG是首个将经验结构化为图的框架,突破了传统反思和非结构化记忆的局限,提供了跨任务经验重用的统一解决方案。

局限性

  • EXG对图构建的依赖可能在高频任务中增加存储开销。
  • 语义相似性计算需要高质量的嵌入模型,可能限制其通用性。

未来方向

未来研究可探索经验图在动态任务环境中的适应性,并优化图的构建和检索效率以支持更大规模的应用。

AI 总览摘要

EXG通过经验图解决了自进化代理在任务间无法重用经验的问题。该框架将代理的成功和失败案例结构化为节点,并通过关系边连接任务关联、语义相似性和错误修正。

实验表明,EXG在代码生成和推理任务中显著提升了性能,在线任务的pass@1提高了150%,离线任务的LLM调用减少了45.7%。此外,EXG的模块化设计支持现有代理的无缝集成。

尽管EXG在存储开销和嵌入质量方面存在一定局限,但其统一的经验组织框架为自进化代理的研究和应用提供了重要基础。未来研究可进一步优化图构建效率并探索动态任务环境中的应用。

深度分析

研究背景

近年来,大语言模型(LLM)推动了代理在复杂推理和问题解决中的应用。然而,现有代理通常行为静态,无法系统性地从过去的任务中学习经验。这导致重复错误和计算成本增加。

核心问题

现有自进化方法要么局限于单任务反思,要么依赖非结构化记忆,难以实现跨任务经验重用。缺乏统一框架来组织和利用经验是关键瓶颈。

核心创新

EXG提出经验图框架,通过结构化节点和关系边实现经验组织。它支持在线实时经验重用和离线作为外部记忆模块,突破了现有方法的局限。

方法详解

  • �� 将任务尝试抽象为结构化案例节点。
  • �� 构建经验图,节点表示案例,边表示任务关联、语义相似性和错误修正。
  • �� 在线检索相关案例并构建经验提示。
  • �� 离线重用经验图作为外部记忆模块。

实验设计

实验使用HumanEval、EvalPlus等数据集,评估EXG在代码生成和推理任务中的性能。对比基线包括反思和非结构化记忆方法,指标为pass@1、LLM调用次数等。

结果分析

EXG在在线任务中pass@1提高150%,离线任务中LLM调用减少45.7%。消融实验表明语义边和修正边显著提升了任务性能。

应用场景

EXG可用于代码生成、复杂推理等领域,适合需要跨任务经验重用的场景,如自动化编程助手和智能问答系统。

局限与展望

EXG对存储和嵌入质量的依赖可能限制其在动态任务环境中的应用。未来可优化图构建效率并探索更通用的嵌入模型。

通俗解读 非专业人士也能看懂

想象一个厨师在厨房里不断改进菜谱。每次尝试新的菜式,厨师都会记录成功的配方和失败的原因。这些记录被整理成一本菜谱,其中每个菜谱条目都有相关的提示,比如哪些配料搭配效果好,哪些错误需要避免。EXG就像这本菜谱,帮助代理在每次任务中学习并改进。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,每次失败后,游戏都会告诉你哪里出了问题,并给你一些提示,比如“试试这个武器”或者“避开这个陷阱”。EXG就像游戏里的攻略助手,记录你的每次尝试,并在下次任务中给你更好的建议,让你变得越来越厉害!

术语表

经验图 (Experience Graph)

一种结构化图,用于组织代理的任务经验,包括节点和关系边。

用于在线和离线任务经验重用。

任务锚点节点 (Task Anchor Node)

经验图中的一种节点,用于组织同一任务的所有案例。

连接任务案例节点。

语义相似边 (Similarity Edge)

经验图中的一种边,表示两个案例的语义相似性。

用于跨任务经验检索。

修正边 (Correction Edge)

经验图中的一种边,表示一个案例修正了另一个案例的错误。

用于捕捉错误修正关系。

pass@1

一种评估指标,表示首次尝试的成功率。

用于代码生成任务性能评估。

开放问题 这项研究留下的未解疑问

  • 1 如何优化经验图的存储效率以支持动态任务环境?
  • 2 如何提升语义相似性计算的质量以增强跨任务重用能力?

应用场景

近期应用

代码生成助手

通过经验图优化代码生成任务,减少重复错误并提高效率。

智能问答系统

在多轮问答中重用经验提示,提高回答质量。

远期愿景

动态任务环境中的自进化

支持复杂动态任务场景中的实时经验学习,推动通用人工智能发展。

原文摘要

Large language model (LLM)-based agents have demonstrated strong capabilities in complex reasoning and problem solving through multi-step interactions, yet most deployed agents remain behaviorally static, with knowledge acquired during execution rarely translating into systematic improvement over time. In response, a growing line of work on self-evolving agents explores how agents can improve through experience during deployment, but most existing approaches either rely on ad hoc reflection limited to single-task correction or adopt unstructured memory that accumulates fragmented experience with delayed usability. To address this limitation, we introduce EXG, an experience graph framework for self-evolving agents that explicitly organizes accumulated successes and failures into a structured, relational representation. EXG is the first experience graph designed for self-evolving agents, supporting both online, real-time graph growth during execution for immediate cross-task experience reuse, and offline reuse of a consolidated experience graph as an external memory module. This design also enables EXG to serve as a plug-and-play component for existing self-evolving agents, organizing prior experience into a unified experience graph and improving both solution quality and resource efficiency as deployment progresses. Extensive experiments across code generation and reasoning benchmarks show that EXG attains more favorable performance-efficiency trade-offs than reflection- and memory-based baselines in both online and offline evaluations. Our results suggest that structuring experience as a graph provides a principled foundation for scalable and transferable self-evolving agent behavior.

cs.AI