Ask Only When Needed: Proactive Retrieval from Memory and Skills for Experience-Driven Lifelong Agents

TL;DR

提出ProactAgent框架,通过EXPONEVO和PROACTRL实现主动记忆检索,在SciWorld上成功率提升32%,交互轮数减少33%。

cs.CL 🔴 高级 2026-04-22 34 次浏览
Yuxuan Cai Wei Li Jie Zhou Qin Chen Xin Li Bo Zhang Liang He
终身学习 强化学习 记忆检索 经验优化 人工智能

核心发现

方法论

ProactAgent框架结合EXPONEVO和PROACTRL。EXPONEVO通过记忆精炼和策略优化,动态更新经验库。PROACTRL将检索建模为策略动作,通过分支奖励学习何时及如何检索。

关键结果

  • 在SciWorld上成功率提升至73.5%,比GRPO+Reflexion高18个百分点,交互轮数减少33.2%。
  • 在AlfWorld上成功率达71.28%,交互轮数减少22.5%。
  • 在StuLife上接近专有模型性能,StuGPA达到19.26。

研究意义

该研究解决了现有方法中被动检索的局限性,显著提升了终身学习代理在长时间任务中的效率和成功率,为跨任务知识利用提供了新思路。

技术贡献

首次将检索建模为强化学习策略动作,提出分支奖励机制,结合记忆和策略的联合演化,显著提升了终身学习代理的性能和效率。

新颖性

首次提出主动检索策略,区别于传统被动检索方法,通过分支奖励机制实现逐步监督,显著提升了检索效率和任务成功率。

局限性

  • 需要高质量的初始经验库,冷启动阶段依赖监督学习。
  • 在复杂任务中可能存在检索延迟问题。
  • 对经验库的存储和计算需求较高。

未来方向

未来可优化检索效率,探索更复杂任务场景下的性能,并研究如何减少经验库的存储和计算成本。

AI 总览摘要

ProactAgent是一种新型终身学习框架,旨在解决在线学习代理在长时间任务中如何主动利用过往经验的问题。

通过EXPONEVO模块,ProactAgent实现了记忆和策略的联合演化,将过去的交互经验组织为事实、情节和技能库,并动态优化。PROACTRL模块则将检索建模为策略动作,通过分支奖励机制学习何时及如何检索,确保检索仅在提高任务效率或结果时触发。

实验结果表明,ProactAgent在SciWorld、AlfWorld和StuLife三大基准上显著优于现有方法,成功率提升至73.5%,交互轮数减少33%。该框架为终身学习代理的主动知识利用提供了新方向,同时也揭示了未来在检索效率和复杂任务适应性上的研究潜力。

深度分析

研究背景

终身学习代理需要在连续任务中积累经验并动态适应。然而,现有方法多为被动检索,无法主动识别知识缺口,导致效率低下。

核心问题

当前方法在任务动态变化时无法灵活检索相关经验,且记忆更新与策略优化相互独立,限制了终身学习的潜力。

核心创新

ProactAgent通过主动检索策略和记忆策略联合演化解决了上述问题。EXPONEVO动态优化记忆库和策略,PROACTRL通过分支奖励机制实现逐步监督,提升了检索的精确性和效率。

方法详解

  • �� EXPONEVO:将经验分为事实、情节和技能库,动态更新记忆和策略。
  • �� PROACTRL:将检索建模为策略动作,通过分支奖励机制学习检索时机和内容。
  • �� 经验库:采用类型化存储,结合相似性和优先级评分返回相关经验。

实验设计

在SciWorld、AlfWorld和StuLife上进行实验,使用Qwen2.5-7B-Instruct模型,比较了多种基线方法,并进行了消融实验验证。

结果分析

ProactAgent在SciWorld上成功率达73.5%,交互轮数减少至18.38;在AlfWorld上成功率达71.28%,交互轮数减少至12.73;在StuLife上接近专有模型性能。

应用场景

适用于需要跨任务知识利用的场景,如教育助手、智能客服和长期任务规划。

局限与展望

对初始经验库质量要求高,复杂任务中可能存在检索延迟,经验库存储和计算成本较高。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,冰箱里有很多食材。ProactAgent就像一个聪明的助手,知道什么时候需要从冰箱拿出特定食材,而不是每次都打开冰箱看一遍。这样既节省时间,也避免了浪费。

简单解释 像给14岁少年讲一样

想象你在玩一个解谜游戏,游戏里有个宝箱,里面有各种道具。ProactAgent就像一个聪明的队友,它会告诉你什么时候打开宝箱拿道具,而且每次都能拿到最有用的那个!是不是很酷?

术语表

ProactAgent (主动代理)

一种终身学习框架,通过主动检索和经验优化提升任务效率和成功率。

用于解决长时间任务中的知识利用问题。

EXPONEVO (经验增强在线演化)

动态优化记忆和策略的模块,组织经验为类型化存储。

用于记忆精炼和策略更新。

PROACTRL (主动强化学习检索)

将检索建模为策略动作,通过分支奖励机制学习检索时机和内容。

用于提升检索效率和准确性。

分支奖励 (Paired-branch process rewards)

通过比较有检索和无检索分支的结果差异,提供逐步监督。

用于优化检索决策。

经验库 (Experience Base)

存储事实、情节和技能的结构化数据库。

为代理提供检索支持。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂的任务中优化检索效率?
  • 2 如何减少经验库的存储和计算成本?
  • 3 如何在无监督环境中实现冷启动?

应用场景

近期应用

教育助手

帮助学生动态检索学习资料,提升学习效率。

智能客服

根据用户问题主动检索相关信息,提供精准解答。

远期愿景

长期任务规划

支持机器人在复杂任务中动态适应和优化决策。

原文摘要

Online lifelong learning agents must decide not only how to act but also when to consult prior experience to continually improve on long-horizon tasks. Existing methods typically retrieve memories passively, such as at task initialization or after each step, and therefore miss knowledge gaps that arise during interaction. We propose ProactAgent, an experience-driven lifelong learning framework for proactive retrieval over a structured Experience Base. ProactAgent continually improves through ExpOnEvo, which jointly updates policies and refines memory, organizing past interactions into factual, episodic, and skill repositories. It further introduces ProactRL, which treats retrieval as an explicit policy action and learns when and what to retrieve. By comparing paired continuations from identical interaction prefixes with and without retrieval, ProactRL provides step-level process rewards that encourage retrieval only when it improves task outcomes or efficiency. Experiments on SciWorld, AlfWorld, and StuLife show that ProactAgent consistently outperforms all baselines, achieving up to 32% relative improvement in success rate and over 33% reduction in interaction rounds. Our code will be publicly available at GitHub.

cs.CL