ECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RL

TL;DR

ECHO通过选择性记忆在Agentic RL中实现43.4%准确率,超越GRPO和SUPO。

cs.LG 🔴 高级 2026-06-30 3 次浏览
Zijun Xie Binbin Zheng Enlei Gong Jihua Liu Yuyang You Lingfeng Liu Jiayao Tang Guanqun Zhao Aoqi Hu Zeyu Chen
强化学习 记忆管理 上下文重构 多目标问答 代码生成

核心发现

方法论

ECHO采用选择性轮次记忆框架,通过将每个环境轮次压缩成索引记忆记录,选择有用记录重构策略上下文,并重用选定的源索引将正向结果信用路由到最终轨迹段。该方法在BrowseComp-Plus上表现出色。

关键结果

  • ECHO在BrowseComp-Plus上达到43.4%的持出准确率,显著优于GRPO的28.9%和SUPO的36.1%。
  • ECHO使用的轮次和轨迹体积均少于SUPO,表明其在资源利用上的优势。
  • 在多目标问答、代码生成和深度信息检索基准上,ECHO展示了零样本泛化能力。

研究意义

ECHO在长时间跨度的语言代理中提供了一种有效的上下文管理方法,解决了传统方法中上下文压缩导致的信用分配问题。其在多领域的泛化能力和资源效率提升了强化学习在实际应用中的可行性。

技术贡献

ECHO通过选择性轮次记忆和可追溯的信用路由,提供了一种新的上下文重构方法,区别于现有的折叠历史方法。它不仅提高了准确率,还减少了不必要的搜索和推理。

新颖性

ECHO首次将选择性记忆与强化学习结合,实现了上下文重构与信用分配的统一。相比于SUPO,ECHO保留了源级别的可追溯性。

局限性

  • ECHO在处理极长的上下文时可能仍面临挑战,尤其是在资源受限的环境中。
  • 在某些复杂任务中,选择性记忆的效果可能不如预期。
  • 需要进一步研究其在不同任务上的适用性。

未来方向

未来研究可以探索ECHO在其他复杂任务中的应用,并优化其在资源受限环境中的表现。此外,进一步的理论分析可以帮助理解其在不同任务上的性能差异。

AI 总览摘要

ECHO是一种新颖的选择性轮次记忆框架,旨在解决长时间跨度语言代理中的上下文管理问题。传统方法在压缩历史时往往丢失了重要的源信息,导致信用分配困难。ECHO通过将每个完成的环境轮次压缩为紧凑的源索引记忆记录,并选择有用的记录来重构策略上下文,从而实现了上下文重构与信用分配的统一。

在BrowseComp-Plus基准测试中,ECHO达到了43.4%的持出准确率,显著优于GRPO和SUPO。这表明ECHO在准确性和资源利用效率上均有显著提升。此外,ECHO在多目标问答、代码生成和深度信息检索等任务中展示了良好的零样本泛化能力。

尽管ECHO在许多方面表现出色,但在处理极长上下文和资源受限环境时仍面临挑战。未来的研究可以进一步优化其在不同任务上的表现,并探索其在更广泛应用中的潜力。

深度分析

研究背景

近年来,随着大规模语言模型的兴起,强化学习在多轮对话、工具调用和环境反馈中的应用越来越广泛。然而,随着交互范围的扩大,历史管理成为一个瓶颈。传统方法在压缩历史时往往丢失了重要的源信息,导致信用分配困难。

核心问题

在长时间跨度的语言代理中,如何有效管理上下文以保留有用信息并实现准确的信用分配是一个核心挑战。传统方法在压缩历史时往往丢失了重要的源信息,导致信用分配困难。

核心创新

ECHO通过选择性轮次记忆框架,实现了上下文重构与信用分配的统一。其创新之处在于将每个完成的环境轮次压缩为紧凑的源索引记忆记录,并选择有用的记录来重构策略上下文。

方法详解

  • �� 将每个完成的环境轮次压缩为紧凑的源索引记忆记录。
  • �� 选择有用的记录来重构策略上下文。
  • �� 重用选定的源索引将正向结果信用路由到最终轨迹段。

实验设计

在BrowseComp-Plus基准测试中,ECHO达到了43.4%的持出准确率,显著优于GRPO和SUPO。实验设计包括使用相同的搜索/开放页面工具环境、验证器和32k-token工作上下文预算。

结果分析

ECHO在BrowseComp-Plus上达到43.4%的持出准确率,显著优于GRPO的28.9%和SUPO的36.1%。此外,ECHO使用的轮次和轨迹体积均少于SUPO,表明其在资源利用上的优势。

应用场景

ECHO在多目标问答、代码生成和深度信息检索等任务中展示了良好的零样本泛化能力。其在资源效率和准确性上的提升使其在实际应用中具有广泛的潜力。

局限与展望

尽管ECHO在许多方面表现出色,但在处理极长上下文和资源受限环境时仍面临挑战。未来的研究可以进一步优化其在不同任务上的表现,并探索其在更广泛应用中的潜力。

通俗解读 非专业人士也能看懂

想象你在一个图书馆里寻找一本书。传统方法就像把所有书都压缩成一本摘要,虽然节省了空间,但你可能找不到你需要的信息。ECHO的方法更像是为每本书做一个索引卡片,记录书名、作者和关键内容。当你需要找信息时,你可以快速查找相关卡片,而不是翻阅整个摘要。这种方法不仅帮助你快速找到信息,还确保你知道这些信息来自哪里。

简单解释 像给14岁少年讲一样

想象你在玩一个大型多人在线游戏。你需要记住很多任务和线索,但你的记忆有限。传统方法就像把所有任务都写在一个长列表上,虽然节省了空间,但你可能找不到重要的任务。ECHO的方法更像是为每个任务做一个小卡片,记录任务名称、重要线索和完成步骤。当你需要完成任务时,你可以快速查找相关卡片,而不是翻阅整个列表。这种方法不仅帮助你快速完成任务,还确保你知道这些任务来自哪里!

术语表

选择性轮次记忆

一种将每个环境轮次压缩为紧凑的源索引记忆记录的方法。

用于上下文重构与信用分配。

上下文重构

通过选择有用的记忆记录来重建策略上下文的过程。

ECHO的核心机制。

信用分配

将正向结果信用路由到相关轨迹段的过程。

用于提高学习效率。

BrowseComp-Plus

一种长时间跨度的工具使用问答基准测试。

用于评估ECHO的性能。

GRPO

一种传统的多轮强化学习方法。

与ECHO进行性能对比。

开放问题 这项研究留下的未解疑问

  • 1 如何在资源受限环境中优化ECHO的性能仍需进一步研究。
  • 2 ECHO在不同任务上的适用性和性能差异需要更多实验验证。

应用场景

近期应用

多目标问答

ECHO可以用于提高复杂问答系统的准确性和效率。

远期愿景

智能助手

ECHO可以用于开发更智能的个人助手,提供更准确和个性化的服务。

原文摘要

Long-horizon language agents must repeatedly interact with tools, accumulate evidence, and make decisions under bounded context windows. Context-management methods make such rollouts feasible by simplifying past interactions through deletion, folding, or memory editing. However, when useful history is collapsed into compressed states, the reconstructed context may no longer reveal which earlier observations support a successful final answer. This creates a mismatch between bounded-context acting and outcome-based reinforcement learning: the policy acts on reconstructed context, while the learner lacks source-level provenance for assigning credit to the evidence that mattered. We propose ECHO, a selective turn-memory framework for traceable context reconstruction in Agentic RL. ECHO compresses each completed environment turn into a compact source-indexed memory record, reconstructs bounded policy contexts by selecting useful records, and reuses the selected source indices to route positive outcome credit to the final trajectory segment, reused evidence turns, memory findings, and memory-selection actions. On BrowseComp-Plus, ECHO reaches 43.4% held-out accuracy, outperforming GRPO at 28.9% and the rolling-summary baseline SUPO at 36.1%, while using fewer turns and lower trajectory volume than SUPO. The trained policy also improves zero-shot generalization across multi-objective QA, code generation, and deep information-seeking benchmarks on both dense and MoE backbones.

cs.LG cs.AI