Beyond RAG for Agent Memory: Retrieval by Decoupling and Aggregation

TL;DR

提出xMemory,通过解耦和层级聚合优化代理记忆检索,提升答案质量与效率。

cs.CL 🔴 高级 2026-02-02 12 引用 40 次浏览
Zhanghao Hu Qinglin Zhu Runcong Zhao Di Liang Hanqi Yan Yulan He Lin Gui
人工智能 信息检索 知识管理 层次结构 大语言模型

核心发现

方法论

本文提出xMemory框架,核心思想是先将交互历史划分为局部事件段,再将每段解耦为可重用的记忆组件,最后将相关组件聚合成高层次的组。结构构建采用稀疏-语义保真目标,确保组的紧凑性与表达能力。在检索阶段,系统采用自顶向下的策略,优先选择互补的组和组件,只有在不确定性较高时,才扩展到具体段落和原始消息。结构动态维护支持新信息的插入、拆分和合并,确保记忆的可修正性。实验在LoCoMo和PerLTQA数据集上,使用多种开源和闭源大模型,显著提升答案质量和推理效率,减少冗余信息。

关键结果

  • 在LoCoMo数据集上,xMemory在Qwen3-8B模型中,BLEU得分从31.44提升至34.48,F1从40.88提升至43.98,推理Token数从9155降至4711,表现优于所有对比方法。
  • 在PerLTQA上,xMemory在Qwen3-8B模型中,BLEU从32.80提升至36.24,F1从42.80到47.08,ROUGE-L从38.05到42.50,Token数从9092降至5087,显示其在长文本和个性化记忆中的优越性。
  • 消除冗余、提升证据密度的分析表明,解耦组件和层级聚合有效减少重复信息,增强关键证据的可访问性,显著改善多轮、多事实问答场景的表现。

研究意义

该研究突破了传统RAG在代理记忆中的局限,提出解耦优先的层级结构,有效应对高度相似历史中的微小差异,解决冗余与细节模糊的问题。其创新的结构设计不仅提升了多轮对话和长文本推理的准确性,也为未来智能代理系统的知识管理提供了新思路。通过动态维护机制,确保记忆结构的可修正性和适应性,推动大模型在复杂任务中的应用落地,具有深远的理论和实践意义。

技术贡献

本文提出的xMemory框架在记忆组织上实现了从原始消息到局部事件段、记忆组件、高层组的层级解耦,结合稀疏-语义保真目标,实现了高效且可修正的记忆结构。其创新点在于引入动态拆分与合并机制,支持记忆的增量更新,避免传统层级结构中信息模糊或冗余堆积的问题。在检索策略上,采用自顶向下的逐层扩展,结合邻近关系维护,显著减少无关信息干扰,提升检索的精确性和效率。实验验证了该方法在多个公开和闭源模型中的优越表现,展示了其在多轮对话、长文本推理中的潜力。

新颖性

该研究首次系统性提出解耦优先的层级记忆组织原则,区别于传统的扁平或总结导向的结构设计。通过引入动态可修正的层级机制,解决了多相似历史中微差识别和信息冗余问题,突破了现有结构在细粒度信息保留和检索效率上的瓶颈。这一创新不仅丰富了记忆管理的理论体系,也为大模型的长时记忆和多任务适应提供了新路径。

局限性

  • 尽管解耦和层级聚合提升了检索效率,但在极端信息密集或高度动态的场景中,结构维护的计算成本可能较高,存在一定的性能瓶颈。
  • 当前方法依赖于预训练的嵌入模型和相似性度量,可能在语义模糊或多义词场景下表现不佳,未来需引入更鲁棒的语义理解机制。
  • 结构调整策略在极端场景下可能引入误拆或误合,影响记忆的完整性和一致性,需进一步优化动态维护算法。

未来方向

未来将探索多模态记忆结构的引入,结合视觉、声音等多模态信息,丰富记忆内容的表达能力。同时,计划引入强化学习机制,优化结构拆分与合并策略,以适应更复杂的动态环境。此外,将研究跨任务迁移能力,提升模型在不同应用场景中的适应性和泛化能力,推动智能代理的长时记忆技术成熟。

AI 总览摘要

在当今人工智能快速发展的背景下,构建高效、可修正的长时记忆系统成为智能代理的核心挑战之一。传统的检索增强生成(RAG)方法在处理大规模异构文档库时表现优异,但在代理记忆场景中,面临着高度相似的交互历史导致的冗余和细节模糊问题。本文提出了xMemory框架,旨在通过解耦和层级聚合,优化代理记忆的组织与检索策略。

xMemory的核心思想是将交互历史划分为局部事件段,再将每段解耦为可重用的记忆组件,最后将相关组件聚合成高层次的组。这一过程借助稀疏-语义保真目标,确保每个组既紧凑又具备良好的表达能力。在检索阶段,系统采用自顶向下的逐层扩展策略,优先选择互补的组和组件,只有在不确定性较高时,才扩展到具体段落和原始消息。这种设计极大地减少了冗余信息的干扰,提高了检索的效率和准确性。

实验结果在LoCoMo和PerLTQA两个多轮对话和长文本问答数据集上均表现出色。以Qwen3-8B模型为例,xMemory在BLEU和F1指标上均优于所有对比方法,且推理Token数显著减少,验证了其在提升答案质量和推理效率方面的优势。这些结果充分证明了解耦优先的层级结构在代理记忆中的适用性和优越性。

该研究的意义在于突破了传统RAG在代理场景中的局限,为多轮对话、个性化长文本推理提供了新的解决方案。其动态维护机制确保记忆结构的可修正性,适应不断变化的交互环境。未来,结合多模态信息和强化学习,将进一步推动智能系统在复杂任务中的应用潜力。整体来看,xMemory为智能代理的知识管理提供了理论基础和实践路径,具有深远的学术和产业价值。

深度分析

研究背景

随着大规模预训练语言模型(如GPT系列、BERT等)的兴起,基于外部记忆的增强推理逐渐成为研究热点。早期工作如RAG(Retrieval-Augmented Generation)通过检索相关文档提升模型表现,但在多轮对话和长文本场景中,面临大量重复信息和细节模糊的问题。近年来,层级结构、图结构等方法被引入以改善存储和检索效率,如Memory Networks、Hierarchical Memory、Graph-based Memory等。这些方法在一定程度上缓解了大规模存储的挑战,但仍未充分解决代理记忆中高相似性导致的冗余和微差识别难题。传统方法多依赖扁平或总结导向的组织方式,忽视了局部事件的解耦和动态修正能力。随着应用场景的复杂化,如何在保证检索效率的同时,保持记忆的细粒度表达和可修正性,成为研究的核心难题。

核心问题

代理记忆的核心问题在于如何在高度相似的交互历史中有效识别关键证据,避免信息冗余,同时保持记忆的细节和动态更新能力。现有的RAG方法多采用固定的相似性排名,容易重复检索相似内容,难以捕捉微小差异,影响问答的准确性。此外,层级结构虽然提升了存储效率,但在高相似性场景中,压缩和抽象可能模糊细节,削弱检索的判别能力。这些问题限制了大模型在多轮对话、个性化推荐、长文本理解等复杂任务中的表现。

核心创新

本文提出的xMemory创新点在于:1)引入解耦优先的层级组织原则,将交互历史划分为局部事件段,再将段解耦为记忆组件,强化关键证据的表达;2)采用稀疏-语义保真目标,确保高层组的紧凑性与区分性,避免信息模糊;3)动态维护机制支持新信息的插入、拆分和合并,确保记忆结构的可修正性;4)自顶向下的检索策略,优先选择互补的高层组和组件,逐层扩展到细节,减少冗余。这些创新结合了结构解耦、动态修正和层级检索的优势,有效解决了传统方法在高相似性场景中的瓶颈。

方法详解

  • �� 构建局部事件段:将交互历史划分为连续的消息段,保持局部上下文的完整性。• 解耦为记忆组件:从每段中提取可重用事实、状态更新、关系等组件,隔离关键证据。• 组的聚合:利用稀疏-语义保真目标,将相关组件聚合成高层组,确保组的紧凑性和表达能力。• 结构动态维护:新信息插入时,将组件分配到最相似的组,超大或不一致的组进行拆分,小组进行合并,保持结构的合理性。• 检索策略:首先通过组的相似性选择候选集合,利用邻近关系避免重复,逐层扩展到组件、段落和原始消息,直到满足答案需求。• 结构修正:基于结构指标,动态调整组的划分,确保记忆的可修正性和适应性。

实验设计

采用LoCoMo和PerLTQA两个长文本和多轮对话数据集,评估不同模型(Qwen3-8B、Llama-3.1-8B-Instruct、GPT-5 nano)在答案质量和推理Token数上的表现。对比基线包括扁平检索、总结结构和层级存储方法。指标涵盖BLEU、F1、ROUGE-L和Token数,重点分析冗余、证据密度和覆盖率。通过消融实验验证解耦、层级聚合和动态维护的重要性。调优参数如组大小上限,确保在不同场景下的最优性能。实验结果显示,xMemory在所有指标上均优于对比方法,特别是在多轮、多事实问答中表现出显著优势。

结果分析

在LoCoMo上,xMemory在Qwen3-8B模型中,BLEU从31.44提升至34.48,F1从40.88提升至43.98,Token数从9155降至4711,优于Nemori和MemoryOS等结构方法。多轮和时间敏感问题表现尤为突出。在PerLTQA中,xMemory在Qwen3-8B模型中,BLEU从32.80提升至36.24,F1从42.80到47.08,ROUGE-L从38.05到42.50,Token数从9092降至5087,验证其在长文本和个性化记忆中的优越性。消除冗余、增强证据密度的分析表明,解耦组件和层级聚合有效减少重复信息,提升多轮、多事实问答的准确性和效率。

应用场景

该方法适用于多轮对话系统、个性化推荐、长文本理解等场景,尤其在需要管理大量相似历史信息的应用中表现优异。通过层级解耦和动态维护,可以提升信息检索的精度和效率,减少冗余,增强模型的推理能力。未来还可结合多模态信息,拓展到视觉、声音等多源信息融合的智能系统,推动智能助手、自动问答等行业的技术革新。

局限与展望

结构维护的计算成本在极端信息密集或动态变化剧烈的场景中可能较高,存在性能瓶颈。当前依赖预训练嵌入模型和相似性度量,可能在语义模糊或多义词场景表现不足。结构拆分和合并策略在极端场景下可能引入误拆或误合,影响记忆完整性。未来需优化算法,提升鲁棒性和适应性,降低成本,增强模型的泛化能力。

通俗解读 非专业人士也能看懂

想象你在整理一个大型的相册,每一张照片都代表一次重要的回忆。为了找到某个特定的瞬间,比如去年夏天的海滩旅行,你不会一开始就翻遍所有照片,而是先根据时间、地点或人物把相册分成几个部分。然后,你会在每个部分中找到一些关键的照片,比如海浪、沙滩、朋友的笑脸。接着,你会把这些关键照片按照主题或事件再分类,比如“海浪拍打岩石”或“沙滩篝火”。这样,当你想回忆那次旅行时,你只需要先看几个关键的主题组,而不是每一张照片。只有当你需要更详细的细节时,才会打开具体的照片或相册页。这种方法让你既能快速找到重要内容,又不会被大量相似的照片淹没。xMemory的思想也是如此,它把复杂的交互历史拆解成小块,分类整理,最后再逐步展开,帮助大模型更聪明、更高效地找到关键信息。

简单解释 像给14岁少年讲一样

想象你在整理你的超级大相册,里面有你一整年的所有照片。每次你想找某个特别的瞬间,比如去年夏天的海边假期,你不会一开始就翻遍所有照片,而是先把相册分成几个部分,比如“海滩”、“朋友”、“日落”。然后,你会在每个部分中找到一些代表性的照片,比如海浪、沙滩上的脚印、朋友的笑脸。接下来,你会把这些照片再分类,比如“海浪拍打岩石”或者“沙滩上的篝火”。这样,当你想回忆那次旅行时,你只需要先看几个主题组,而不是每一张照片。只有当你需要更多细节时,你才会打开具体的照片。这就像给你的记忆装上了智能整理器,让你既能快速找到重要的事情,又不会被无数相似的照片搞糊涂。xMemory也是这个道理,把复杂的对话和交互拆成小块,分类整理,然后逐步展开,帮大模型更聪明地找到关键证据,回答问题。它就像给你的大脑装了个聪明的整理系统,让你既快又准!

原文摘要

Standard Retrieval Augmented Generation (RAG) is poorly matched to agent memory. Unlike large heterogeneous corpora, agent memory forms a bounded and coherent interaction stream in which many spans are highly correlated or near duplicates. As a result, flat top-$k$ similarity retrieval often returns redundant context, while summary-centric hierarchies can blur the subtle details that distinguish one candidate from another. We argue that agent memory should follow the principle of decoupling before aggregation: the system should first isolate reusable facts, updates, and distinguishing details from similar histories, and only then organise them for efficient retrieval. Based on this principle, we propose xMemory, which constructs a revisable hierarchical memory structure from original messages to segments, memory components, and groups. xMemory segments interaction history into local events, decouples each segment into memory components, aggregates related components into high-level groups using a sparsity--semantic faithfulness objective, and maintains this structure incrementally as memory evolves. At inference time, xMemory retrieves top-down, first selecting a compact backbone of complementary groups and components, and then expanding to segments and raw messages only when additional evidence reduces the reader's uncertainty. Experiments on LoCoMo and PerLTQA across diverse open source and closed source LLMs show consistent gains in answer quality and inference token efficiency, supported by analyses of redundancy, evidence density, and coverage.

cs.CL cs.AI

参考文献 (20)

Is ChatGPT Good at Search? Investigating Large Language Models as Re-Ranking Agent

Weiwei Sun, Lingyong Yan, Xinyu Ma 等

2023 611 引用 ⭐ 高影响力 查看解读 →

Memory OS of AI Agent

Jiazheng Kang, Mingming Ji, Zhe Zhao 等

2025 111 引用 ⭐ 高影响力 查看解读 →

A-MEM: Agentic Memory for LLM Agents

Wujiang Xu, Zujie Liang, K. Mei 等

2025 961 引用 ⭐ 高影响力 查看解读 →

Beyond Goldfish Memory: Long-Term Open-Domain Conversation

Jing Xu, Arthur Szlam, J. Weston

2021 382 引用 查看解读 →

Conversation Chronicles: Towards Diverse Temporal and Relational Dynamics in Multi-Session Conversations

Jihyoung Jang, Minseong Boo, Hyounghun Kim

2023 58 引用 查看解读 →

MemGPT: Towards LLMs as Operating Systems

Charles Packer, Sarah Wooders, Kevin Lin 等

2023 1258 引用 查看解读 →

LongLLMLingua: Accelerating and Enhancing LLMs in Long Context Scenarios via Prompt Compression

Huiqiang Jiang, Qianhui Wu, Xufang Luo 等

2023 541 引用 查看解读 →

Lost in the Middle: How Language Models Use Long Contexts

Nelson F. Liu, Kevin Lin, John Hewitt 等

2023 4917 引用 查看解读 →

MemoryBank: Enhancing Large Language Models with Long-Term Memory

Wanjun Zhong, Lianghong Guo, Qi-Fei Gao 等

2023 647 引用 查看解读 →

Generative Agents: Interactive Simulacra of Human Behavior

J. Park, Joseph O'Brien, Carrie J. Cai 等

2023 5431 引用 查看解读 →

RAPTOR: Recursive Abstractive Processing for Tree-Organized Retrieval

Parth Sarthi, Salman Abdullah, Aditi Tuli 等

2024 698 引用 查看解读 →

Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks

Patrick Lewis, Ethan Perez, Aleksandara Piktus 等

2020 17974 引用 查看解读 →

ROUGE: A Package for Automatic Evaluation of Summaries

Chin-Yew Lin

2004 21755 引用

Bleu: a Method for Automatic Evaluation of Machine Translation

Kishore Papineni, Salim Roukos, T. Ward 等

2002 34581 引用

Crafting Papers on Machine Learning

P. Langley

2000 1033 引用

PerLTQA: A Personal Long-Term Memory Dataset for Memory Classification, Retrieval, and Fusion in Question Answering

Yiming Du, Hongru Wang, Zhengyi Zhao 等

2024 46 引用

IBM Research Report Bleu: a Method for Automatic Evaluation of Machine Translation

Kishore Papineni, S. Roukos, T. Ward 等

2001 303 引用

Retrieval-Augmented Generation for Large Language Models: A Survey

Yunfan Gao, Yun Xiong, Xinyu Gao 等

2023 4029 引用 查看解读 →

Anatomy of Agentic Memory: Taxonomy and Empirical Analysis of Evaluation and System Limitations

Dongming Jiang, Yi Li, Song-Tao Wei 等

2026 21 引用 查看解读 →

Evaluating Very Long-Term Conversational Memory of LLM Agents

Adyasha Maharana, Dong-Ho Lee, S. Tulyakov 等

2024 806 引用 查看解读 →

被引用 (12)

Rethinking How to Remember: Beyond Atomic Facts in Lifelong LLM Agent Memory

2026 2 引用 ⭐ 高影响力 查看解读 →

MemoryCPT: An End-to-End Agent Memory Framework for Cost-Performance Trade-off

CUADebug: Diagnosing and Repairing Computer-Use Agent Failures

2026 1 引用 查看解读 →

Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory

Memory in the Loop: In-Process Retrieval as Extended Working Memory for Language Agents

Memory-Orchestrated Semantic System (MOSS): An Auditable Agentic Memory Architecture

Seek to Segment: Active Perception for Panoramic Referring Segmentation

MemTrace: Tracing and Attributing Errors in Large Language Model Memory Systems

2026 4 引用 查看解读 →

DimMem: Dimensional Structuring for Efficient Long-Term Agent Memory

2026 1 引用 查看解读 →

Toward a Theory of Hierarchical Memory for Language Agents

2026 5 引用 查看解读 →

DOVA: Deliberation-First Multi-Agent Orchestration for Autonomous Research Automation

2026 1 引用 查看解读 →

OSCR-Attack: One-Shot Character Level Attacks through Self-Optimizing Continuous Relaxation

2026