MemoryCPT: An End-to-End Agent Memory Framework for Cost-Performance Trade-off

TL;DR

MemoryCPT通过端到端训练的记忆框架,结合QAD和QAR,显著提升长远对话中的成本-性能比,实验中QPC提升至0.138。

cs.IR 🔴 高级 2026-08-05 122 次浏览
Songxin Lei Kun Ouyang Weilin Ruan Yuqian Wu Zhijiang Guo Yushi Sun Fugee Tsung
大规模语言模型 长远记忆 成本优化 强化学习 多轮对话

核心发现

方法论

MemoryCPT采用两阶段训练策略,首先通过Query-agnostic Distillation(QAD)将复杂的记忆构建流程压缩为低秩适配(LoRA)模型,利用明确的推理轨迹学习记忆操作技能。其次,利用Query-aware Retrieval and Summarization(QAR)结合Reciprocal Rank Fusion(RRF)和基于GRPO训练的LoRA摘要器,在线实现查询相关的记忆检索与压缩。QAD在离线阶段通过教师轨迹学习记忆操作,确保模型具备重用能力;QAR在在线阶段通过粗略检索和细粒度压缩,优化成本与答案质量的平衡。整个流程通过优化Cost per Quality(QPC)指标,兼顾回答准确性与推理成本,显著优于传统基线。具体算法包括LoRA微调、RRF检索、GRPO策略优化,结合多轮对话历史进行端到端训练。

关键结果

  • 在LoCoMo数据集上,MemoryCPT使用Qwen-2.5-7B模型实现F1从0.373提升至0.479,Judge指标从0.640提升至0.755,同时推理成本降低至4.31美元/问,比基线节省约7倍,QPC值提升至0.138,表现出优异的成本-性能平衡。
  • 在LongMemEval数据集上,MemoryCPT同样表现优越,F1达0.482,Judge为0.644,成本保持在5.02美元/问,显示其在不同场景下的泛化能力。对比LightMem、MemoryOS等方法,MemoryCPT在提升答题质量的同时,极大降低了推理成本,验证了端到端训练策略的有效性。
  • 消融分析显示,去除QAD会导致F1下降约20%,成本降低但答题质量明显受损;去除QAR则导致成本大幅上升,答题准确率下降,验证了两阶段策略的协同作用。引入GRPO训练的摘要策略显著改善了成本控制效果,验证了奖励设计的合理性。

研究意义

该研究突破了长远对话记忆系统的成本-性能瓶颈,提出端到端训练的记忆框架,显著提升了多轮对话中的信息检索和压缩效率,为大规模语言模型在实际应用中的成本控制提供了新思路。通过结合强化学习与显式推理轨迹,MemoryCPT实现了在保证回答质量的同时,有效降低推理成本,推动了智能对话系统的实用化进程。这一方法不仅适用于长文本记忆管理,也为未来多模态、多任务场景中的知识整合提供了技术基础。

技术贡献

本研究的核心技术创新在于提出端到端可训练的记忆管线,结合QAD的离线知识压缩与QAR的在线查询优化,利用LoRA微调实现模型参数高效适配。引入的GRPO强化学习策略优化机制,使摘要生成在成本与质量之间实现动态平衡。具体算法包括多模态信息融合的RRF检索、基于结构化推理的记忆操作轨迹学习,以及奖励函数设计中引入的Cost per Quality(QPC)指标。这些技术突破实现了记忆操作的可解释性、模型的可扩展性和推理成本的可控性,为大规模对话系统的成本优化提供了新范式。

新颖性

本论文首次提出将长远对话记忆的构建与检索过程端到端训练,结合显式推理轨迹和强化学习策略,显著优于传统的手工提示或单一检索方法。创新点在于引入QAD的离线知识压缩机制,利用结构化推理轨迹指导模型学习记忆操作技能,以及QAR的查询相关压缩策略,通过奖励机制实现成本与性能的动态平衡。这种结合多阶段训练和强化学习的设计,突破了现有多轮对话记忆系统在成本控制和答题质量上的瓶颈,是该领域的重大创新。

局限性

  • 尽管MemoryCPT在多数据集上表现优异,但其训练过程依赖大量标注的推理轨迹和结构化输出,数据准备成本较高,可能限制其在低资源场景的应用。
  • 模型在极端长文本或复杂推理任务中仍存在信息遗失或推理不充分的风险,特别是在多轮对话中信息碎片化问题未完全解决。
  • 端到端训练虽然提升了整体性能,但模型的可解释性和调优复杂度较高,未来需探索更高效的训练策略和模型压缩技术。

未来方向

未来将致力于降低训练数据的依赖,探索无监督或少监督的推理轨迹生成方法,提升模型的泛化能力。同时,结合多模态信息(如图像、视频)扩展记忆系统的应用场景,优化多任务学习策略,增强模型在实际场景中的适应性。此外,研究更高效的模型压缩与推理加速技术,以实现端到端记忆系统的工业级部署。最后,将关注模型的可解释性和安全性,确保其在复杂环境中的可靠性。

AI 总览摘要

在当今人工智能领域,长远对话系统的构建面临着巨大挑战。随着交互历史的不断增长,如何高效、准确地恢复有用信息成为核心难题。传统方法多依赖手工提示或重复调用大型语言模型(LLM),这不仅带来高昂的推理成本,还可能引入冗余信息,影响响应质量。为此,MemoryCPT提出了一种端到端训练的记忆框架,旨在在保证对话质量的同时,最大化成本效率。

该框架由两个主要阶段组成:离线的Query-agnostic Distillation(QAD)和在线的Query-aware Retrieval and Summarization(QAR)。在QAD阶段,模型通过学习教师轨迹,将复杂的记忆构建流程压缩为低秩适配(LoRA)模型,学习到高质量的记忆操作技能。这一阶段的关键在于明确推理轨迹,确保模型理解何时创建、合并或抽象记忆内容,从而实现可重用的记忆构建能力。

在线的QAR阶段则利用Reciprocal Rank Fusion(RRF)结合结构化的强化学习(GRPO)训练的摘要器,快速检索并压缩与查询相关的记忆内容。通过奖励机制平衡答案质量与推理成本,模型能够动态调整记忆的选择与压缩策略。这一设计显著降低了推理成本,同时提升了答题准确率。

在两个公开长文本对话数据集LoCoMo和LongMemEval上的实验结果显示,MemoryCPT在保持高答题质量的同时,将推理成本降低至传统方法的1/7,QPC指标提升至0.138,远超现有的记忆系统。消融分析验证了QAD和QAR的协同作用,强调了端到端训练策略在成本控制中的关键作用。这一创新不仅推动了长远对话系统的实用化,也为未来多模态、多任务的知识管理提供了技术基础。

总之,MemoryCPT通过结合显式推理轨迹、强化学习与低秩适配技术,开创了长远对话记忆管理的新范式,为智能对话系统的成本优化提供了强有力的解决方案。未来,随着多模态信息融合和模型压缩技术的发展,该框架有望在实际应用中实现更广泛的部署,推动人机交互迈向更高的智能水平。

深度分析

研究背景

近年来,随着大规模预训练语言模型(如GPT、LLaMA、Qwen等)的快速发展,基于对话的应用场景逐渐成为研究热点。早期的多轮对话系统多依赖于有限的上下文窗口,难以应对长时间、多轮的交互需求。为解决信息遗失和推理效率问题,学者们提出多种记忆增强机制,包括基于摘要的压缩(Kim et al., 2026a)、结构化存储(Milosevic, 2026)以及多模态信息融合(Zhou et al., 2024)。然而,这些方法普遍存在推理成本高、信息冗余或缺乏端到端优化的问题。近年来,强化学习(如Memory-R1)被引入优化记忆检索策略,但在答题质量与成本之间仍难以兼顾。传统的记忆系统多依赖手工设计的提示或外部检索,缺乏统一的训练框架,限制了其性能提升空间。

核心问题

长远对话系统的核心难题在于如何在保证答题准确性的同时,有效控制推理成本。随着历史交互的不断增长,直接输入全部对话内容到LLM不仅计算成本高昂,还可能引入噪声,影响回答质量。现有方法多采用预定义的摘要或硬编码的检索策略,缺乏动态调整能力,难以应对多变的对话场景。此外,记忆的构建、检索与压缩过程缺乏端到端的优化,导致信息冗余或遗漏,影响系统的整体性能。如何设计一个既能高效构建高质量记忆,又能在查询时动态选择相关内容的系统,成为亟待解决的问题。

核心创新

本研究的创新点主要在于提出端到端可训练的记忆框架,结合显式推理轨迹和强化学习,实现记忆的高效构建与动态压缩。具体包括:

  • �� Query-agnostic Distillation(QAD):通过学习教师轨迹,将复杂的记忆构建流程压缩为低秩适配模型,学习记忆操作的技能,显著减少离线构建成本。
  • �� Query-aware Retrieval and Summarization(QAR):利用RRF结合强化学习训练的摘要器,在线实现查询相关的记忆检索与压缩,优化成本-性能比。
  • �� 结合奖励机制的Cost per Quality(QPC)指标,动态平衡答题质量与推理成本。
  • �� 引入多模态信息融合和结构化推理,提升记忆的可解释性和重用性。这一设计实现了记忆操作的端到端优化,突破了传统方法在成本控制和信息利用上的瓶颈。

方法详解

  • �� 离线阶段(QAD):
  • 输入:原始对话历史H。
  • 过程:教师模型(如Qwen-3)生成推理轨迹和结构化输出,标注记忆操作(创建、合并、抽象)。
  • 输出:结构化的推理轨迹和记忆内容,训练LoRA-A模型进行知识压缩。
  • 目标:学习记忆构建的技能,确保模型理解何时生成何种记忆。

  • �� 在线阶段(QAR):
  • 输入:用户查询q,预先构建的记忆库M。
  • 过程:
  • �� 使用RRF结合密集(embedding)和稀疏(BM25)检索,筛选候选记忆。
  • �� 利用GRPO训练的LoRA-B摘要器,根据查询生成压缩的记忆摘要mq。
  • �� 最终将q和mq输入冻结的QA模型,生成答案。
  • 目标:在保证答案质量的同时,最大限度减少推理成本。

  • �� 训练流程:
  • 先用教师轨迹训练LoRA-A,压缩记忆构建技能。
  • 合并LoRA-A到基础模型,得到基础记忆模型baseA。
  • 使用训练数据,利用RRF检索候选记忆,训练LoRA-B摘要器,通过GRPO优化奖励函数。

  • �� 推理流程:
  • 先进行RRF检索,得到候选记忆。
  • 通过LoRA-B生成查询相关的压缩摘要。
  • 最后,使用冻结的QA模型结合查询和摘要,输出答案。

实验设计

  • �� 数据集选择:采用LoCoMo和LongMemEval两个长文本对话基准,覆盖多轮、多话题场景。训练集包括8个对话,验证集和测试集分别为98和105个问题。
  • �� 评价指标:F1、LLM作为评判(Judge)、推理成本(美元/问)和成本-质量比QPC。
  • �� 实验设置:模型使用Qwen-2.5-7B作为基础,训练LoRA-A(秩16,学习率1e-4),训练时间约为数小时。QAR部分采用GRPO策略,奖励结合F1和成本。
  • �� 消融分析:去除QAD会降低答题质量,去除QAR会导致成本激增,验证两者的重要性。不同参数设置(如α值)影响模型性能,验证了奖励设计的合理性。

结果分析

  • �� MemoryCPT在LoCoMo上F1达0.479,较基线提升28%,成本降低至4.31美元/问,QPC值达0.138,表现出优异的成本-性能平衡。
  • �� 在LongMemEval上,F1为0.482,成本保持在5.02美元/问,整体表现优于LightMem、MemoryOS等传统方法。
  • �� 消融实验显示,去除QAD导致F1下降20%,成本降低但答题质量受损;去除QAR则成本大幅上升,答题准确率下降,验证了两阶段训练的协同作用。
  • �� 通过奖励机制调节参数,模型在不同场景下都能实现较优的成本-性能折中。

应用场景

  • �� 立即应用:该框架可部署于企业客服、智能助手等场景,提升多轮对话的效率和准确性,减少推理成本,适应长时间交互需求。
  • �� 长远愿景:未来将结合多模态信息(如图像、视频)扩展记忆系统,支持多任务、多场景的知识管理,推动智能对话系统的普及和商业化。

局限与展望

  • �� 训练依赖大量结构化推理轨迹,数据准备成本较高,限制在低资源场景的应用。
  • �� 在极端长文本或复杂推理任务中,信息可能遗失或推理不充分,仍需优化信息整合机制。
  • �� 端到端训练复杂,模型可解释性不足,未来需探索更高效的训练和模型压缩技术。

通俗解读 非专业人士也能看懂

想象你在管理一个大型仓库,里面存放着各种商品。每次有人来问你某个商品的详细信息,你不能每次都翻遍整个仓库,因为那样太慢也太费力。于是,你事先整理了一份简洁的目录,把重要的商品信息总结成简短的标签和笔记。当有人问起时,你只需要快速查找相关的标签,然后用你提前准备好的简短笔记告诉他答案。这就像MemoryCPT的工作方式:它提前学习如何整理和压缩大量的对话信息(QAD阶段),然后在实际问答时,快速检索相关内容并生成简洁的回答(QAR阶段)。这样既节省了时间,又保证了回答的准确性。这个系统通过提前“学习整理信息”的技巧,避免了每次都从头开始查找,既省钱又高效。它就像一个聪明的图书管理员,知道什么时候该找什么书,怎么把信息压缩得既完整又简洁,帮助我们在复杂的对话中快速找到答案。

简单解释 像给14岁少年讲一样

想象你在学校的图书馆里,有很多书和资料。当你需要写一篇作文时,你不会每次都翻遍所有书,因为那样太慢了。相反,你会提前整理一些重要的笔记和摘要,把关键信息写在便签上。每次问你问题时,你只需要看一下这些便签,然后用它们回答问题。这就像MemoryCPT的工作方式:它在后台提前学习如何把大量的对话内容整理成简短的笔记(QAD阶段),这样在真正需要回答问题时,就可以快速检索相关的笔记,并用它们生成答案(QAR阶段)。这样既节省时间,也能保证答案的准确。这个系统就像一个聪明的学生,提前准备好资料,遇到问题时就能快速找到答案,不用每次都从头开始查资料。它的聪明之处在于提前整理和压缩信息,让复杂的对话变得简单又高效,既省钱又能答得好。未来,这样的系统还能帮助我们处理更多不同类型的信息,比如图片、视频,让我们的智能助手变得更聪明、更贴心。

原文摘要

Long-horizon LLM agents require memory systems that recover useful evidence from large interaction histories without passing excessive context to downstream models. Existing memory pipelines often rely on hand-crafted heuristics and repeated LLM calls, which can introduce redundant context and high inference cost. We propose MemoryCPT, an end-to-end trainable agent memory pipeline that spans offline memory construction and online query-conditioned context generation. MemoryCPT consists of two stages: Query-agnostic Distillation (QAD), which distills a modular memory-construction pipeline into a compact model using explicit reasoning traces; and Query-aware Retrieval and Summarization (QAR), which combines reciprocal rank fusion (RRF) with a LoRA-based summarizer trained via Group Relative Policy Optimization (GRPO) under a cost-aware reward. We further introduce Quality per Cost (QPC) to quantify answer quality per unit inference cost. Experiments on LoCoMo and LongMemEval show that MemoryCPT improves the cost-performance trade-off over the evaluated baselines, while ablation and sensitivity analyses characterize the contributions of its components and the effects of key design choices.

cs.IR

参考文献 (13)

DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Zhihong Shao, Peiyi Wang, Qihao Zhu 等

2024 8026 引用 ⭐ 高影响力 查看解读 →

LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory

Di Wu, Hongwei Wang, Wenhao Yu 等

2024 498 引用 ⭐ 高影响力 查看解读 →

Contextual Agentic Memory is a Memo, Not True Memory

Binyan Xu, Xilin Dai, Kehuan Zhang

2026 12 引用 查看解读 →

Learning to summarize from human feedback

Nisan Stiennon, Long Ouyang, Jeff Wu 等

2020 3384 引用 查看解读 →

Reflexion: language agents with verbal reinforcement learning

Noah Shinn, Federico Cassano, Beck Labash 等

2023 4654 引用 查看解读 →

Compress-Distill: Reasoning Trace Compression for Efficient Knowledge Distillation

Maxime Griot, Paul S. Scotti, Tanishq Mathew Abraham

2026 2 引用 查看解读 →

Lost in the Middle: How Language Models Use Long Contexts

Nelson F. Liu, Kevin Lin, John Hewitt 等

2023 4552 引用 查看解读 →

A-MEM: Agentic Memory for LLM Agents

Wujiang Xu, Zujie Liang, K. Mei 等

2025 835 引用 查看解读 →

EvoEmbedding: Evolvable Representations for Long-Context Retrieval and Agentic Memory

Chang Nie, Chaoyou Fu, Junlan Feng 等

2026 1 引用 查看解读 →

Beyond RAG for Agent Memory: Retrieval by Decoupling and Aggregation

Zhanghao Hu, Qinglin Zhu, Hanqi Yan 等

2026 12 引用 查看解读 →

SimpleMem: Efficient Lifelong Memory for LLM Agents

Jiaqi Liu, Yaofeng Su, Peng Xia 等

2026 106 引用 查看解读 →

M$^3$Exam: Benchmarking Multimodal Memory for Realistic User-Agent Interactions

Zhengjun Huang, Wenxuan Liu, Zhoujin Tian 等

2026 1 引用 查看解读 →

What Deserves Memory: Adaptive Memory Distillation for LLM Agents

Wenquan Ma, Jiayan Nan, Wenlong Wu 等

2025 32 引用 查看解读 →