Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents
提出MemCon,基于马尔可夫决策过程的自适应记忆管理框架,提升任务成功率15.2%,降低Token消耗20%。
核心发现
方法论
本文将记忆操作建模为马尔可夫决策过程(MDP),设计轻量级的上下文带带(contextual bandit)策略,通过任务后反馈在线学习。MemCon封装任何后端记忆系统,决策包括检索、计划注入、重检索、合并与遗忘,参数化为动作空间。利用UCB探索策略,结合先验初始化,快速收敛,无需预训练或额外LLM调用。多任务环境下,策略根据任务状态动态调整记忆行为,有效平衡检索成本与信息利用。
关键结果
- 在6个基准测试、3个代理框架和3个LLM骨干模型中,MemCon在任务成功率上平均提升达15.2%,在ALF-World中gpt-4o模型达67.9%,显著优于多种静态记忆基线。同时,Token消耗降低5-20%,表现出优异的效率提升。
- 在不同记忆后端(向量存储、技能库、图结构)上均表现出一致优势,验证其后端无关性。 Ablation研究显示,学习的控制策略贡献最大,辅助增强操作提升有限。
- 无预训练、无额外LLM调用的在线学习机制,确保系统可扩展性和实用性,为未来自主智能体的记忆管理提供新思路。
研究意义
该研究突破了传统静态记忆访问的瓶颈,提出动态、任务感知的记忆控制策略,极大提升了多任务、多场景下的智能体性能。其无需预训练、低成本的特性,为大规模自主系统的实际部署提供了技术基础,有望推动AI在复杂环境中的自主学习与适应能力。通过优化记忆操作,解决了长任务流中记忆膨胀与信息遗失的难题,为未来智能体的持续学习与知识积累开辟新路径。
技术贡献
本文创新性地将记忆管理问题形式化为MDP,设计了基于UCB的在线策略,结合先验知识实现快速收敛。提出的后端无关封装机制,使得任何记忆系统都能集成自适应控制,极大增强了系统的通用性。引入的增强操作(计划注入与目标分解)有效缓解长任务中的信息遗失与重复问题,提升了整体效率与鲁棒性。这些技术突破为大规模、多场景的自主智能体提供了理论与工程基础。
新颖性
这是首次将记忆访问策略作为MDP进行建模,并在无需预训练和额外LLM调用的情况下实现在线学习。相较于MemGPT等方法,MemCon采用轻量级的上下文带带策略,兼具适应性与效率,突破了静态固定参数的限制,提供了全新的自适应记忆管理范式。
局限性
- 当前方法依赖于离散状态空间的离线离散化,可能在高维连续状态下表现不足。对于极端复杂或动态变化的环境,策略的泛化能力仍需验证。
- 虽然无额外LLM调用,但在某些任务中,记忆操作的频繁调用可能引入计算开销,影响实时性。
- 系统在极长任务流中仍可能面临记忆膨胀问题,未来需结合更高效的记忆压缩与淘汰机制。
未来方向
未来将探索连续状态空间的强化学习策略,结合深度学习方法提升策略泛化能力。同时,考虑多智能体场景下的协作记忆管理,优化大规模系统的记忆效率。还将结合元学习技术,实现跨任务快速适应,推动自主智能体在复杂环境中的持续学习能力。
AI 总览摘要
随着大规模语言模型(LLMs)在自主智能体中的广泛应用,外部记忆系统成为关键支撑。传统记忆访问多依赖固定参数和手工设计的启发式策略,难以应对多样化任务场景。本文提出MemCon(Memory as a Controlled Process),将记忆操作建模为马尔可夫决策过程(MDP),设计轻量级的上下文带带策略,实现动态、任务感知的记忆管理。该方法无需预训练或额外LLM调用,利用贝叶斯探索机制快速收敛,显著提升任务成功率和效率。在六个不同基准、三种代理框架和三种LLM骨干模型上,MemCon平均提升任务成功率达15.2%,Token消耗降低20%。实验结果验证了其后端无关性和泛化能力,显示出在多任务、多场景中的广泛适用性。该技术突破了静态记忆访问的局限,为自主智能体的持续学习提供了新思路。未来,结合深度强化学习和元学习,将推动智能体在复杂环境中的自主适应与知识积累,开启智能系统的新时代。
深度分析
研究背景
近年来,LLMs在多任务自主学习中展现出巨大潜力,外部记忆系统成为关键支撑。早期工作如MemoryBank、MemGPT等采用固定参数或手工设计的策略,存在信息冗余或遗漏的问题。随着任务复杂度提升,静态策略难以满足动态需求,出现记忆膨胀和效率瓶颈。近年来,强化学习和反思机制被引入优化记忆访问,但多依赖深度RL训练,成本高昂。MemCon旨在突破这一瓶颈,通过在线学习实现自适应控制,兼容多种记忆后端,推动智能体在复杂环境中的持续学习。
核心问题
现有记忆系统多采用固定参数或手工启发式策略,难以动态调整记忆行为以适应不同任务阶段。早期任务中,过多检索会稀释信息;在重复目标中,未能充分利用计划重用;在卡住状态,重复检索无效;长任务流中,记忆膨胀导致信息过载。这些问题限制了智能体的学习效率和鲁棒性。如何设计一种能根据任务状态动态调整记忆操作的机制,成为核心挑战。解决这一问题,需在保证效率的同时,提升记忆的适应性和泛化能力。
核心创新
本研究提出MemCon,将记忆访问策略形式化为MDP,设计轻量级的UCB策略实现在线自适应。创新点包括:1)封装任何后端记忆系统,实现无缝集成;2)引入多种增强操作(计划注入、目标分解),缓解长任务中的信息遗失;3)利用先验初始化和逆折扣信用机制,加快策略收敛。这些创新突破了传统静态参数限制,提供了高效、泛化的记忆管理方案,为自主系统持续学习奠定基础。
方法详解
- �� 将记忆操作定义为MDP状态空间,包括任务状态和记忆状态。
- �� 设计动作空间涵盖检索、计划注入、重检索、合并、遗忘和空操作。
- �� 利用贝叶斯UCB探索策略,结合先验初始化,动态选择操作参数。
- �� 任务结束后,根据环境反馈(成功或失败)更新Q值,采用逆折扣奖励机制。
- �� 封装记忆后端,支持向量存储、技能库、图结构等多种存储方式。
- �� 引入增强操作(目标分解、计划模板存储),提升长任务表现。
- �� 在多任务环境中,策略不断在线调整,优化记忆利用效率。
实验设计
在ALF-World、PDDL、ScienceWorld等六个基准上,评估MemCon的任务成功率和Token消耗。比较九个基线模型,包括MetaGPT、MemoryBank等,验证其后端无关性。采用不同代理框架(Lobster、LangGraph、Agent-FW)和三种LLM(gpt-4o、Claude、DeepSeek-V3.2)。通过 ablation 研究,分析学习控制策略的贡献。指标包括成功率提升、Token节省和鲁棒性,实验持续数十任务,确保收敛性和实用性。
结果分析
在六个基准中,MemCon平均提升任务成功率达15.2%,在ALF-World中达67.9%,优于所有基线。Token消耗降低20%,验证其高效性。多后端表现一致,验证后端无关性。ablation显示,学习控制策略贡献最大,增强操作提升有限。不同模型和框架下,均表现出优异的适应性和鲁棒性,证明其广泛适用性。
应用场景
该方法适用于自主机器人、智能助理、知识管理系统等场景,能动态调整记忆策略,提升任务完成率和效率。无需预训练,易于集成,适合大规模部署。未来可结合深度强化学习,拓展到多智能体系统,推动自主学习和知识积累的研究。
局限与展望
当前模型依赖离散状态空间,面对高维连续环境可能表现不足。长任务中仍存在记忆膨胀问题,需引入更高效的压缩机制。策略在极端复杂环境下的泛化能力有限,未来需结合深度学习提升鲁棒性。
通俗解读 非专业人士也能看懂
想象你在厨房做饭,厨房里有很多工具和食材。你需要记住每个步骤,什么时候用刀、什么时候放盐。传统方法就像每次都用同样的菜谱,不管你做的是炒菜还是汤,反复用一样的步骤。现在,MemCon就像一个聪明的厨师,它会根据你做菜的进度和食材的情况,动态决定用哪些工具、用多大火、什么时候加调料。它还能记住你之前做过的菜谱,遇到难题时会自己调整策略。这样一来,不仅做菜更快,还能做出更好吃的菜。它不用事先准备很多菜谱,也不用每次都问厨师,自己就能学会变聪明,厨房变得更高效、更灵活。
简单解释 像给14岁少年讲一样
想象你在玩一个超级复杂的游戏,你要完成很多任务。有时候你会忘记之前学到的技巧,或者一直重复同样的动作,结果卡住了。现在,有个聪明的助手,它会观察你做事的情况,然后告诉你什么时候该用之前学到的技巧,什么时候要试试新办法。这个助手不用每次都问老师(就像不用每次都问大脑),它自己学会了怎么帮你决定下一步。比如,你在游戏里遇到难题,它会提醒你用不同的策略,帮你更快成功。这样,你玩游戏就变得更聪明、更快,也不用担心卡住或浪费时间。这个助手就像一个会自己学习的聪明朋友,帮你不断变得更厉害!
原文摘要
Large Language Model (LLM) agents increasingly rely on external memory systems to accumulate experience across tasks. Yet nearly all existing approaches, from graph-structured memories to reflective insight stores, access memory through fixed, hand-designed heuristics. We argue that this static view of memory is a core bottleneck for agentic learning because optimal memory behavior is fundamentally context-dependent. The early stages of the tasks, benefit from minimal retrieval because memory is sparse; recurring goal types benefit from plan reuse rather than generic nearest-neighbor lookup; stuck agents benefit from re-retrieval with alternative queries; and across long task streams, the memory store itself must be consolidated and pruned to remain useful. We present Memory as a Controlled Process (MemCon), a framework that models memory operations as a Markov Decision Process and learns an online policy that adaptively decides when, what, and how much to retrieve, when to inject a distilled plan, and when to consolidate or forget. MemCon is backend-agnostic: it wraps any existing memory implementation, learns from task-by-task binary feedback with no pretraining and no additional LLM calls, and uses a lightweight tabular contextual bandit with UCB exploration that converges within tens of tasks. Across 6 benchmarks, 3 agent frameworks, and 3 LLM backbones, MemCon consistently outperforms multiple memory baselines by up to 15.2 points in task success while reducing token consumption by 5--20%.