From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized Agents

TL;DR

引入Memora基准与FAMA指标,评估长时记忆在个性化代理中的表现,揭示模型在记忆整合与遗忘处理中的不足。

cs.CL 🔴 高级 2026-04-22 42 次浏览
Md Nayem Uddin Kumar Shubham Eduardo Blanco Chitta Baral Gengyu Wang
长时记忆 个性化代理 基准测试 记忆遗忘 模型评估

核心发现

方法论

本研究提出Memora基准,模拟长达数周至数月的用户对话,涵盖记忆、推理与推荐三项任务。通过自动化记忆验证与人类评估确保数据质量。引入FAMA指标,结合记忆有效性与遗忘惩罚,量化模型对动态记忆的掌控能力。评估包括四个大型语言模型(GPT-5.2、Claude、Gemini、Qwen)及六个记忆代理,测试其在长时间跨度中的记忆一致性与遗忘处理。

关键结果

  • 模型在长时间跨度(季度)中频繁重用过时信息,FAMA得分显著下降,GPT-5.2在记忆保持任务中的平均得分从周度的25.32降至季度的19.24,说明模型难以有效管理记忆的更新与遗忘。
  • 记忆代理在记忆保持方面略优于纯模型,但整体表现仍不足,MemoBase在记忆任务中的平均FAMA为43.6,远低于理想状态,反映出长时记忆的持续挑战。
  • 引入遗忘惩罚后,模型对过时信息的依赖明显减少,但仍存在频繁重用无效记忆的问题,揭示当前方法在动态记忆管理上的不足。

研究意义

该研究突破了传统基准仅关注记忆检索的局限,强调记忆的持续整合与遗忘机制,推动个性化代理向更真实、更稳健的方向发展。引入遗忘感知指标,为未来设计具备动态记忆管理能力的模型提供评估工具,具有深远的学术与应用价值。此工作填补了长时记忆评估中对记忆更新与遗忘处理的研究空白,助力实现更具人类般认知能力的智能系统。

技术贡献

提出Memora基准,系统模拟多周/月的对话场景,增强记忆整合与变异的难度,突破现有仅关注短期记忆的限制。引入FAMA指标,结合记忆有效性与遗忘惩罚,提供更全面的模型评估体系。实验验证显示,现有模型在长时间跨度中表现不佳,揭示其在动态记忆管理方面的不足,为未来模型设计提供指导。

新颖性

首次系统性模拟长达数月的对话场景,强调记忆的持续整合与遗忘机制,超越以往只关注记忆检索的评估框架。引入遗忘感知指标,明确惩罚过时记忆的依赖,推动长时记忆研究从静态检索向动态管理转变。这些创新为个性化代理的长时记忆能力提供了新的评估视角。

局限性

  • 当前评估主要基于模拟对话,可能与真实用户行为存在差异,未来需引入真实用户数据验证模型的实际应用效果。
  • 模型在处理频繁更新的记忆时仍表现不足,尤其在复杂推理任务中,说明算法在动态记忆融合方面仍需改进。
  • 评估指标虽考虑遗忘,但对多模态信息的处理尚未涉及,未来应扩展多模态记忆管理能力。

未来方向

未来将结合多模态数据,提升模型对多源信息的整合能力。探索更复杂的遗忘机制与记忆更新策略,增强模型在真实场景中的适应性。同时,扩展到多用户、多任务环境,推动个性化代理的长时记忆技术向实际应用迈进。

AI 总览摘要

随着人工智能在个性化服务中的广泛应用,模型的长时记忆能力成为核心瓶颈。现有评测多聚焦于短期信息检索,忽视了记忆的持续整合与动态遗忘机制。本文提出Memora基准,通过模拟数周至数月的用户对话,系统评估模型在记忆保持、推理与推荐任务中的表现。引入FAMA指标,结合记忆有效性与遗忘惩罚,揭示模型在长时间跨度中频繁重用过时信息的问题。实验显示,四个主流大模型和六个记忆代理在季度尺度下表现明显下降,模型在记忆更新与遗忘处理方面仍存在巨大挑战。该工作不仅丰富了长时记忆的评估体系,也为未来设计具备动态记忆管理能力的智能系统提供了重要参考。通过强调记忆的持续整合与遗忘机制,推动个性化代理向更接近人类认知的方向发展,具有深远的学术与实际意义。未来,结合多模态信息与真实用户数据,将进一步提升模型的实用性与鲁棒性。

深度分析

研究背景

长时记忆作为人工智能研究的重要方向,经历了从短期记忆模型到多轮对话系统的演变。早期工作如DSTC系列、PersonaChat等关注对话中的记忆保持,逐步引入外部存储机制。近年来,随着大规模预训练模型的崛起,研究重点转向模型在长时间跨度内的记忆整合能力,代表性工作包括LoCoMo、LongMemEval等,强调跨会话信息的检索与总结。然而,这些方法多局限于短期或中期记忆,缺乏对记忆变异、遗忘机制的系统评估。现有基准如LoCoMo、MemDaily等,主要关注记忆的提取与重用,忽视记忆的动态更新与遗忘处理,导致模型在长时间、多任务、多用户环境中的表现不稳定。长时记忆的研究尚未解决信息的持续整合、冲突解决和遗忘机制的有效实现,限制了个性化代理的实际应用。

核心问题

当前大模型在长时间、多轮对话中表现出记忆不一致、信息过时等问题,严重影响用户体验。传统评估方法多关注记忆的存在与否,忽略了记忆的动态变化和遗忘机制。实际应用中,用户信息不断更新,模型需在保持有用记忆的同时,及时遗忘无关或过时信息。缺乏系统化的评估体系,难以衡量模型在长时间跨度中的记忆管理能力。这些问题制约了个性化代理的持续性和可靠性,亟需新的基准与指标来推动技术突破。

核心创新

本研究的核心创新包括:1)提出Memora基准,模拟真实长时间对话场景,增强记忆整合与变异的难度,突破现有短期评估的局限;2)引入FAMA指标,结合记忆有效性与遗忘惩罚,系统衡量模型对动态记忆的掌控能力;3)采用多阶段对话生成与自动化验证机制,确保数据质量与评估的可靠性。这些创新使得模型在长时间、多任务、多场景中的表现得以全面评估,为未来研究提供了新的工具和思路。

方法详解

  • �� 设计十个专业人物设定,涵盖偏好、活动、目标等多维信息,作为记忆模拟的基础。• 利用会话模拟器,生成跨周/月/季的用户交互,动态引入、更新或删除记忆实体,确保时间一致性。• 构建多轮对话,结合记忆操作指令,采用多智能体生成框架,确保对话内容符合记忆状态。• 自动化记忆验证环节,检测对话中是否正确表达目标记忆操作,排除偏离设定的内容。• 通过多模型投票与人类抽样验证,确保生成对话的质量与一致性。• 构建记忆问答集,设计记忆检索、推理与推荐任务,基于模拟记忆轨迹进行评估。• 引入FAMA指标,结合记忆存在与遗忘惩罚,量化模型在长时间跨度中的记忆管理能力。

实验设计

采用模拟多轮对话数据,覆盖不同时间尺度(周、月、季),测试四个大型语言模型及六个记忆代理的表现。指标包括FAMA得分、记忆保持率、遗忘惩罚等。对比不同模型在长时间跨度下的记忆一致性,分析其在记忆更新、冲突解决中的表现。通过消融实验验证记忆遗忘机制的影响,评估模型在复杂推理任务中的表现差异。实验还结合人类评审,确保评估的客观性与可靠性。整体设计旨在揭示模型在动态记忆环境中的实际能力,为未来优化提供依据。

结果分析

实验结果显示,模型在季度尺度下的记忆保持明显下降,FAMA平均得分从周度的高值降至季度的低值,表明长时间跨度内记忆管理困难。记忆代理虽略优于纯模型,但整体表现仍不足,尤其在推理任务中表现较差。引入遗忘惩罚后,模型对过时信息的依赖减少,但仍存在频繁重用无效记忆的问题。不同模型在记忆更新和冲突解决方面差异显著,验证了动态记忆管理的重要性。整体而言,研究揭示了当前模型在长时记忆中的瓶颈,为未来改进提供了明确方向。

应用场景

该基准适用于开发更具人类认知能力的个性化助手、智能客服、长期陪伴机器人等场景。企业可利用Memora评估模型在实际应用中的记忆稳定性与适应性,优化模型设计。未来,结合多模态信息与真实用户数据,将推动个性化系统在教育、医疗、智能家居等领域的广泛应用,提升用户体验与系统可靠性。

局限与展望

目前评估主要基于模拟对话,可能与真实用户行为存在差异,需引入真实数据验证。模型在频繁更新的记忆中表现不足,尤其在复杂推理任务中存在较大差距。指标尚未涵盖多模态信息的动态管理,未来需扩展多源信息融合能力。此外,计算成本较高,长时间跨度的模拟与验证对硬件资源要求较大,限制了大规模应用推广。

通俗解读 非专业人士也能看懂

想象你在经营一家工厂,工厂每天都在生产不同的产品,员工们会记住每天的任务、客户的需求和生产的流程。随着时间推移,工厂的任务会发生变化,有些旧的流程需要忘掉,有新的需求需要记住。工厂管理者需要不断更新员工的记忆,确保他们知道最新的任务和客户信息。如果管理不善,员工可能会记错旧的任务,导致生产出错。这个工厂的管理就像人工智能中的长时记忆,模型需要学会记住重要信息、忘记过时内容,并在需要时正确使用这些信息。研究者设计了一个模拟工厂的系统,让模型像管理者一样,处理长时间的任务变化,确保信息的准确性和及时更新。

简单解释 像给14岁少年讲一样

你知道吗,就像你在学校里记笔记,有时候你会忘记一些旧的事情,但又会记住新发生的事情。比如,你昨天和朋友玩游戏,今天你可能会忘记一些细节,但记得你们玩了什么游戏。这个研究就像是让电脑学会像你一样记忆——它要记住重要的事情,也要忘掉不再重要的东西。科学家们设计了一个模拟场景,让电脑在几周甚至几个月的时间里不断学习和更新信息。比如,电脑要记住你的兴趣爱好、每天的活动,还要知道什么时候该忘掉一些旧的偏好。这样,电脑就能更像一个真正了解你、能陪你聊天的朋友。这项研究帮助电脑变得更聪明,能更好地记住和忘记信息,像人一样聪明地管理自己的记忆。

术语表

Long-Term Memory (长时记忆)

指在长时间内存储和管理信息的能力,区别于短期记忆,涉及信息的存储、更新和遗忘。

论文中强调模型在长时间跨度内的记忆整合与遗忘机制。

Memory Consolidation (记忆巩固)

将短期记忆转化为长期存储的过程,确保信息在多次会话中持续可用。

评估模型在跨会话中信息的持续积累能力。

Forgetting-Aware Memory Accuracy (遗忘感知记忆准确率)

一种评估指标,衡量模型在使用有效记忆的同时,避免依赖已失效或被删除的记忆。

本文提出的核心评估指标。

Memory Mutation (记忆变异)

指在多次会话中对存储信息的更新、修改或删除过程。

衡量模型处理动态信息变化的能力。

FAMA (遗忘感知记忆准确率)

结合记忆有效性与遗忘惩罚的指标,用于评估模型在长时间跨度中的记忆管理表现。

论文中的主要评估工具。

开放问题 这项研究留下的未解疑问

  • 1 如何在真实用户环境中验证模型的长时记忆能力,尤其是在多模态信息融合方面仍缺乏系统研究。
  • 2 现有指标难以全面衡量模型在复杂动态场景中的记忆遗忘与更新能力,未来需开发更细粒度的评估体系。

应用场景

近期应用

个性化助手评估

企业可利用Memora检测模型在长时间交互中的记忆稳定性,优化个性化服务质量。

智能客服优化

通过评估模型的记忆管理能力,提升客服系统的连续性与用户满意度。

远期愿景

人类级认知系统

推动构建具备人类般记忆、推理与遗忘机制的智能体,实现更自然的交互与学习能力。

原文摘要

Personalized agents that interact with users over long periods must maintain persistent memory across sessions and update it as circumstances change. However, existing benchmarks predominantly frame long-term memory evaluation as fact retrieval from past conversations, providing limited insight into agents' ability to consolidate memory over time or handle frequent knowledge updates. We introduce Memora, a long-term memory benchmark spanning weeks to months long user conversations. The benchmark evaluates three memory-grounded tasks: remembering, reasoning, and recommending. To ensure data quality, we employ automated memory-grounding checks and human evaluation. We further introduce Forgetting-Aware Memory Accuracy (FAMA), a metric that penalizes reliance on obsolete or invalidated memory when evaluating long-term memory. Evaluations of four LLMs and six memory agents reveal frequent reuse of invalid memories and failures to reconcile evolving memories. Memory agents offer marginal improvements, exposing shortcomings in long-term memory for personalized agents.

cs.CL