DynamicMem: A Long-Horizon Memory Benchmark in Real-World Settings

TL;DR

DynamicMem通过15个月长时记忆基准,评估多应用场景中用户属性、习惯和偏好的动态推断能力。

cs.CL 🔴 高级 2026-06-22 38 次浏览
Wenya Xie Shengming Zhou Zelin Li Pouya Parsa Shuang Zhou Xinheng Ding Chinmay Arvind Guanchu Wang Vladimir Braverman Ali Payani Yantao Zheng Zirui Liu
长时记忆 多应用场景 用户建模 行为推断 基准测试

核心发现

方法论

DynamicMem采用合成轨迹生成框架,结合多时间尺度的用户模型(属性、习惯、偏好),通过外部事件驱动的因果关系模拟用户行为变化。利用15个月的多应用数据,构建跨应用事件链,结合状态一致的日志生成,评估模型在不同时间点的记忆和推断能力。采用五个季度的检查点,分析历史长度对记忆准确率的影响,揭示不同系统在保持稳定事实和更新变化事实方面的差异。

关键结果

  • 在15个月轨迹中,状态完成任务的准确率逐步下降,从初期的85%降至65%,反映出随着历史增长,记忆的保持难度增加。大部分错误源于记忆检索阶段,超过93%的失败归因于检索不准确,而非模型生成错误。不同系统在保持不变事实方面表现差异显著,未能同时正确更新变化事实,偏好和实体命名错误频发。整体来看,长时记忆的挑战主要集中在记忆存储和检索机制的优化上。

研究意义

该研究填补了长时记忆评估中缺乏跨应用、多时间尺度和因果关系建模的空白,为个性化助手的长期记忆能力提供了标准化测试平台。通过模拟真实用户行为变化,推动多模态、多应用场景下的记忆系统设计,解决隐私限制下难以获取真实用户数据的难题,对智能助理、个性化推荐等行业具有深远影响。它强调了模型在动态环境中保持事实一致性和适应性的重要性,为未来长时记忆系统的研究提供了理论基础和实践指南。

技术贡献

本文提出了融合多时间尺度用户模型的轨迹合成框架,创新性地引入因果驱动的属性、习惯和偏好演变机制,结合状态一致的多应用日志生成技术,实现了长达15个月、超过2.2百万tokens的用户轨迹模拟。通过多任务评估策略,系统性分析了记忆的可扩展性和更新能力,揭示了现有系统在保持事实稳定性和动态更新方面的不足。该方法在多应用、多任务、多时间尺度的长时记忆评估中具有开创性意义,为未来多模态、多场景的个性化系统设计提供了技术支撑。

新颖性

本研究首次提出以因果关系为驱动的长时轨迹合成方法,系统性模拟用户在多个应用中的行为演变,超越了以往仅关注单一会话或静态快照的评估方式。通过引入多时间尺度模型和状态一致的多应用日志生成,实现在隐私限制下的长时、多场景用户行为模拟,极大丰富了长时记忆评估的粒度和真实性,推动了个性化系统的长远发展。

局限性

  • 当前模型对复杂外部事件的响应还不够细腻,难以捕捉突发性行为变化。部分场景下,因果关系的模拟仍有偏差,影响轨迹的真实性。系统在大规模多应用环境下的计算成本较高,未来需优化效率和泛化能力。

未来方向

未来将结合多模态数据(如图像、语音)丰富用户行为表现,增强因果关系建模的复杂性与真实性。同时,探索更高效的轨迹生成算法,提升大规模应用中的实用性。此外,将引入用户反馈机制,动态调整模型参数,进一步提升个性化和适应性。

AI 总览摘要

随着人工智能技术的发展,基于大规模语言模型(LLMs)的个人助理逐渐成为日常生活的重要工具。这些系统需要具备长时间记忆能力,以持续追踪用户的属性、习惯和偏好的变化,从而提供个性化、动态的服务。然而,现有的评估方法多局限于短期、静态的交互,难以反映真实用户行为的复杂性。为解决这一问题,Wenya Xie等人提出了DynamicMem,一种面向真实世界场景的长时记忆基准。该基准通过模拟15个月的用户行为轨迹,涵盖多达16个应用场景,包括电商、健身和社交平台,构建了超过2.2百万tokens的连续轨迹,真实反映用户在不同时间尺度上的属性、习惯和偏好的演变。其创新之处在于引入因果关系驱动的轨迹生成机制,确保行为变化具有合理的外部驱动,且跨应用行为协调一致。评估五个代表性记忆系统后,发现长时间轨迹中,状态完成任务的准确率显著下降,超过93%的失败源于检索阶段的错误。这一结果凸显了当前记忆系统在存储和检索机制上的不足,为未来优化指明了方向。该工作不仅丰富了长时记忆的评估体系,也为个性化助手的长期性能提升提供了宝贵的工具和思路。未来,结合多模态数据和用户反馈,将进一步推动智能系统在复杂、多变环境中的应用潜力。

深度分析

研究背景

长时记忆在人工智能个性化系统中扮演核心角色。早期工作如Persona-based模型关注静态用户画像,后续如LlamaIndex和Memory-Augmented模型引入外部存储机制,但多局限于短期或单一应用场景。近年来,随着多模态和多应用场景的兴起,研究逐渐转向跨应用、多时间尺度的用户行为建模。然而,缺乏统一的长时轨迹生成和评估平台,限制了系统在真实复杂环境中的表现。现有基准如LlamaIndex的长时记忆测试,主要关注单一任务,忽视行为的因果关系和多场景协调。本文提出的DynamicMem通过模拟真实用户的多应用、多时间尺度行为变化,弥补了这一空白,为未来多模态、多场景的个性化系统提供了评估标准。

核心问题

当前的长时记忆评估多局限于静态快照或短期对话,难以反映用户行为的动态演变。真实用户的属性、习惯和偏好在不同时间尺度上变化,且受外部事件驱动,行为散布在多个应用中,缺乏统一的因果关系建模。现有系统在保持事实稳定性和动态更新方面表现不佳,导致个性化服务的准确性和连续性不足。此外,缺乏长时间、多应用、多任务的系统性评估工具,限制了技术的实际应用推广。

核心创新

本文的核心创新在于提出了基于因果关系驱动的轨迹合成框架,结合多时间尺度的用户模型,将属性、习惯和偏好分离建模,模拟其在外部事件影响下的演变。通过多应用的状态一致日志生成,确保行为的跨应用协调。引入五个季度的检查点评估策略,系统性分析模型在长时间轨迹中的表现变化。该方法首次实现了在隐私保护前提下,模拟真实用户长时间、多场景、多任务的行为轨迹,为长时记忆评估提供了全新视角。

方法详解

  • �� 构建静态基础用户画像,结合生命周期信息。• 利用外部事件(如季节变化、重大事件)驱动属性、习惯、偏好的因果演变。• 设计多任务生成机制,分别模拟属性、习惯、偏好的状态完成和个性化服务任务。• 通过多应用环境中的状态一致日志,确保行为的逻辑性和一致性。• 在每个季度检查点,评估模型对当前用户状态的恢复能力和服务能力。• 采用因果关系标注,确保行为变化合理,避免随机漂移。• 利用大规模LLMs生成多应用交互日志,模拟真实用户行为。• 结合人工验证,确保轨迹的合理性和一致性。

实验设计

采用PersonaHub生成的10个用户轨迹,覆盖6个生活领域,16个应用,66个API,轨迹长度超过15个月,包含1790个事件链和17715个应用日志。评估指标包括状态完成准确率和个性化服务成功率。对比多种记忆系统(如Retrieval-Augmented、External Memory、Policy-based)在不同时间点的表现。通过 ablation 研究验证因果关系驱动和多时间尺度模型的贡献。设置不同的历史长度,分析系统在长时间轨迹中的性能变化。采用人工验证确保生成轨迹的真实性和一致性。

结果分析

实验显示,随着轨迹长度增加,状态完成任务的准确率从85%降至65%,反映出记忆存储和检索的挑战。大部分错误源于检索不准确,超过93%的失败归因于检索阶段。不同系统在保持不变事实方面表现差异显著,未能同时正确更新变化事实。偏好和实体命名错误频繁出现,表明模型在动态事实维护上仍有较大提升空间。这些结果强调了长时记忆系统在因果关系建模和多应用协调方面的不足,为未来优化提供了方向。

应用场景

该基准适用于评估个性化智能助理、推荐系统和多模态交互系统的长时记忆能力。通过模拟真实用户行为,为行业提供改进个性化服务的技术依据。未来可结合隐私保护机制,推动商业化应用,提升用户体验。长远来看,该框架有助于构建更智能、更适应变化的个性化系统,满足复杂、多变的实际需求。

局限与展望

模型在应对突发事件和极端行为变化时表现尚不理想,因果关系模拟仍需完善。轨迹生成的计算成本较高,限制了大规模应用。对多模态数据的整合不足,未来需引入图像、语音等多源信息以丰富行为表现。模型在极端变化场景下的适应性和泛化能力仍需提升。

通俗解读 非专业人士也能看懂

想象你有一个超级智能的朋友,他每天都在帮你记事、安排日程、了解你的喜好。可是,这个朋友不可能每天都见面,只能靠你告诉他一些线索,比如你喜欢的运动、常去的餐厅、重要的节日。随着时间推移,你的喜好可能会改变,比如喜欢上了新的运动,或者搬到新地方。这个朋友需要根据你散落在不同应用中的小线索,逐步拼凑出你的最新状态,帮你安排更贴心的生活。DynamicMem就像这个朋友,它用一套聪明的方法,从你过去的行为中学习、推断你的变化,确保每次帮你做事都符合你现在的需求。它模拟了你长达15个月的生活轨迹,跨越多个应用,理解你在不同时间点的真实状态,帮助未来的智能助手变得更聪明、更贴心。

简单解释 像给14岁少年讲一样

你知道吗?想象你有个超级厉害的朋友,他能记住你所有的秘密、喜好和习惯,还能随着时间帮你安排一切。可是,这个朋友每天都在不同的地方,比如你的手机、电脑、社交媒体,他只能通过你发的点点滴滴来猜测你的最新状态。比如,你喜欢的运动、喜欢吃的东西、甚至你心里的秘密。随着时间推移,你可能会喜欢上新的运动,或者搬到新城市。这个朋友要不断学习,理解你这些变化,还要确保每次帮你安排事情都符合你现在的想法。研究人员开发了一个叫DynamicMem的系统,就像这个朋友一样,能用15个月的时间,观察你在不同应用中的行为,学习你的变化,帮你更好地生活。它还会在不同时间点检查,看看自己记得是否准确,确保每次都能帮你做最合适的事情。未来,这样的系统会让我们的智能助手变得更聪明、更贴心,帮我们解决更多复杂的问题!

原文摘要

LLM agents increasingly act as personal assistants that must remember a user's profile over months: who they are (attributes), what they routinely do (habits), and what they prefer (preferences), and keep it updated as jobs, routines, and tastes drift. Existing benchmarks evaluate this "memory" ability through short, simplified interactions, missing three core properties of real behavior: the profile is heterogeneous, with attributes, habits, and preferences evolving on different timelines; changes are driven by external context such as seasons and life events; and evidence is rarely stated explicitly, instead scattered across many small actions in different apps that a memory system must infer from. We introduce DynamicMem, a synthetic benchmark that constructs 15 months of activity per user, providing long-term multi-app data that real users' privacy keeps out of reach. It provides user-consistent trajectories averaging 2.2M tokens and 1,772 grounded events per user across 16 applications such as e-commerce, fitness, and social platforms. The profile evolves over this period and is never given explicitly: each attribute, habit, or preference must be inferred from small signals scattered across apps. We evaluate at five quarterly checkpoints to track how systems scale as history grows. Benchmarking five representative systems exposes problems a single accuracy score hides: (i) profile reconstruction degrades with history length while service-task accuracy stays flat, despite both drawing on the same memory; (ii) no system both keeps facts that stay true and replaces facts that change, with errors clustering on preferences and on naming the exact referent; and (iii) over 93% of failures trace to what the memory retrieves, not to the model writing the answer, so the largest room for improvement lies in memory itself. Code: https://wenyaxie023.github.io/DynamicMem/

cs.CL