Fortunate Recall: Ontology-Driven Memory Lifecycle Management for Persistent Coherence in LLMs

TL;DR

Fortunate Recall通过10+1行为本体和生命周期策略,提升LLM记忆管理精度,LifecycleBench得分76.9%。

cs.AI 🔴 高级 2026-09-10 79 次浏览
Ansuman Mullick Eray Tüzün
大语言模型 记忆管理 行为本体 生命周期策略 实验验证

核心发现

方法论

Fortunate Recall (FR) 提出了一种基于10+1行为本体的生命周期策略层,通过分类个人事实并应用差异化的衰减、替代、事件时间有效性等策略,优化LLM记忆管理。FR-Bank作为独立实现,结合LLM元数据提取与确定性函数计算,确保高效性。

关键结果

  • FR-Bank在LifecycleBench基准测试中得分76.9%,显著超过Mem0 (61%)、A-MEM (65.3%)等基线方法。
  • 在LongMemEval-S基准测试中,FR-Bank在Wu等人评估协议下得分75.2%,与标准检索性能无显著差异。
  • FR-Bank将回答查询的虚构率从Mem0的45.1%降低到22.4%,同时正确回答比例从18.6%提高到31.2%。

研究意义

本研究通过引入行为本体和生命周期管理策略,解决了LLM记忆系统中信息过载和检索精度下降的问题。它为长期对话中的一致性维护提供了新的思路,并显著减少了虚构内容的生成,提升了LLM在实际应用中的可靠性。

技术贡献

技术贡献包括:1) 提出基于行为动态的10+1本体分类;2) 开发了可组合的生命周期策略层,支持差异化的记忆管理;3) 发布了LifecycleBench基准测试,用于评估时间分辨能力;4) 提供了基础设施无关的实现FR-Bank,验证了方法的普适性。

新颖性

该研究首次将行为本体引入LLM记忆管理,区别对待不同类型的事实,提出了基于元数据的确定性生命周期策略,与现有基于RL或统一衰减的系统相比,显著提升了性能和一致性。

局限性

  • FR-Bank在AV7测试中表现较差,仅有5%的检索通过率,表明其在处理显式撤回信息时存在不足。
  • 生命周期策略的10+1分类可能并非最优,未来需要进一步优化。
  • 对LLM的依赖可能导致在低算力环境中的应用受限。

未来方向

未来工作包括优化行为本体分类以提升策略精度,扩展生命周期策略以支持更多复杂场景,并探索在资源受限环境中的高效实现。

AI 总览摘要

当前的大语言模型(LLM)记忆系统无法区分不同类型的个人事实,导致存储无限增长和检索精度下降。为了解决这一问题,本文提出了Fortunate Recall (FR),一种基于10+1行为本体的生命周期管理策略。FR通过分类个人事实并应用差异化的策略(如时间衰减、替代、事件时间有效性等),优化了LLM的记忆管理。

FR-Bank作为FR的独立实现,在LifecycleBench基准测试中得分76.9%,显著优于现有方法(如Mem0和A-MEM)。此外,在LongMemEval-S基准测试中,FR-Bank在Wu等人评估协议下得分75.2%,表明生命周期策略不会对标准检索任务造成显著性能损失。实验还表明,FR-Bank显著减少了虚构内容生成率,并提高了正确回答比例。

尽管FR在许多方面表现出色,但其在处理显式撤回信息的能力上仍有提升空间。未来的研究方向包括优化行为本体分类、扩展生命周期策略的适用范围以及提高其在资源受限环境中的效率。FR的代码、基准测试和本体已公开,为后续研究提供了重要资源。

深度分析

研究背景

大语言模型(LLM)在长期对话中容易失去一致性,这是因为现有的记忆系统对所有个人事实一视同仁,未能根据事实的行为类型进行差异化管理。近年来,诸如Mem0、A-MEM、MemoryOS等系统在记忆存储和检索方面取得了一定进展,但它们未能有效解决信息过载和检索精度下降的问题。

核心问题

核心问题在于LLM记忆系统的生命周期管理。现有系统无法区分当前偏好与过时信息,也无法识别过期的时间敏感信息。这种缺陷导致存储增长失控,检索精度逐渐下降,影响了LLM在长期对话中的一致性和可靠性。

核心创新

FR的核心创新在于提出了10+1行为本体,将个人事实分类为不同的行为类型,并为每种类型设计了特定的生命周期管理策略。这些策略包括差异化的时间衰减、基于槽键的替代、事件时间有效性和类别感知的检索路由。与现有方法相比,FR的本体分类直接基于事实的行为动态,而非认知类型,显著提升了记忆管理的精度。

方法详解

  • �� FR使用LLM提取元数据,包括行为类别、槽键、生命周期状态、事件时间锚点等。
  • �� 每条事实被分类为10+1行为类别之一,每个类别有特定的生命周期策略,如差异化衰减率和事件时间有效性。
  • �� 检索时,FR结合语义候选集和类别感知的候选集,通过轻量级LLM模型筛选前20个候选,然后应用确定性生命周期策略进行排序。
  • �� 生命周期策略层完全基于数学函数,无需额外训练,具有高效性和可解释性。

实验设计

实验使用了LifecycleBench和LongMemEval-S两个基准测试。LifecycleBench包含516个问题,涵盖40个虚拟用户角色和9种攻击向量,用于测试时间分辨能力。LongMemEval-S则是一个500问题的长时记忆评估基准。实验还包括对FR-Graphiti的多种配置消融实验,以及在独立构建的BEAM基准上的迁移测试。

结果分析

FR-Bank在LifecycleBench中得分76.9%,显著超过Mem0 (61%)和A-MEM (65.3%)。在LongMemEval-S中,FR-Bank得分75.2%,与标准检索性能无显著差异。此外,FR-Bank将虚构率从Mem0的45.1%降低到22.4%,正确回答率从18.6%提升至31.2%。

应用场景

FR适用于需要长期对话一致性的场景,如虚拟助手、个性化推荐和客户服务等。其行为本体分类和生命周期管理策略可显著提升这些应用的可靠性和用户体验。

局限与展望

FR在处理显式撤回信息时表现不佳,AV7测试中检索通过率仅为5%。此外,10+1行为本体分类可能并非最优,未来需要进一步优化。对LLM的依赖也可能限制其在低算力环境中的应用。

通俗解读 非专业人士也能看懂

想象一个图书馆,里面有很多书,每本书代表一个记忆。传统LLM会把所有书都放在一个大书架上,不管它们是否过时。而FR就像一个聪明的图书管理员,它会根据书的类型决定如何管理:有些书需要长期保存,有些书会过期被替换。比如,你喜欢的食物可能会变,但你的名字不会。FR通过这种分类和管理,让LLM在需要时能更快找到正确的书,而不是在一堆无用的书中浪费时间。

简单解释 像给14岁少年讲一样

想象你有一个超大的记事本,记下了所有的事情,比如你喜欢的食物、朋友的生日、还有你上周看的电影。可是,时间长了,记事本会变得乱七八糟!FR就像一个超级整理高手,它会帮你把记事本分成不同的部分,比如‘喜欢的东西’、‘重要的日期’等等。然后,它会自动把过时的东西删掉,比如你已经不喜欢的食物,或者已经过去的事情。这样,你的记事本就一直很整洁,随时能找到你需要的东西!

术语表

行为本体 (Behavioral Ontology)

将个人事实分类为10+1种行为类型的框架,用于指导记忆生命周期管理。

用于决定每种事实的生命周期策略,如衰减率和检索路由。

生命周期策略 (Lifecycle Policies)

针对不同类型事实的特定管理规则,包括时间衰减、替代和事件时间有效性等。

用于优化LLM的记忆管理,减少虚构和过时信息。

虚构率 (Confabulation Rate)

模型生成错误或虚假信息的比例,反映了记忆系统的一致性。

用于评估FR在回答查询时的准确性。

LifecycleBench

一个包含516个问题的基准测试,用于评估LLM的时间分辨能力和生命周期管理性能。

用于验证FR的性能提升。

FR-Bank

FR的独立实现版本,结合LLM元数据提取与确定性生命周期策略。

在实验中用于验证FR的普适性和高效性。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化行为本体分类以提升策略精度?
  • 2 如何在低算力环境中高效实现FR的生命周期策略?
  • 3 是否可以扩展FR以支持更复杂的记忆场景?

应用场景

近期应用

虚拟助手优化

提高虚拟助手在长期对话中的一致性,减少错误信息生成,提升用户体验。

个性化推荐

通过动态管理用户偏好数据,为用户提供更精准的个性化推荐服务。

远期愿景

智能记忆系统

开发能够长期学习和适应用户需求的智能记忆系统,支持更复杂的应用场景。

原文摘要

Current LLM memory systems treat all personal facts identically, so stores grow without bound while retrieval precision degrades. The core challenge is lifecycle management: which memories should persist, which should be replaced, and at what rate, conditioned on the behavioral type of each fact. Fortunate Recall (FR) is a composable policy layer that classifies personal facts into a 10+1 behavioral ontology and applies category-specific lifecycle policies (differential temporal decay, slot-key supersession, event-time validity, and category-aware retrieval routing) as deterministic functions over LLM-extracted metadata. FR-Bank, our infrastructure-independent implementation, reaches a 76.9% pass rate on LifecycleBench, a new 516-question temporal-disambiguation benchmark, ahead of Mem0, A-MEM, Memory-R1, and MemoryOS (61% to 70.5%), and 75.2% on the full LongMemEval-S under the canonical Wu et al. judge protocol, so lifecycle policies impose no measurable cost on standard retrieval. A pre-registered ablation locates the gains: replacing the typed layer with three generic lifecycle primitives leaves correctness statistically unchanged (-1.7pp, 95% CI [-6.0, +2.7]), so the generic lifecycle metadata carries the correctness advantage, while the behavioral ontology carries calibration, halving downstream confabulation (12.0% vs 24.2%, p<0.001). End-to-end, FR-Bank cuts confabulation from Mem0's 45.1% to 22.4% over answered queries and from 32.2% to 13.0% over all queries while answering more of them correctly (31.2% vs 18.6%); the ranking replicates on the open-weight Kimi K2.5. The decomposition transfers to BEAM, an independently built benchmark: 46.8% correct vs Mem0's 32.9% over 280 questions, with the ontology's benefit concentrated in contradiction resolution and saturating near seven policy clusters. The ontology, benchmark, and code are released.

cs.AI