Latent Personal Memory: Represent personal memory as dynamic soft prompts

TL;DR

LPM通过动态软提示实现个性化,提升PersonaMem v1准确率8.8%,减少KV缓存64倍。

cs.CL 🔴 高级 2026-06-19 5 次浏览
Debrup Das Avinash Amballa Yashas Malur Saidutta Vijay Srinivasan Vivek Kulkarni Srinivas Chappidi
个性化 大语言模型 动态软提示 记忆表示 效率提升

核心发现

方法论

LPM通过将用户历史表示为N个潜在槽的紧凑矩阵,并使用共享的交叉注意力投影网络将这些槽映射为动态输入条件的软提示,前置于冻结的大语言模型输入。该方法在不修改基础模型的情况下实现个性化。

关键结果

  • 在PersonaMem v1上,LPM比LoRA提高8.8%,比Prompt Tuning提高54.4%,同时KV缓存使用减少64倍。
  • 在LoCOMO上,LPM与LoRA的准确率相当,但训练参数减少120倍。
  • LPM在128K上下文长度下的效率优于全上下文方法。

研究意义

LPM在学术界和工业界具有重要意义。它解决了大规模个性化中计算效率和存储需求的问题,同时保持了模型的通用能力。这为个性化大语言模型提供了一种可扩展的方法。

技术贡献

LPM通过将用户历史压缩为潜在记忆槽,避免了修改基础模型,提供了一种新的参数高效微调方法。它在不增加训练复杂性的情况下,显著减少了KV缓存使用。

新颖性

LPM首次将用户历史表示为潜在记忆槽,并通过动态软提示实现个性化。这与传统的文本空间记忆方法有本质区别,提供了更高效的个性化解决方案。

局限性

  • LPM在记忆精确事实方面表现不佳,可能需要结合文本记忆方法。
  • 记忆槽的长短期捕获能力可能需要进一步优化。

未来方向

未来研究可以探索混合记忆方法,结合显式事实缓存以提高精确记忆能力。此外,可以研究如何优化记忆槽以更好地捕获长短期用户信息。

AI 总览摘要

个性化大语言模型需要在保持计算效率和模型通用能力的同时,编码用户特定的长期行为模式。现有方法难以同时满足这些要求。我们提出了潜在个人记忆(LPM),通过将用户历史表示为潜在槽的紧凑矩阵,并使用共享的交叉注意力投影网络将其映射为动态软提示,前置于冻结的大语言模型输入。实验表明,LPM在PersonaMem v1和LoCOMO基准上表现优异,显著减少了KV缓存使用和训练参数量。LPM在长上下文长度下的效率也优于全上下文方法。这项研究为个性化大语言模型提供了一种可扩展且高效的方法,具有重要的学术和工业意义。未来研究可以探索混合记忆方法,以提高精确记忆能力,并优化记忆槽以更好地捕获用户信息。

深度分析

研究背景

个性化大语言模型需要在保持计算效率和模型通用能力的同时,编码用户特定的长期行为模式。现有方法如LoRA和Prompt Tuning在参数效率和表达能力上存在不足。

核心问题

现有个性化方法难以同时满足计算效率、可扩展性和模型通用能力的要求。尤其是在处理长上下文和用户历史时,现有方法的计算开销和存储需求过高。

核心创新

LPM通过将用户历史表示为潜在槽的紧凑矩阵,并使用共享的交叉注意力投影网络将其映射为动态软提示,实现了高效的个性化。这种方法避免了修改基础模型,显著减少了KV缓存使用。

方法详解

  • �� 将用户历史表示为潜在槽的紧凑矩阵
  • �� 使用共享的交叉注意力投影网络
  • �� 将潜在槽映射为动态软提示
  • �� 前置于冻结的大语言模型输入

实验设计

在PersonaMem v1和LoCOMO基准上进行评估,使用Qwen3-1.7B, 4B, 8B模型。比较基线包括LoRA和Prompt Tuning,评估指标包括准确率和KV缓存使用。

结果分析

LPM在PersonaMem v1上比LoRA提高8.8%,比Prompt Tuning提高54.4%,KV缓存使用减少64倍。在LoCOMO上,LPM与LoRA的准确率相当,但训练参数减少120倍。

应用场景

LPM适用于需要高效个性化的大语言模型应用场景,如个性化推荐和智能助手。其低存储需求和高计算效率使其适合大规模部署。

局限与展望

LPM在记忆精确事实方面表现不佳,可能需要结合文本记忆方法。记忆槽的长短期捕获能力可能需要进一步优化。

通俗解读 非专业人士也能看懂

想象一个图书馆,LPM就像是一个聪明的图书管理员,他能快速找到你需要的书,而不必每次都翻遍整个图书馆。这就像你有一个小笔记本,记录了你最常看的书的书名和位置。当你需要一本书时,图书管理员会根据你的需求,从笔记本中找到相关的书,并快速递给你。这种方法既节省时间,又不需要占用太多空间。

简单解释 像给14岁少年讲一样

想象你在学校有一个超级记忆的朋友,他能记住你所有的喜好和习惯。每次你有问题,他都能根据你过去的表现给出最合适的建议,而不需要重新学习。这就是LPM的工作原理!它就像一个聪明的助手,能快速理解你的需求,给出最好的答案。是不是很酷?

术语表

潜在个人记忆 (Latent Personal Memory)

一种将用户历史表示为潜在槽的紧凑矩阵的方法,能够高效地实现个性化。

在论文中用于表示用户特定的长期行为模式。

动态软提示 (Dynamic Soft Prompts)

根据输入条件动态生成的提示,前置于大语言模型输入。

用于实现个性化的关键组件。

交叉注意力投影网络 (Cross-attention Projection Network)

用于将潜在槽映射为动态软提示的网络。

在LPM中用于实现用户历史的动态映射。

KV缓存 (KV-cache)

存储用于自注意力机制的键值对的缓存。

在LPM中通过潜在槽减少使用。

LoRA

一种参数高效的微调方法,通过训练小规模的用户权重实现个性化。

作为LPM的对比基线方法之一。

开放问题 这项研究留下的未解疑问

  • 1 如何结合显式事实缓存以提高LPM的精确记忆能力?
  • 2 如何优化记忆槽以更好地捕获长短期用户信息?

应用场景

近期应用

个性化推荐

LPM可以用于个性化推荐系统,通过动态软提示提高推荐的准确性和相关性。

远期愿景

智能助手

LPM可以应用于智能助手,通过高效的个性化提高用户交互体验。

原文摘要

Personalizing large language models (LLMs) requires encoding long-term, user-specific behavioral patterns in a way that is computationally efficient, scalable, and compatible with a frozen base model. We present Latent Personal Memory (LPM), a scalable framework that represents user-specific history as a compact, persistent matrix of N latent slots, that are interpretable. A shared cross-attention projection network maps these slots into dynamic, input-conditioned soft prompts that are prepended to the input of a frozen LLM. We evaluate LPM on PersonaMem v1 and LoCOMO benchmarks across Qwen3-1.7B, 4B, and 8B backbones. Results demonstrate that LPM outperforms LoRA and Prompt Tuning by up to 8.8% and 54.4% in overall accuracy respectively on PersonaMem v1, while reducing KV-cache usage by over 64x. On LoCoMo, LPM matches LoRA accuracy with 120x fewer trainable parameters. We also show that the efficiency of LPM grows with context length and outperforms full-context at 128K context length.

cs.CL cs.AI