Agentic Recommender System with Hierarchical Belief-State Memory

TL;DR

提出MARS,采用三层记忆结构,提升推荐性能,HR@1提升26.4%。

cs.CL 🔴 高级 2026-05-14 20 次浏览
Xiang Shen Yuhang Zhou Yifan Wu Zhuokai Zhao Siyu Lin Lei Huang Qianqian Zhong Lizhu Zhang Benyu Zhang Xiangjun Fan Hong Yan
推荐系统 记忆增强 层次化信念状态 大语言模型 动态生命周期

核心发现

方法论

本文提出的MARS框架将推荐任务建模为部分可观测马尔可夫决策过程(POMDP),通过三层结构(事件、偏好、画像记忆)逐步抽象用户行为信号。事件记忆存储原始行为数据,偏好记忆维护细粒度偏好块,画像记忆则生成用户自然语言画像。引入六个操作(提取、强化、弱化、整合、遗忘、重构),由基于大语言模型(LLM)的调度器动态调控,避免固定周期。实验在四个InstructRec基准域中,MARS在HR@1和NDCG@10指标上分别超越最优基线26.4%和10.3%。

关键结果

  • 在四个数据集上,MARS显著优于传统和基于LLM的推荐方法,HR@1平均提升26.4%,NDCG@10提升10.3%。在动态演化场景中,调度策略进一步提升性能,验证了生命周期管理的有效性。
  • 与MemRec和i2Agent等方法相比,MARS在推荐精度和记忆管理效率上表现优异,特别是在偏好变化频繁的场景中,调度机制带来明显优势。
  • 消融实验显示,层次化记忆结构和自适应调度是性能提升的关键因素,避免了平面记忆的局限性。

研究意义

该研究突破了推荐系统中记忆表示的局限,提出层次化信念状态模型,有效融合短期行为信号与长期偏好,推动个性化推荐向更具解释性和适应性的方向发展。其动态生命周期管理机制,为未来智能推荐系统提供了理论基础和工程实践路径,有望在电商、内容推荐等领域实现更精准、更个性化的用户体验。

技术贡献

技术创新在于引入三层结构的信念状态,结合强化学习思想设计完整生命周期操作,利用LLM调度实现自适应记忆维护。不同于传统平面记忆或静态模型,MARS实现了偏好抽象、动态演化与语义表达的深度融合,为推荐系统中的记忆管理提供新范式。

新颖性

首次提出层次化的信念状态模型,结合完整生命周期操作与LLM调度,系统性解决偏好抽象与记忆演化的难题,超越现有平面或静态记忆方法,具有理论创新和工程实用价值。

局限性

  • 模型依赖大规模预训练LLM,计算成本较高,难以在资源有限环境中部署。
  • 偏好块的自动生成和合并策略尚需优化,可能影响偏好表达的准确性和一致性。
  • 在极端稀疏或偏好快速变化场景下,记忆管理策略仍存在一定局限。

未来方向

未来将探索多模态信号融合,提升偏好建模的丰富性;优化调度策略以降低计算开销;扩展到多任务和跨域推荐场景,增强系统的泛化能力。

AI 总览摘要

随着互联网内容的爆炸式增长,个性化推荐系统成为连接用户与内容的关键桥梁。传统方法多依赖协同过滤或深度学习模型,虽取得一定成功,但在理解用户意图、动态偏好变化方面存在明显局限。近年来,基于大语言模型(LLM)的推荐系统崭露头角,赋予系统更强的语义理解和推理能力,但缺乏有效的记忆管理机制,难以持续积累用户偏好。本文提出的MARS(Memory-Augmented Agentic Recommender System)通过引入层次化信念状态,结合动态生命周期管理,显著提升推荐性能。

MARS架构包括事件、偏好和画像三层记忆,分别存储原始行为信号、细粒度偏好块和用户自然语言画像。系统设计六个操作(提取、强化、弱化、整合、遗忘、重构),由基于LLM的调度器自主调控,实现记忆的自适应维护。这一机制有效平衡了记忆新鲜度与计算成本,确保偏好信息的准确性和时效性。

在四个不同的InstructRec基准域中,MARS在HR@1和NDCG@10指标上分别超越最优基线26.4%和10.3%,展现出优异的推荐效果。实验还验证了层次化记忆结构和调度策略在偏好追踪中的关键作用,为未来个性化推荐提供了新的技术路径。尽管如此,模型对大规模预训练LLM的依赖和在极端场景下的适应性仍需优化,未来工作将聚焦多模态融合和跨域扩展,推动推荐系统向更智能、更个性化的方向发展。

深度分析

研究背景

推荐系统经历了从协同过滤到深度学习的演变,诸如BPR、LightGCN、SASRec等模型在静态场景中表现优异,但难以应对用户偏好的动态变化。近年来,LLM的引入赋予推荐系统更强的语义理解能力,但缺乏有效的记忆机制,限制了个性化的深度发展。现有的记忆增强方法多为平面或静态结构,未能系统性地管理偏好的抽象、演化与遗忘,阻碍了推荐系统的持续优化。

核心问题

核心挑战在于如何构建一个能动态抽象、管理偏好变化的记忆体系,既要捕捉短期行为信号,又要维护长期偏好,避免信息冗余或冲突。现有方法多采用固定周期或简单启发式,缺乏灵活调度机制,导致偏好信息滞后或过时,影响推荐效果。此外,缺少完整的生命周期管理,使得偏好偏移难以及时反映,限制了系统的适应性。

核心创新

本研究的创新点包括:1)提出三层层次化信念状态,分别存储原始行为、偏好块和用户画像,增强偏好抽象能力;2)设计完整的六操作生命周期(提取、强化、弱化、整合、遗忘、重构),由LLM调度实现自适应维护;3)引入动态调度策略,避免固定周期带来的局限,提升偏好追踪的实时性和准确性。这些创新共同推动推荐系统向更具解释性和适应性的方向发展。

方法详解

  • �� 构建POMDP模型,将用户偏好视为隐藏状态,行为信号为部分观测。• 设计三层记忆结构:事件存储原始行为,偏好存储细粒度偏好块,画像生成用户自然语言描述。• 每层记忆由专门的操作(提取、强化、弱化、合并、遗忘、重构)管理,操作由LLM调度器自主选择。• 采用贝叶斯滤波等方法进行偏好更新,结合偏好强度和证据追踪,确保偏好演化的合理性。• 通过调度策略动态决定何时进行偏好提取、合并或遗忘,保持记忆的最新性和有效性。• 最终利用自然语言生成的画像和偏好块作为输入,进行个性化排序,提升推荐准确率。

实验设计

在四个InstructRec基准域(Books、Goodreads、MovieTV、Yelp)上,采用留一法评估推荐效果。对比传统模型(BPR、LightGCN、SASRec)和LLM基础方法(LLMRank、MemRec、i2Agent),指标包括HR@1、NDCG@10。设置不同记忆调度策略(固定与调度),验证生命周期管理的效果。参数包括最大记忆长度Lmax=15,偏好块容量K,调度频率等,确保公平比较。实验还包括消融分析,验证层次化结构和调度策略的贡献。

结果分析

MARS在所有域中均优于对比模型,HR@1平均提升26.4%,NDCG@10提升10.3%。调度策略显著优于固定调度,尤其在偏好快速变化场景中表现更佳。消融实验显示,层次化记忆和自适应调度是性能提升的核心因素。结果表明,系统能更准确捕捉用户偏好变化,提升个性化推荐的精度和鲁棒性。

应用场景

该方法适用于电商、内容平台、社交媒体等场景,能实现更精准的用户画像和内容匹配。依赖大规模预训练LLM,适合资源充足的企业部署。未来可扩展到多模态数据融合和跨域推荐,增强系统的适应性和泛化能力。

局限与展望

模型对大规模LLM依赖,计算成本高,难以在低资源环境中部署。偏好块的自动生成和合并策略仍需优化,可能影响偏好表达的准确性。极端稀疏或偏好快速变化场景下,记忆管理策略仍有改进空间。

通俗解读 非专业人士也能看懂

想象你在经营一家餐厅,你每天都要记住每位常客喜欢吃什么、偏好什么口味。以前你可能用纸笔记下来,但每次客人点餐时都要翻一翻,容易忘记细节。现在,你用一个智能助手,它不仅记住每个客人的偏好,还能根据他们最近的点餐行为,自动调整记忆内容。这个助手会把信息分成三层:第一层是他们最近点的菜(原始信号),第二层是他们偏爱的菜系或口味(偏好块),第三层是用自然语言描述的完整画像(整体用户画像)。每当有新信息时,助手会决定是加强某个偏好、淡化一些信息、合并相似偏好,还是忘记一些过时的内容。这些操作由一个聪明的调度系统自主决定,确保记忆既新鲜又不繁琐。这样,餐厅的服务变得更贴心,客人也更满意。这个系统就像一个聪明的厨师助手,能不断学习和调整,帮你更好地了解每位客人的需求。

简单解释 像给14岁少年讲一样

想象你在学校里有很多朋友,每个人都喜欢不同的游戏和食物。有时候你会忘记谁喜欢什么,或者朋友的兴趣发生了变化。现在,假设你有一个超级聪明的朋友,他不仅记住了每个人的喜好,还会根据你们最近的聊天内容,帮你整理出每个人的最新兴趣。这个朋友会把信息分成三部分:第一部分是你们最近的对话(原始行为),第二部分是朋友们喜欢的类型(偏好块),第三部分是用一句话总结每个人的性格和兴趣(整体画像)。每次你们有新聊天,他会决定是加强某个兴趣、淡化一些旧的偏好、合并相似的兴趣,还是忘记一些不再重要的内容。这一切都由他自己决定,不需要你操心。这样,你就能更快了解朋友们的最新喜好,和他们相处得更开心。这就像一个聪明的朋友,帮你记住所有重要的事情,还会不断调整,变得越来越懂你。

原文摘要

Memory-augmented LLM agents have advanced personalized recommendation, yet existing approaches universally adopt flat memory representations that conflate ephemeral signals with stable preferences, and none provides a complete lifecycle governing how memory should evolve. We propose MARS (Memory-Augmented Agentic Recommender System), a framework that treats recommendation as a partially observable problem and maintains a structured belief state that progressively abstracts noisy behavioral observations into a compact estimate of user preferences. MARS organizes this belief state into three tiers: event memory buffers raw signals, preference memory maintains fine-grained mutable chunks with explicit strength and evidence tracking, and profile memory distills all preferences into a coherent natural language narrative. A complete lifecycle of six operations -- extraction, reinforcement, weakening, consolidation, forgetting, and resynthesis -- is adaptively scheduled by an LLM-based planner rather than fixed-interval heuristics. Experiments on four InstructRec benchmark domains show that MARS achieves state-of-the-art performance with average improvements of 26.4% in HR@1 and 10.3% in NDCG@10 over the strongest baselines with further gains from agentic scheduling in evolving settings.

cs.CL cs.AI