SlimPer: Make Personalization Model Slim and Smart

TL;DR

SlimPer通过迭代优化<用户-物品>知识库,降低模型复杂度,提升推荐效率。

cs.IR 🔴 高级 2026-07-14 44 次浏览
Siqi Wang Xianjie Chen Shaofeng Deng Albert Chen Romil Shah Jiawei Huang Zhaoqin Wang Zhang Zhang Yiqun Liu Meilei Jiang Anish Dubey Moyan Mei Tongxin Wang Nathan Berrebbi Misael Manjarres Armand Sauzay Shardul Kothapalli Aryaman Vinchhi Kevin Johnstone Juheon Lee Gufan Yin Ziheng Huang Justin Lin Mert Terzihan Yilin Qi Cynthia Yang Colin Peppler Qi Ding Ruohan Sun Ge Song Litao Deng Parichay Kapoor Matt Ma Huihui Cheng Jiyuan Zhang Yanli Zhao Yiping Han Fangqiu Han Ning Yao Arun Singh Jordan Edwards Zhengyu Su Abhishek Kumar Guangdeng Liao Ankit Asthana
推荐系统 Transformer 模型压缩 知识库 效率优化

核心发现

方法论

本文提出SlimPer架构,将个性化排序转化为对<用户-物品>知识库的迭代优化。模型在每层通过选择性查询多模态用户端Token,计算显式相关性匹配分数,并更新知识库,避免维护随输入序列增长的巨大中间表示。采用固定大小的知识库(K×d),每层实现O(N)复杂度,解耦模型深度与用户历史长度。引入请求共享机制,减少内存消耗。模型融合稀疏、密集和序列特征,利用注意力机制实现可解释性。整体架构包括多层堆叠的Select–Match–Refine循环,支持深层理解用户偏好。

关键结果

  • 在Instagram Reels和Feed上部署,SlimPer在用户参与度指标上优于传统Transformer模型,提升约5-8%。在处理超过1万条用户行为事件时,模型保持低延迟和内存消耗。实验证明,深层模型(10层)在理解复杂用户偏好方面优于浅层模型(5层),且模型参数显著减少(约30%)。
  • 通过消融实验验证,固定大小知识库(64×d)在保持性能的同时,显著降低了计算成本。请求共享机制使得用户端Token在多候选物品中复用,减少了50%的内存占用。模型在多模态特征融合方面表现优异,优于基于Transformer的多模态模型。
  • 模型的可解释性通过attention机制实现,能直观关联推荐结果与用户历史事件,增强模型透明度。多任务训练提升了模型在多指标(点击率、停留时间等)上的表现,验证了其多样性和鲁棒性。

研究意义

该研究突破了Transformer在推荐系统中的结构限制,提出以知识库为核心的迭代优化框架,极大提升了模型的深度理解能力与计算效率。解决了传统Transformer在长序列处理中的内存瓶颈问题,为工业级推荐系统提供了新思路。模型的可解释性也为实际应用中的调试和优化提供便利,推动推荐算法向更高效、更透明方向发展。

技术贡献

本文创新性地将推荐任务抽象为知识库的迭代优化,打破了Transformer依赖逐Token预测的架构限制。提出固定大小知识库与全模态查询机制,确保深层理解的同时降低复杂度。引入请求共享机制,优化多候选物品的计算效率。模型融合稀疏、密集、序列特征,增强多模态表达能力。整体架构支持深层堆叠,提供理论上的信息容量保证。

新颖性

首次将个性化推荐中的序列建模转化为基于知识库的迭代优化,突破了Transformer在推荐中的结构限制。提出固定大小知识库与全模态查询的结合,显著降低复杂度。引入请求共享机制,优化多候选物品的计算效率,具有较强创新性。该方法在工业场景中实现高效、深层次的用户理解,填补了长序列推荐模型的空白。

局限性

  • 模型在极端长序列(超过10万行为事件)下仍可能面临信息稀释问题,知识库容量有限可能限制表现。
  • 在多模态特征极度不平衡(如稀疏类别极少或密集特征过多)时,模型的融合效果可能下降。
  • 尽管模型降低了内存和计算成本,但在极端高并发场景中仍需优化推理速度和硬件适配。

未来方向

未来将探索动态扩展知识库容量的方法,结合稀疏表示技术进一步提升长序列建模能力。考虑引入自适应层数机制,根据用户行为复杂度动态调整模型深度。此外,将结合强化学习优化知识库更新策略,提升模型在冷启动和新用户场景下的表现。

AI 总览摘要

随着推荐系统对个性化理解的需求不断提升,Transformer架构在工业界逐渐普及,但其固有的序列建模机制带来了高昂的计算和存储成本,尤其在处理长用户历史时表现不佳。本文提出的SlimPer架构,创新性地将个性化排序转变为对<用户-物品>知识库的迭代优化过程。模型在每一层通过选择性查询多模态用户端Token,计算显式相关性匹配分数,并更新固定大小的知识库,避免了传统Transformer中随输入序列增长的中间表示膨胀问题。这一设计实现了模型深度与用户历史长度的解耦,提升了理解能力的同时大幅降低了计算成本。实验证明,SlimPer在Instagram Reels和Feed的实际部署中,显著优于传统Transformer模型,不仅提升了用户参与度,还降低了系统复杂度。模型融合稀疏、密集和序列特征,提供了天然的可解释性,便于调试和优化。未来,该架构有望在更大规模、更复杂场景中推广,推动推荐系统向高效、深度、透明的方向发展。

深度分析

研究背景

推荐系统的发展经历了从传统协同过滤到深度学习的演进。Transformer架构在自然语言处理中的成功激发了其在推荐中的应用,出现如Interformer、OneTrans等模型,旨在建模长序列和多模态特征。然而,Transformer在推荐中的应用面临序列长度带来的计算瓶颈,尤其在工业场景中,长用户历史导致模型内存和推理速度难以满足需求。现有方法多采用稀疏注意力或两塔结构,但仍未根本解决模型深度与输入长度的矛盾。

核心问题

核心问题在于Transformer架构依赖逐Token预测,导致中间表示随序列增长而爆炸,难以在长序列上高效运行。推荐任务本质上是判别性预测,不需要逐Token生成,现有模型在保持高性能的同时,面临计算成本高、模型复杂度大的挑战。如何在保证模型理解能力的同时,降低内存和计算开销,是当前的瓶颈。

核心创新

本文提出将推荐任务抽象为知识库的迭代优化,打破序列建模的限制。创新点包括:1)引入固定大小的<用户-物品>知识库,避免中间表示随输入增长;2)每层通过全模态查询实现信息选择与匹配,提升效率;3)请求共享机制,减少重复计算;4)多模态融合能力强,支持稀疏、密集和序列特征的统一处理。这些创新共同实现了模型深度与输入长度的解耦,极大提升了系统效率。

方法详解

  • �� 输入:多模态特征(稀疏、密集、序列)经过tokenization转化为向量。• 知识库初始化:用非用户端Token通过线性映射得到固定大小的知识库(K×d)。• 层级操作:每层执行Select–Match–Refine:
  • �� 选择:利用QKV注意力从知识库中查询相关用户Token;
  • �� 匹配:计算显式点积相关性分数,生成多维模板;
  • �� 更新:结合匹配分数和密集特征,更新知识库,增强对用户偏好的理解。• 多层堆叠:多层递归优化,逐步深化用户偏好理解。• 训练:多任务目标,优化多指标(CTR、停留时间等),提升模型鲁棒性。

实验设计

在Instagram Reels和Feed两个场景中,采用真实用户行为数据,评估模型在点击率和留存指标上的提升。对比Transformer基线,SlimPer在参数量减少30%的情况下,提升了5-8%的用户参与度。通过消融实验验证固定知识库容量(64×d)和请求共享机制的有效性。模型在长序列(超过1万行为事件)上表现尤为优越,保持低延迟。

结果分析

实验证明,SlimPer在多个指标上优于传统Transformer模型,尤其在长序列场景中表现出色。模型参数减少显著,推理速度提升,内存占用降低50%。多模态特征融合效果优异,模型可解释性增强。深层模型(10层)在理解复杂偏好方面优于浅层(5层),验证了迭代优化的有效性。

应用场景

该模型适用于大规模工业推荐场景,能实时处理海量用户行为数据,提升个性化推荐质量。其架构便于部署在现有推荐系统中,支持多模态特征融合,适应多变的业务需求。未来可扩展到视频、电商、社交等多个领域,推动个性化推荐的深度发展。

局限与展望

模型在极端长序列(如超过十万行为事件)下仍可能面临信息稀释问题,知识库容量有限可能限制表现。多模态特征不平衡时效果不佳,模型在高并发场景中的推理速度仍需优化。未来需解决知识库动态扩展和多模态融合的鲁棒性问题。

通俗解读 非专业人士也能看懂

想象你在一家厨房做饭,厨师需要准备各种食材(用户行为、兴趣偏好等信息),但厨房空间有限,不能存放所有食材。于是厨师每次只拿出一部分重要的食材(知识库),根据菜谱(推荐目标)不断调整和补充这些食材,直到菜肴完成。这个过程就像SlimPer模型,每次只关注最关键的部分,不需要存放所有细节,反复优化,最终做出美味的菜肴(精准推荐)。这种方法比传统的把所有食材都放在桌子上(维护庞大中间表示)更高效,也更容易理解和调整。

简单解释 像给14岁少年讲一样

想象你在学校的图书馆找书,你不能一眼看完所有书(用户的全部行为历史),只能根据一些关键词(重要信息)逐步找到你想的书。每次你拿出一些关键词(知识库中的信息),看看是否能找到更接近的书,然后再调整关键词,直到找到最合适的那一本。这个过程就像SlimPer模型,它每次只关注最重要的线索,不需要一次性记住所有细节。这样既快又省力,还能找到你最喜欢的书(推荐内容)。它就像一个聪明的助手,反复帮你筛选、优化,最后给你最满意的建议。

术语表

知识库 (Knowledge Base)

一个固定大小的存储结构,用于存放用户偏好和物品信息,模型通过迭代优化它以实现推荐。

模型核心思想,将推荐任务转化为对知识库的迭代更新。

Select–Match–Refine

一种模型层级流程,包括选择相关Token、匹配相关性、更新知识库,提升效率和理解深度。

模型每层的基本操作流程。

请求共享 (Request-only Sharing)

在同一请求中,用户端Token只计算一次,复用到所有候选物品,减少重复计算。

优化多候选物品场景的计算效率。

多模态特征 (Multimodal Features)

融合稀疏、密集和序列等不同类型的用户和物品信息,提升模型表达能力。

模型输入的多样性特征。

迭代优化 (Iterative Refinement)

通过多层逐步更新知识库,增强模型对用户偏好的深层理解。

模型的核心创新机制。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端长序列(如百万行为)中保持信息完整性仍是挑战,未来需研究动态知识库扩展和稀疏表示技术。
  • 2 多模态特征融合在极端不平衡场景下效果有限,需探索更鲁棒的融合策略。

原文摘要

Transformer-style architectures are increasingly adopted for industrial recommendation systems, yet they inherit a design premise misaligned with the task: generative models rely on per-token autoregressive prediction, which justifies maintaining large intermediate tensors that scale with sequence length. In contrast, recommendation systems produce a single set of relevance scores for each <user, item> pair without token-level supervision. Leveraging this observation, we propose SlimPer, which reformulates personalized ranking as iterative refinement of a compact, unified <user, item> knowledge base. At each layer, the model selectively queries raw multi-modal user-side tokens, computes explicit relevance matching scores, and refines the knowledge base, all in O(N) per-layer cost with a fixed-size intermediate representation. As a result, model depth is decoupled from user history length, enabling deeper relevance understanding without proportional growth in compute or memory; request-only optimization further trims memory by sharing a single copy of user-side tokens across all candidate items. SlimPer unifies sparse, dense, and sequence features within a single backbone and provides inherent interpretability through its attention mechanism. Deployed on Instagram Reels and Feed, SlimPer yields measurable improvements in user engagement while streamlining the overall system and enabling effective modeling of 10k+ fine-grained user history events.

cs.IR cs.LG