核心发现
方法论
论文提出PruneRec,将宽度剪枝与深度剪枝结合为三阶段迭代流程:第一阶段剪枝注意力头和嵌入维度,第二阶段依据激活强度保留MLP前馈层约10%的行或列,第三阶段按移除单层造成的性能差异进行层级剪枝。每阶段后使用反向KL散度与交叉熵蒸馏恢复能力。
关键结果
- 在三个公开数据集上,PruneRec平均保留原始模型约88%的推荐性能,同时剪除超过95%的非嵌入参数,即仅使用约5%的非嵌入参数,显示出显著的存储和推理效率优势。
- 在Amazon Video Games的观察实验中,微调后的推荐模型比通用Qwen呈现更强的激活长尾和信息集中现象,说明推荐微调强化了少数任务相关维度,也扩大了结构冗余。
- WANDA按权重绝对值与输入激活范数的Hadamard积剪枝,在推荐任务中表现甚至不如随机剪枝;这表明通用LLM剪枝指标不能直接迁移,任务特定的重要性评估十分必要。
研究意义
研究回应了LLM推荐系统难以部署的核心痛点:庞大参数带来的显存、存储和推理成本。与把知识迁移到小模型的蒸馏路线不同,PruneRec直接压缩原LLM,避免明显的模型容量鸿沟。其结果说明,推荐微调后大量通用语言能力参数可能成为负担,而结构化删除可产生更适合现有硬件的规则模型。
技术贡献
技术上,论文把层间冗余和层内冗余统一到同一剪枝—恢复框架。注意力头采用逐层扰动、KL散度和跨层递归加权;嵌入维度采用权重与梯度乘积;MLP维度采用末位token激活强度;层级剪枝则直接测量移除前后的性能差异。每轮蒸馏既恢复性能,也为下一轮重要性估计提供稳定模型。
新颖性
多数既有推荐模型压缩工作集中于层级剪枝或知识蒸馏,PruneRec进一步指出Transformer内部的注意力头、MLP中间维度和嵌入维度同样存在冗余。其核心新意不是单一评分函数,而是按照“宽度到深度”的顺序进行多粒度、渐进式剪枝,并在阶段间恢复模型能力。
局限性
- 正文给出的三数据集名称、完整指标表和部分实验细节在所提供文本中不可见,因此无法核验各数据集上的HR@20、NDCG@20及基线差异。
- 方法依赖逐头扰动和层移除后的前向评估,重要性计算可能增加训练前处理成本;跨层递归公式还需要超参数α,任务变化时可能需重新校准。
- 嵌入剪枝与模型输入维度、词表设计紧密相关;删除低频或停用词维度在其他语言、生成式推荐或多任务场景中未必安全。
未来方向
后续可公开完整实验表,研究不同α、保留比例和蒸馏温度的敏感性,并扩展到多语言、跨域和多任务推荐。还应比较真实硬件上的延迟、能耗与峰值显存,探索自动化剪枝策略、量化联合压缩及动态结构重配置。
AI 总览摘要
大语言模型正在提升序列推荐的物品理解与推理能力,但其庞大参数量使显存、存储和推理成本成为部署瓶颈。传统知识蒸馏虽能训练轻量模型,却面临教师—学生容量鸿沟;既有剪枝则多聚焦层间冗余,可能忽略层内大量无效结构。
郑山乐等提出PruneRec,先按“宽度到深度”逐步压缩模型:利用KL散度和跨层递归权重评估注意力头,结合权重—梯度乘积筛选嵌入维度;随后依据激活强度在MLP中仅保留约10%的重要行或列;最后以移除单层造成的性能差异进行层剪枝。每阶段都用反向KL散度和交叉熵知识蒸馏恢复能力,避免一次性压缩导致崩溃。
在三个公开数据集上,模型平均达到原始模型88%的推荐性能,同时删除超过95%的非嵌入参数。Amazon Video Games观察还发现,推荐微调模型的激活呈明显长尾,通用LLM剪枝方法WANDA甚至不如随机剪枝,说明推荐任务需要专门的重要性估计。该工作为面向硬件的LLM推荐压缩提供了可行路径,但完整数据集名称、逐项指标和真实部署延迟仍需进一步披露与验证。
深度分析
研究背景
LLM推荐通过Prompt(I)输入用户历史I=[i1,…,in]并最大化目标物品文本Yi(n+1)的概率。BIGRec等工作证明了LLM微调的潜力,但高参数量阻碍落地。知识蒸馏可降低规模,却引入容量鸿沟;结构化剪枝更利于硬件加速,但早期方法主要删除整层。
核心问题
推荐微调会强化少数任务相关能力,使注意力和MLP激活呈长尾分布。问题在于:哪些参数真正支撑推荐?如何同时删除层内维度、注意力头和层本身而不造成模型崩溃?通用WANDA在该场景中不优于随机剪枝,说明一般LLM指标并不可靠。
核心创新
PruneRec的创新包括:一,首次在该框架中系统结合层内与层间冗余;二,以宽度到深度的三阶段顺序降低结构冲突;三,用扰动输出的KL散度衡量注意力头,用权重—梯度乘积评估嵌入维度,用激活强度筛选MLP维度;四,每阶段蒸馏恢复,形成迭代闭环。
方法详解
- �� 先按式(1)和交叉熵式(2)训练推荐LLM,遵循BIGRec。
- �� 注意力头:计算Ai=Softmax(QiKiT/√dk),令ε趋近0抑制第i头,以原始与扰动输出的DKL评估重要性,并用式(6)以α传播前层影响;主实验每层剪7个头。
- �� 嵌入层:对每维计算|E⊙∇E|并排序,保留与注意力输入匹配的维度。
- �� MLP:在Y=(σ(XWgate+b)⊙(XWup+bup))Wdown+bdown中依据末位token激活,保留约10%中间行或列。
- �� 最后按移除层的性能差异剪层;每阶段用反向KL与交叉熵蒸馏恢复。
实验设计
观察实验使用Amazon Video Games,随机抽取100个样本分析各层Top-K激活占比,并比较通用Qwen与推荐微调模型。方法比较包括随机剪枝和WANDA;论文还在三个公开数据集上评估PruneRec与常规、剪枝及蒸馏LLM推荐方法。报告指标包括HR@20和NDCG@20;关键设置包括每层剪7个注意力头、MLP保留Top 10%。
结果分析
核心结果是三数据集平均保留原模型88%的性能,同时仅保留约5%的非嵌入参数。激活分析显示推荐微调后信息更集中于少数维度,支持层内剪枝假设。WANDA在推荐模型上的性能保持率低于随机剪枝,说明基于通用任务设计的权重—激活评分存在任务错配。逐阶段蒸馏是避免累积损失的重要因素。
应用场景
该方法适用于需要保留原LLM知识、却受显存和延迟限制的电商、视频、游戏和内容推荐服务。结构化删除注意力头、MLP维度和层,理论上更容易映射到GPU、CPU或边缘加速器。部署前仍需根据语言、词表、序列长度和业务指标重新校准保留比例。
局限与展望
论文提供文本未包含完整三数据集名称、表格数值、基线配置和硬件延迟,因此主要结论仍以摘要级数据为准。重要性估计包含多次扰动前向传播,可能增加压缩成本;层级剪枝和嵌入维度剪枝也可能损害多语言、冷启动和多任务能力。未来应进行硬件实测、联合量化和自动化比例搜索。
通俗解读 非专业人士也能看懂
把LLM想成一家特别大的餐厅:它原本要同时准备语言、数学、代码和推荐等所有菜。推荐业务上线后,真正经常用到的可能只是少数厨师、灶台和食材,但整家餐厅仍然全部开着,既占地方又耗电。
PruneRec先观察哪些厨师一停工,最终菜单就明显变差,这对应注意力头;哪些食材和提示词贡献很小,就减少相应的记录空间;再检查每道菜中间哪些步骤几乎没有作用,这对应MLP内部结构。最后,它尝试暂时关闭整间厨房,保留影响最大的厨房部分。
每删一轮,系统都会让原来的完整餐厅当老师,指导缩小后的餐厅重新做出相似菜单。因此不是一次性乱砍,而是边删边练。结果是,三个数据集上仍保留约88%的推荐表现,却去掉超过95%的非嵌入部分。代价是评估和再训练仍需时间,而且不同业务可能需要不同的删减方案。
简单解释 像给14岁少年讲一样
想象你在做一个“猜你喜欢”的游戏装备推荐器。它背后请了一位超级博学的机器人老师,但老师太大了,像一整座图书馆:能聊天、写代码、做数学,也能推荐装备。真正上线时,如果每次推荐都搬着整座图书馆,电脑当然会很慢、很贵!
PruneRec像整理书包。先找出哪些“小助手”最重要:有些注意力头像专门看价格,有些看类别;不重要的就拿掉。接着检查每一层里哪些小格子几乎没亮过,只留下最常用的部分。最后测试整层:如果关掉它,推荐结果几乎不变,就可以删除。
但它不会一次把东西全扔掉。每整理一轮,就让原来的大机器人教小机器人复习,让小机器人尽量给出相似答案。这就是蒸馏。论文发现,三个数据集上删掉超过95%的非嵌入参数后,仍有原模型约88%的效果。
不过,这不代表任何模型都能照搬。论文还发现通用方法WANDA在推荐任务中不如随机删除,说明推荐系统有自己的“重点区域”。完整表格和真实手机、服务器速度还需要更多实验验证。
术语表
Structured Pruning(结构化剪枝)
删除完整的神经元、通道、注意力头或层,而不是零散权重。所得结构规则,通常更容易被硬件直接加速。
PruneRec剪枝注意力头、嵌入维度、MLP维度和Transformer层。
Intra-layer Redundancy(层内冗余)
同一层内部只有少数维度或组件主导输出,其余部分贡献较小。它不同于整层之间的层间冗余。
论文通过注意力和MLP激活的长尾分布发现该现象。
WANDA
一种依据|W|与对应输入激活范数Hadamard积评估权重重要性的剪枝方法。它主要面向通用LLM任务。
论文发现WANDA在推荐场景中不如随机剪枝。
Knowledge Distillation(知识蒸馏)
让较小或被剪枝模型模仿原始教师模型的输出分布。这里使用反向KL散度和交叉熵恢复性能。
每个剪枝阶段结束后执行蒸馏。
Attention Head(注意力头)
多头自注意力中的独立子模块,计算Ai=Softmax(QiKiT/√dk)并输出AiVi。不同头可捕获不同关系。
第一阶段按抑制前后的KL散度剪除不重要的头。
HR@20 / NDCG@20
HR@20衡量目标物品是否进入前20名;NDCG@20进一步考虑目标在前20名中的排序位置。二者是Top-K推荐常用指标。
论文在观察和公开数据集实验中报告这类推荐指标。
开放问题 这项研究留下的未解疑问
- 1 完整三数据集名称、逐项HR@20和NDCG@20、基线配置及硬件延迟未出现在所给文本中,因而难以复现精确比较。
- 2 尚不清楚α、剪枝比例和蒸馏超参数在跨域、跨语言及不同模型规模下是否稳定,需要系统敏感性实验。
- 3 结构化剪枝是否会削弱事实知识、冷启动能力或长尾物品推荐,论文尚未给出充分的安全性与公平性分析。
应用场景
近期应用
电商与内容推荐压缩
拥有BIGRec式LLM推荐模型的团队可先在业务样本上计算注意力头、嵌入和MLP重要性,再分阶段剪枝并蒸馏。上线前应用HR@20、NDCG@20和真实显存测试验证收益。
边缘设备部署
视频、游戏或购物应用可将结构化压缩模型部署到内存有限的服务器或边缘设备。删除完整组件比非结构化稀疏更便于现有推理框架利用,但需重新编译并校准序列长度。
远期愿景
自动化推荐模型设计
未来可将重要性估计、剪枝比例、量化和蒸馏联合优化,自动生成满足延迟、能耗和质量约束的模型,为不同业务端定制模型结构。
原文摘要
LLM-based recommender systems have made significant progress; however, the deployment cost associated with the large parameter volume of LLMs still hinders their real-world applications. This work explores parameter pruning to improve parameter efficiency while maintaining recommendation quality, thereby enabling easier deployment. Unlike existing approaches that focus primarily on inter-layer redundancy, we uncover intra-layer redundancy within components such as self-attention and MLP modules. Building on this analysis, we propose a more fine-grained pruning approach that integrates both intra-layer and layer-wise pruning. Specifically, we introduce a three-stage pruning strategy that progressively prunes parameters at different levels and parts of the model, moving from intra-layer to layer-wise pruning, or from width to depth. Each stage also includes a performance restoration step using distillation techniques, helping to strike a balance between performance and parameter efficiency. Empirical results demonstrate the effectiveness of our approach: across three datasets, our models achieve an average of 88% of the original model's performance while pruning more than 95% of the non-embedding parameters. This underscores the potential of our method to significantly reduce resource requirements without greatly compromising recommendation quality. Our code will be available at: https://github.com/zheng-sl/PruneRec