Empowering Large Language Model for Sequential Recommendation via Multimodal Embeddings and Semantic IDs
MME-SID用多模态量化嵌入缓解塌缩与遗忘,Amazon Beauty初测将遗忘率从94.5%降至约62.9%。
核心发现
方法论
MME-SID以Llama3-8B-Instruct为基础,联合协同、文本和视觉嵌入。MM-RQ-VAE分别编码三种模态,并以特征核最大均值差异(MMD)替代MSE重构损失,以保留距离分布;再用InfoNCE对齐协同—文本和协同—视觉量化嵌入。训练后的码向量初始化语义ID嵌入,最后通过LoRA和多模态频率感知融合微调LLM。
关键结果
- 在Amazon Beauty的预实验中,SASRec协同嵌入经RQ-VAE量化后,与原嵌入的距离排序Kendall’s tau为0.3714,说明保留了部分结构信息;若下游随机初始化码向量,tau仅为0.0550,即约94.5%的原有信息被遗忘。
- 论文观察到,直接将低维协同嵌入线性投影到LLM空间会造成严重嵌入塌缩,实验中嵌入矩阵超过98%的维度发生塌缩。MME-SID通过原始嵌入、量化嵌入及三种模态联合输入改善表示容量。
- 作者在Amazon Beauty、Amazon Sports、Amazon Clothing三个公开Amazon数据集上进行实验,并报告MME-SID整体优于现有LLM序列推荐方法;但所给文本未提供表格中的具体Recall或NDCG数值。
研究意义
论文把LLM序列推荐中的两个常被分开讨论的问题联系起来:低秩协同表示导致的嵌入塌缩,以及语义ID下游重训造成的灾难性遗忘。其意义不只是加入文本和图像,而是说明多模态信息可以扩大LLM输入表示的有效子空间,同时保留量化前后的几何关系。对工业推荐而言,使用预训练码向量初始化也可能减少大规模物品词表从零训练的成本。
技术贡献
核心技术包括MM-RQ-VAE、MMD重构、跨模态InfoNCE对齐、训练码向量初始化和LoRA频率感知融合。MMD通过特征核比较分布,而非只最小化逐点欧氏误差;对齐目标使协同信号与文本、视觉信号相互约束。输入端同时拼接原始模态投影与语义ID码向量,兼顾连续距离信息和层次离散结构。
新颖性
作者据其所知首次系统地将LLM推荐中的embedding collapse与catastrophic forgetting作为联合问题研究。相较仅使用文本语义ID、丢弃训练后码嵌入的工作,MME-SID保留码向量,并把协同、文本、视觉三路信息共同量化和输入LLM。
局限性
- 全文摘要和所给正文没有列出三套数据集上的完整Recall@K、NDCG@K及相对提升,因而难以独立核验“优越性能”的幅度。
- MME-SID依赖LLM2CLIP、Llama3-8B-Instruct及三类物品特征;缺失图像、长文本或高质量协同信号时,跨模态对齐可能变弱。
- 多路编码、RQ-VAE码本和LLM微调增加训练与部署复杂度,论文材料未充分量化端到端成本。
未来方向
后续可报告完整指标、显著性检验和规模化成本,并研究动态码本、更多模态及跨域迁移。还应比较不同核函数、码本层数、LoRA秩和频率融合策略,测试新物品、长序列、噪声模态及真实工业流量下的鲁棒性。
AI 总览摘要
序列推荐希望从用户的点击历史中预测下一件可能感兴趣的物品。传统方法依赖物品ID,难以处理冷启动;LLM方法虽然能理解文本,却面临两个隐蔽瓶颈:低维协同嵌入投影到高维LLM空间后发生embedding collapse,以及语义ID量化后只保留离散编号、重新训练嵌入导致catastrophic forgetting。论文指出,在实验中超过98%的嵌入维度可能塌缩,而随机重训码向量会丢失大部分原有距离结构。
作者提出MME-SID,基于Llama3-8B-Instruct整合协同、文本和视觉信息。其核心编码器MM-RQ-VAE为每种模态生成分层语义ID;使用最大均值差异(MMD)重构损失保存分布和距离信息,用InfoNCE对齐协同与文本、视觉量化表示。训练完成后,码本中的真实向量被直接用于初始化LLM语义ID嵌入,而非丢弃后随机初始化。随后,LoRA以多模态频率感知方式高效微调模型。
Amazon Beauty预实验显示,量化嵌入与原协同嵌入的Kendall’s tau为0.3714,而随机初始化下仅为0.0550,后者对应约94.5%的信息遗忘。作者还在Amazon Sports和Amazon Clothing上开展实验,并报告整体优于现有LLM序列推荐方法,但提供材料未包含完整表格数值。该研究的更广泛价值在于:语义ID不应只是编号,多模态码向量也不应被当作一次性预训练产物丢弃。未来仍需验证大规模工业成本、缺失模态场景和跨域泛化能力。
深度分析
研究背景
序列推荐从SASRec等基于协同ID的模型发展到TALLRec等LLM指令调优方法。RQ-VAE及相关语义ID工作把物品嵌入离散成可生成代码,改善LLM的生成式检索能力。但纯ID模型易受冷启动影响,纯文本语义ID又忽略视觉和协同关系;同时,低维嵌入映射到LLM空间会浪费表示容量。
核心问题
论文聚焦两个问题。其一,若协同表E_c∈R^{M×D}低秩,则线性映射满足rank(WE_c+b)≤rank(E_c)+1,无法充分占据LLM空间。其二,下游只保留语义ID、重新学习码嵌入,会破坏原有距离排序;Amazon Beauty中随机初始化的Kendall’s tau仅为0.0550。
核心创新
第一,MM-RQ-VAE同时处理协同、文本和视觉模态。第二,以特征核MMD替代普通MSE,使重构目标关注分布统计与距离结构。第三,以InfoNCE对齐量化协同—文本和协同—视觉表示。第四,用训练码向量初始化语义ID嵌入。第五,拼接原始投影和量化码向量,并通过LoRA及频率感知融合适配冷、暖物品。
方法详解
- �� 编码:SASRec提供协同嵌入,LLM2CLIP提供文本与视觉嵌入。
- �� 量化:每种模态经L层RQ-VAE码本逐层量化,残差递归更新,量化向量为各层码向量之和。
- �� 训练:最小化MMD重构损失、InfoNCE对齐损失及RQ-VAE承诺损失,整体形式为L_MMRQ=L_Recon+βL_Align+γΣL_RQ。
- �� 输入:行为序列同时携带原始模态投影和语义ID码嵌入,经MLP映射至4096维LLM token空间。
- �� 微调:冻结大部分LLM,仅用LoRA更新,并利用物品训练频率融合LLM输出与模态物品表示。
实验设计
实验使用Amazon Beauty、Amazon Sports和Amazon Clothing三个公开数据集,以Llama3-8B-Instruct为主干,并与LLM序列推荐、语义ID及传统序列推荐方法比较。分析包括奇异值检验、Kendall’s tau遗忘评估,以及MMD与MSE、随机码初始化、模态组合等消融。材料明确给出Beauty预实验tau=0.3714和0.0550,但未呈现完整主实验表。
结果分析
方法分析显示,直接映射协同嵌入导致超过98%的维度塌缩。训练RQ-VAE码向量可保留一定距离排序,tau达到0.3714;随机初始化后仅0.0550。三数据集实验被报告为优于现有方法,说明多模态输入和码向量继承具有互补作用,但由于提供文本缺少Recall、NDCG和逐项消融数值,无法量化各模块的独立增益。
应用场景
电商可利用标题、描述、图片与点击序列联合推荐,尤其适合新商品和信息丰富的商品。短视频、内容平台也可将视觉语义与用户行为共同编码。部署前需要稳定的多模态特征、物品频率统计、RQ-VAE码本和LLM推理资源;LoRA可降低微调参数量,但不消除大模型推理成本。
局限与展望
论文主要证据来自Amazon公开数据,跨行业、跨语言和实时流量验证仍不足。MME-SID假设文本、图像和协同信号可获得,模态缺失或质量不一致时,InfoNCE对齐可能放大噪声。RQ-VAE码本层数、核函数、β/γ和频率融合对结果的影响需要更系统的敏感性分析。未来应补充完整指标、成本、隐私与公平性评估。
通俗解读 非专业人士也能看懂
把推荐系统想成一家大型书店。传统系统只记住每本书的编号,就像店员只看条形码;它能根据顾客过去买过什么来推荐,却不了解新书内容。LLM像一位很会读书的店员,能看标题、简介和封面,但如果把旧系统的短小笔记硬塞进一张超大的白纸上,信息会挤在很小一块区域,很多空间白白浪费。
MME-SID的做法像同时建立三种目录:购买记录目录、文字目录和图片目录。它把每本书拆成几级小标签,再保留这些标签背后的原始信息,而不是只记标签编号。MMD像检查两批书的整体分布是否相似,不只比较每一本书的位置;对比学习则让同一本书的购买记录、简介和封面彼此靠近。
最后,系统把旧目录中的真实内容直接交给大模型,而不是把所有标签重新随机填写。这样既保留旧知识,又能让模型学习用户的新兴趣。论文在Amazon Beauty的测试中发现,保留的距离排序得分为0.3714,随机重学时只有0.0550。简单说,它让推荐员少忘记过去,也更能利用不同来源的信息。
简单解释 像给14岁少年讲一样
想象你在给朋友推荐游戏。你知道他过去玩过哪些游戏,也能看懂游戏介绍和截图。普通推荐器像一本只写游戏编号的小本子:它能记住“他玩过3号和8号”,但不知道游戏到底是什么。大语言模型像很聪明的朋友,能读介绍、看图片,可是把旧本子内容翻译成它的大脑语言时,可能只挤进很小一角,很多信息就浪费了。
MME-SID像给每个游戏制作三张卡片:玩家行为卡、文字卡和图片卡。每张卡再分成几层小密码。关键是,系统不只保存密码,还保存制作密码时用过的原始卡片信息。这样,两个相似游戏仍然比较接近,不会因为换成密码就完全认不出来。
系统还会让同一个游戏的三张卡互相“对照学习”:玩家记录、介绍和截图应该讲的是同一个东西。训练大模型时,它把过去学好的密码内容直接放进去,而不是全部从零开始猜。这样就像转学时带着旧笔记,而不是把旧知识撕掉。
结果很有意思:在Amazon Beauty数据上,保留旧结构的分数是0.3714;随机重新学习只有0.0550,差距很大。研究者还测试了Sports和Clothing数据集。它说明好推荐不只是“让模型更大”,还要让模型保存记忆、看懂多种线索,并合理使用它们!
术语表
Embedding Collapse(嵌入塌缩)
嵌入矩阵的大量维度变得近似无效,表示集中在低维子空间。它会浪费LLM表示容量并限制扩展性。
论文观察到超过98%的嵌入维度可能塌缩,并用多模态输入缓解。
Semantic ID(语义ID)
由量化模型生成的离散代码序列,用来表示物品的语义或结构。它可作为LLM生成式推荐中的特殊token。
MME-SID为协同、文本和视觉模态分别生成语义ID。
RQ-VAE
Residual Quantized Variational Autoencoder,通过多级码本逐层量化残差。各级码向量相加得到量化表示。
论文用MM-RQ-VAE生成三种模态的分层代码。
MMD
Maximum Mean Discrepancy,用核均值嵌入衡量两个分布的差异。特征核可保留比逐点MSE更丰富的分布统计。
MM-RQ-VAE用MMD作为重构损失。
InfoNCE
一种对比学习损失,使匹配样本相似度升高、非匹配样本相似度降低。温度参数控制分布尖锐程度。
论文用它对齐协同与文本、视觉量化嵌入。
LoRA
Low-Rank Adaptation,通过低秩增量矩阵微调大模型,避免更新全部参数。它能降低训练参数和显存需求。
MME-SID用LoRA进行多模态频率感知微调。
开放问题 这项研究留下的未解疑问
- 1 三套数据集的完整Recall、NDCG和显著性结果未在所给材料中出现,因此MME-SID相对各基线的真实提升幅度仍需查阅正式实验表。
- 2 在缺失图像、噪声文本、极冷启动和快速变化物品目录中,MMD与跨模态对齐是否仍稳定,尚缺系统验证。
- 3 Llama3-8B和多路编码的实际训练、推理成本,以及在数十亿物品规模上的码本维护开销仍不清楚。
应用场景
近期应用
多模态电商推荐
电商平台可用商品标题、描述、图片和点击序列训练MM-RQ-VAE,再以训练码向量初始化语义ID。适合内容丰富但存在新商品的场景;需要稳定商品特征、行为日志和GPU推理资源。
内容与短视频推荐
平台可将视频封面、标题及用户观看序列联合编码,利用频率感知融合区分热门和长尾内容。LoRA适合周期性更新模型,但仍需监控模态噪声、延迟和推荐多样性。
远期愿景
可继承记忆的生成式推荐
未来推荐系统可把语义ID视为可持续更新的知识接口:新模型继承旧码向量,再通过增量量化和跨域对齐适应新业务。实现这一愿景需要解决码本版本兼容、隐私保护和大规模在线更新。
原文摘要
Sequential recommendation (SR) aims to capture users' dynamic interests and sequential patterns based on their historical interactions. Recently, the powerful capabilities of large language models (LLMs) have driven their adoption in SR. However, we identify two critical challenges in existing LLM-based SR methods: 1) embedding collapse when incorporating pre-trained collaborative embeddings and 2) catastrophic forgetting of quantized embeddings when utilizing semantic IDs. These issues dampen the model scalability and lead to suboptimal recommendation performance. Therefore, based on LLMs like Llama3-8B-instruct, we introduce a novel SR framework named MME-SID, which integrates multimodal embeddings and quantized embeddings to mitigate embedding collapse. Additionally, we propose a Multimodal Residual Quantized Variational Autoencoder (MM-RQ-VAE) with maximum mean discrepancy as the reconstruction loss and contrastive learning for alignment, which effectively preserve intra-modal distance information and capture inter-modal correlations, respectively. To further alleviate catastrophic forgetting, we initialize the model with the trained multimodal code embeddings. Finally, we fine-tune the LLM efficiently using LoRA in a multimodal frequency-aware fusion manner. Extensive experiments on three public datasets validate the superior performance of MME-SID thanks to its capability to mitigate embedding collapse and catastrophic forgetting. The implementation code and datasets are publicly available for reproduction: https://github.com/Applied-Machine-Learning-Lab/MME-SID.