SpecFormer: Mitigating Embedding and Attention Collapse via Spectral-Aware Transformer for Recommendation

TL;DR

提出SpecFormer,通过谱软化和谱注意机制缓解推荐中的嵌入与注意力崩溃。

cs.IR 🔴 高级 2026-07-27 42 次浏览
Yu Cui Yi Xu Jiahao Wang Hao Zhang Yu Zhang Xiaoyi Zeng Can Wang Jinxin Hu Jiawei Chen
推荐系统 Transformer 谱分析 注意力机制 模型稳定性

核心发现

方法论

本文分析推荐场景中Transformer的谱特性,揭示数据异质性和长尾分布导致的谱崩溃问题。提出谱软化模块动态平衡奇异值分布,谱软化注意力机制在谱空间建模特征交互,谱残差位置编码引入谱偏置。通过理论分析和实验证明,该架构缓解嵌入与注意力崩溃,提升模型可扩展性。核心算法包括奇异值软化、谱空间注意力和Taylor展开的谱残差编码,结合多层堆叠实现深层性能提升。

关键结果

  • 在工业数据集和两个公开数据集上,SpecFormer显著优于SOTA方法,CTR提升1.34%,订单增长16.72%。在深层堆叠中,attention有效秩提升30%,模型可扩展性增强。 Ablation实验验证谱软化和谱注意力的贡献,模型在长尾特征和异质数据中表现优异。
  • 与传统Transformer和现有改进方法相比,SpecFormer在attention的有效秩和特征表达丰富度方面表现出明显优势,尤其在浅层和深层模型中均保持稳定性能。
  • 在实际推荐系统中部署后,在线A/B测试显示其在点击率和转化率上均优于基线,验证了其工业应用潜力。

研究意义

该研究突破了推荐场景中Transformer的谱崩溃瓶颈,解决模型深层堆叠难题,为大规模推荐系统提供了理论基础和工程方案。通过谱空间建模,有效缓解数据异质性带来的特征表达退化,推动Transformer在推荐中的深度应用,具有重要的学术价值和产业意义。

技术贡献

提出谱软化模块、谱注意力机制和谱残差位置编码,创新性地从谱角度解决嵌入与注意力崩溃问题。理论分析证明低秩谱结构引发的梯度偏向,模型设计打破这一循环。实现深层堆叠的可扩展性,推动Transformer在推荐中的应用边界。

新颖性

首次系统性结合谱分析与Transformer架构,提出谱软化和谱空间建模机制,解决推荐场景中深层Transformer的崩溃问题。区别于传统正则化和频域方法,强调谱结构的动态调节和偏置引入,具有明显创新性。

局限性

  • 模型依赖谱软化参数的学习,可能在极端异质或噪声数据中表现不佳,需进一步鲁棒性验证。
  • 谱残差编码引入额外参数,增加模型复杂度,实际部署中需权衡效率与效果。
  • 当前实验主要在CTR预测任务,泛化到其他推荐任务和多模态场景仍需验证。

未来方向

未来将探索谱软化的自适应调节机制,结合多模态信息增强特征表达,拓展到多任务和跨域推荐。此外,将研究模型的鲁棒性和推理效率,推动其在工业环境中的广泛应用。

AI 总览摘要

推荐系统中Transformer架构的应用面临严重的谱崩溃问题,导致模型深层堆叠性能急剧下降。本文深入分析了异质数据和长尾分布引发的谱特性退化,揭示了嵌入和注意力的低秩结构形成机制。为此,提出SpecFormer,一种谱感知Transformer,核心创新包括可学习的谱软化模块、谱空间注意力机制和Taylor展开的谱残差位置编码。这些设计共同缓解了谱崩溃,提升了模型的深层堆叠能力和推荐性能。大量实验证明,SpecFormer在工业和公开数据集上均优于现有最优模型,尤其在attention有效秩和长尾特征表达方面表现出显著优势。其部署于实际推荐平台后,在线A/B测试显示CTR提升1.34%,订单增长16.72%,验证了其工业应用潜力。该研究不仅突破了推荐场景中Transformer的深度瓶颈,也为未来谱空间建模提供了理论基础和工程方案,具有重要的学术和产业价值。未来工作将聚焦谱软化的自适应调节、多模态融合及模型鲁棒性,推动Transformer在推荐系统中的深度应用与普及。

深度分析

研究背景

推荐系统的演进经历了传统的因子分解模型到深度学习模型,再到Transformer架构。Transformer因其强大的特征交互能力在工业界得到广泛应用,如Facebook的Deep Learning Recommendation Model (DLRM)和Google的Duo等。然而,Transformer在推荐中的深层堆叠面临谱崩溃问题,导致模型性能受限。此前的研究多集中在正则化和频域变换,但未从谱结构角度系统性解决崩溃问题。随着数据异质性和长尾分布的加剧,模型的谱特性逐渐退化,影响特征表达和模型可扩展性。

核心问题

核心问题是推荐场景中Transformer的谱崩溃,表现为嵌入退化和注意力低秩。数据异质性和长尾分布导致特征表示的谱结构极度偏斜,形成少数主导奇异值,抑制次要信息。模型在深层堆叠时,低秩的注意力矩阵限制了特征交互的丰富性,梯度偏向主导谱方向,形成恶性循环。这不仅影响模型性能,也限制了模型的深度扩展,成为推荐系统深层Transformer应用的瓶颈。

核心创新

本文提出谱软化模块、谱空间注意力和Taylor展开的谱残差位置编码,创新性地从谱角度缓解崩溃问题。谱软化动态调节奇异值分布,平衡谱能量;谱注意力在谱空间建模特征交互,避免单一主导;谱残差编码引入谱偏置,增强模型的谱表达能力。这些设计打破了低秩陷阱,提升深层模型的稳定性和表达能力。理论分析证明低秩谱结构引发的梯度偏向机制,模型堆叠深度显著增加。

方法详解

  • �� 输入特征经过分组和投影形成token矩阵X。• 在每层中,H(l)通过奇异值分解(SVD)得到U(l)、Σ(l)、V(l)。• 采用可学习的幂律软化参数τ,将奇异值σ(l)i进行平滑,形成Σ(l)*。• 计算谱软化的Query、Key矩阵,保持Value在原空间。• 通过谱空间的softmax计算注意力,避免谱崩溃。• 引入Taylor展开的谱残差位置编码,提供谱偏置。• 多层堆叠后,模型在深层中保持稳定的谱结构,提升性能。

实验设计

在工业推荐平台和两个公开数据集(如MovieLens、Criteo)上,比较SpecFormer与SOTA模型(如OneTrans、RankMixer)。指标包括CTR、订单转化率、attention有效秩等。采用不同层数和参数设置,验证深层堆叠能力。进行消融实验,分析谱软化、谱注意力和位置编码的贡献。模型训练采用Adam优化,学习率调节,早停策略,确保公平对比。

结果分析

SpecFormer在工业数据集上CTR提升1.34%,订单增长16.72%,明显优于对比模型。在深层模型中,attention的有效秩提升30%,模型稳定性增强。消融实验显示,谱软化和谱注意力机制是性能提升的关键。在长尾特征和异质数据中表现尤为优越,验证了谱结构调节的有效性。

应用场景

可直接应用于大规模工业推荐平台,提升广告点击率、商品转化率等关键指标。模型适应多样化特征和复杂场景,支持深层堆叠,满足工业级性能需求。未来可结合多模态信息,拓展到多任务学习和跨域推荐,推动个性化推荐的智能化升级。

局限与展望

模型依赖谱参数的学习,可能在极端异质或噪声数据中表现不佳。引入额外参数增加复杂度,影响推理效率。当前主要验证于CTR任务,泛化到其他推荐任务和多模态场景仍需验证。未来需优化算法效率和鲁棒性,提升实际应用的适应性。

通俗解读 非专业人士也能看懂

想象你在厨房里准备一道复杂的菜肴。每个食材代表不同的特征,厨师(模型)需要把这些食材混合成美味佳肴。传统的厨师会用一种固定的方式混合,但如果某些食材特别多或特别少,厨师可能只关注主要的几样,忽略了其他细节。这就像模型中的嵌入崩溃,只关注少数主要特征。为了让厨师更均匀地使用所有食材,厨师可以用一种特殊的调料(谱软化)平衡各个食材的比例,确保每种都能发挥作用。这样,菜肴(模型)就会更丰富、更美味,也能做得更深、更复杂。本文提出的SpecFormer就像给厨师配备了这种“调料”,让他在做菜时能充分利用所有食材,做出更好吃的菜肴。

简单解释 像给14岁少年讲一样

想象你在学校的厨房里帮忙做披萨。平时你只用一种酱料和几种配料,但如果你只关注主要的配料,其他的小配料就会被忽略,就像模型只关注少数几个特征一样。这会让披萨变得单调,缺少丰富的味道。现在,你得到了一瓶神奇的调料,可以让所有的配料都变得一样重要,不管是少的还是多的。这样,你做出来的披萨就会有各种各样的味道,特别丰富。这瓶调料就像论文里的谱软化机制,它让模型在处理不同特征时变得更公平、更全面。这样,模型就能更聪明、更强大,能做出更好的推荐,就像你的披萨变得更好吃一样。

原文摘要

Transformer architectures have achieved remarkable success across diverse domains; however, directly applying their standard self-attention mechanism to recommendation often yields suboptimal performance, sometimes even trailing behind well-designed simple recommendation models. In this paper, we reveal that this performance bottleneck stems from severe embedding and attention collapse unique to recommendation scenarios. The heterogeneity and long-tail nature of recommendation data lead to a severe spectral collapse dominated by a few principal singular values. We further theoretically demonstrate that this triggers a vicious cycle in recommendation model's forward and backward propagation, which accelerates embedding and attention collapse and limits the model's scaling capability with increased depth. To address these issues, we propose SpecFormer, a novel Spectral-Aware Transformer designed for mitigating embedding and attention collapse in recommendation. Specifically, SpecFormer introduces 1) a Learnable Spectral Softening module to dynamically smooth the singular values distribution of the input token embeddings; 2) a Spectrum-softened Attention mechanism to model feature interaction under a more uniform spectral distribution space; 3) a Spectral Residual Position Encoding via Taylor expansion of singular values, explicitly providing a spectral inductive bias for feature interactions. Extensive experiments on one industrial and two public datasets demonstrate that SpecFormer significantly outperforms state-of-the-art baselines. Notably, SpecFormer has been successfully deployed in a real-world commercial recommender system and exhibits exceptional scaling capabilities: stacking SpecFormer layers actively improves the attention effective rank and recommendation performance.

cs.IR cs.LG