Expand More, Shrink Less: Shaping Effective-Rank Dynamics for Dense Scaling in Recommendation

TL;DR

RankElastor以全参数混合与GLU-P-FFN提升有效秩,Criteo/Avazu上较最强基线AUC超过0.001。

cs.LG 🔴 高级 2026-05-22 23 次浏览
Guoming Li Shangyu Zhang Junwei Pan Wentao Ning Jin Chen Gengsheng Xue Chao Zhou Shudong Huang Haijie Gu Menglin Yang
推荐系统 CTR预测 有效秩 Embedding Collapse RankElastor

核心发现

方法论

论文从有效秩动态分析RankMixer,并提出RankElastor。前者交替执行块转置Token Mixing与GELU型P-FFN,形成“扩张—收缩”的阻尼振荡;后者以可学习矩阵W进行细粒度全混合,并用GLU门控、扩展投影和残差映射替代标准FFN,目标是扩张更多、收缩更少。

关键结果

  • 在Criteo与Avazu上,RankMixer的有效秩呈锯齿式变化:混合模块略升、P-FFN下降;Avazu中收缩效应可重新主导并导致塌缩。
  • RankElastor在两个工业级CTR数据集上持续优于强基线,较最强基线取得超过0.001的AUC提升;论文同时报告其最终表示具有更高有效秩。
  • 消融与扩展性分析表明,参数化全混合和GLU-P-FFN分别改善秩扩张与谱稳定性,整体参数规模增长时比RankMixer表现出更稳健的收益。

研究意义

论文将推荐模型扩展中的表示塌缩与层间谱动力学联系起来,说明单纯增加深度和维度并不等于获得更多有效表示容量。该视角既为RankMixer的经验优势与失败模式提供统一解释,也给工业CTR系统一个可操作的架构设计原则:提高跨Token变换的表达自由度,同时抑制逐Token网络造成的谱收缩。

技术贡献

理论上,定理2.1给出块转置混合的有效秩下界与上界;定理2.2说明标准P-FFN在低秩输入上可能确定性或概率性收缩。RankElastor进一步以公式vec(Mᵀ)=LN((W+I)vec(Xᵀ))实现全坐标混合,并以GLU残差式Z=(GELU(MW1)⊙MW2)W3+MWr增强恢复能力;定理3.1和3.2分别支持表达性与秩恢复。

新颖性

新意不在于孤立使用GLU或线性混合,而在于以有效秩轨迹为设计目标,把RankMixer的两个模块同时重构。相较固定、非参数块转置,参数化全混合取消Kronecker结构约束;相较标准GELU-P-FFN,门控分支和残差映射专门针对谱收缩。

局限性

  • 论文只报告Criteo与Avazu,且摘要提供的性能信息主要是“超过0.001 AUC”;缺少更广泛领域、完整绝对AUC和线上长期收益。
  • 全混合矩阵W在T×D坐标上参数量可能较大;理论结论依赖正交性、谱非相干性、次高斯初始化及响应间隔等假设。

未来方向

后续可研究低秩、稀疏或结构化W以降低全混合成本,验证不同Token化策略、归一化和优化器对有效秩的影响,并在更多广告、搜索与内容推荐流量上进行在线A/B测试。同时需要建立有效秩、校准、延迟和收益之间的因果联系。

AI 总览摘要

大规模推荐系统通常把用户、物品和上下文字段编码为Embedding,再学习字段之间的交互。RankMixer通过统一Token表示、Token Mixing和逐Token前馈网络实现了较好的扩展性,但论文发现:随着层数增加,表示并没有充分利用更大的空间。有效秩显示,RankMixer的混合层略微扩张谱,P-FFN却反复收缩谱,形成阻尼振荡;在Avazu上,收缩最终重新占优。

论文提出RankElastor,核心思想是“扩张更多、收缩更少”。参数化全混合用可学习矩阵W替代固定块转置,使所有Token—特征坐标能够细粒度交互;GLU-improved P-FFN则通过GELU门控分支、逐元素乘法、扩展—压缩投影和可学习残差,减少标准FFN放大塌缩的风险。定理3.1指出,块级Kronecker约束的表达集合严格小于全混合;定理3.2给出GLU模块在足够隐藏宽度下的有效秩恢复保证。

在Criteo和Avazu工业级CTR基准上,RankElastor持续改善推荐表现,较最强基线AUC提升超过0.001,并获得更高有效秩和更稳健的参数扩展行为。论文的价值在于把“模型变大但表示变窄”转化为可测量、可分析、可设计的谱动力学问题。不过,公开材料没有给出完整绝对AUC、延迟和内存数字,且W的成本与理论假设仍需在更多线上场景检验。

深度分析

研究背景

Embedding-interaction推荐模型先生成E∈R^{n×k},再进行字段交互。RankMixer将异构Embedding Token化为X∈R^{T×D},交替使用块转置混合和P-FFN,继承了深度模型的扩展思路。与此同时,DCNv2、xDeepFM等模型常出现随深度单调下降的有效秩,提示容量扩展可能受到Embedding Collapse限制。

核心问题

塌缩表现为表示矩阵出现大量近零奇异值。论文采用稳定秩定义erank(X)=||X||²_F/||X||²_2。RankMixer虽比传统模型保留更多有效秩,却出现混合层上升、P-FFN下降的阻尼振荡;其固定块转置扩张有限,而标准GELU-P-FFN对低秩输入具有收缩倾向。

核心创新

  • �� 参数化全混合:以W∈R^{TD×TD}替代固定置换,并保留I残差,解除块级Kronecker约束。• GLU-improved P-FFN:使用Z=(GELU(MW1)⊙MW2)W3+MWr,引入门控、扩展通道和残差恢复谱。• 理论支撑:定理3.1证明全混合表达集合严格更大;定理3.2在m≥Ck logD时给出概率性秩恢复。

方法详解

  • �� 输入:多字段Embedding经Tokenization映射为X^(0)∈R^{T×D}。• 混合:向量化后计算LN((W+I)vec(Xᵀ)),再重塑为Token矩阵。• 逐Token变换:每个Token独立执行两路升维;一路GELU,另一路作为门控,逐元素相乘后经W3压缩,并加入MWr。• 堆叠:重复L个混合—P-FFN块,最后输出投影用于CTR预测。• 诊断:逐样本计算奇异值稳定秩,比较Raw、Mixing和FFN阶段。

实验设计

实验使用FuxiCTR框架,在Criteo与Avazu上比较RankElastor、RankMixer、DCNv2和xDeepFM。RankMixer分析配置为两层Token Mixing与两层P-FFN,共四层,以保证深度可比。指标包括CTR预测AUC、各阶段平均有效秩及参数扩展曲线;论文还比较模块分布变化,并通过组件分析验证全混合与GLU-P-FFN的作用。

结果分析

RankMixer在两个数据集均呈锯齿式有效秩轨迹;Criteo最终秩仅略高于原始Embedding,Avazu则因P-FFN持续收缩而重新塌缩。RankElastor在Criteo和Avazu上均提升CTR性能,较最强基线AUC超过0.001,并产生更高有效秩。全混合负责增强谱表达,GLU模块负责降低收缩,二者结合带来更好的规模鲁棒性。

应用场景

该架构适合广告点击率、信息流排序、电商推荐和短视频召回后的精排。已有Embedding—交互管线可将RankMixer模块替换为RankElastor;部署前需评估Token数量、W的显存占用、批处理延迟和线上校准。若有效秩监控与AUC同步改善,系统可在扩大模型时减少容量浪费。

局限与展望

主要限制包括数据集仅覆盖Criteo和Avazu、公开摘要缺少完整绝对指标,以及全参数W可能带来较高内存和计算成本。定理依赖谱非相干、次高斯权重和响应间隔等条件,未必覆盖真实偏斜特征。未来应发展结构化混合、在线秩监控、更多工业流量验证,并联合研究精度、延迟、成本与公平性。

通俗解读 非专业人士也能看懂

把推荐模型想成一家大型餐厅。每个Token像一位厨师,手里有用户、商品和场景信息。RankMixer让厨师按固定规则交换食材,再各自加工;问题是交换方式太死板,而加工过程可能不断丢掉食材种类。于是厨房看似越来越大,最后做出来的菜却越来越相似,这就是表示塌缩。

RankElastor做了两项改造。第一,它允许每种食材与其他食材自由组合,不再只按固定格子交换;第二,它让厨师使用“试吃—控制分量”的门控步骤,并保留一份原始食材,避免加工过度。论文用奇异值分布和有效秩衡量菜品是否丰富:秩越高,说明保留下来的信息类型越多。

在Criteo和Avazu上,RankElastor比最强基线AUC高出超过0.001,同时保持更丰富的内部表示。它说明扩大厨房不够,关键是别让加工流程把新空间又压扁。

简单解释 像给14岁少年讲一样

想象你在玩一个推荐游戏:系统要猜下一条视频、商品或广告是否会让你点击。它先把“你是谁、你看过什么、商品是什么”等信息写成很多小卡片,再让卡片互相交流。RankMixer很聪明,但它有个怪问题:卡片越来越多,最后内容却变得很像,好像全班同学都只会说同一句话!

研究者用“有效秩”检查信息到底有多丰富。RankMixer的交换步骤能增加一点差异,但后面的普通加工步骤又会把差异压回去,像气球被反复吹大又放气,最后在Avazu数据上尤其明显。

RankElastor像升级版团队。它让每张卡片都能和更多位置自由交流,而不是只能按固定路线传话;它还使用GLU门控,像一个小裁判决定哪些信息该放大、哪些该保留,并加回原始信息。这样,系统更不容易把所有卡片变成同一种颜色。

实验在Criteo和Avazu上进行,AUC比最强对手高超过0.001,内部信息也更丰富。听起来很棒,但还要继续测试速度、内存和真实线上效果,毕竟游戏里分数高不代表服务器一定跑得轻松!

术语表

Effective rank(有效秩/稳定秩)

衡量矩阵有效信息维度的谱指标,而非简单计算非零奇异值个数。论文定义为erank(X)=||X||²_F/||X||²_2。

用于跟踪各层表示是否扩张或塌缩。

Embedding collapse(Embedding塌缩)

表示集中到低秩子空间,多个奇异值接近零。它会降低特征多样性和模型扩展收益。

论文用它解释RankMixer的性能瓶颈。

Token Mixing(Token混合)

在不同Token之间传播信息的变换。RankMixer使用固定块转置,RankElastor使用可学习全混合。

负责跨字段、跨Token交互。

P-FFN(逐Token前馈网络)

对每个Token独立执行的前馈网络,用于特征变换与交互建模。标准版本采用两层GELU结构。

论文指出其可能造成有效秩收缩。

GLU(门控线性单元)

通过两路投影及逐元素乘法控制信息流的结构。门控可选择性放大或抑制特征。

RankElastor用其改造P-FFN。

Spectral robustness(谱鲁棒性)

表示奇异值分布在层间保持多样和稳定的能力。谱越稳健,通常越不易发生低秩塌缩。

是RankElastor的主要设计目标。

开放问题 这项研究留下的未解疑问

  • 1 全混合矩阵W在超大Token规模下的成本边界尚不清楚;需要稀疏、低秩或分块参数化,并量化AUC、延迟与显存的权衡。
  • 2 有效秩提高与线上点击、校准、长尾覆盖之间是否存在稳定因果关系,论文尚未通过长期A/B实验验证。
  • 3 理论假设在强偏斜、动态分布和多模态特征下是否成立,仍需更多数据集与训练设置检验。

应用场景

近期应用

广告CTR精排

广告平台可将RankMixer的交互模块替换为RankElastor,在保留Embedding和CTR训练流程的前提下监控有效秩、AUC与延迟。论文在Criteo、Avazu上报告超过0.001的AUC相对提升,但上线前需进行显存和吞吐压测。

内容推荐排序

视频或资讯平台可把用户、内容、上下文Token统一投影后使用GLU-P-FFN,减少深层表示趋同。适合已有FuxiCTR式训练管线的团队;应先离线比较有效秩、AUC、长尾点击和校准,再进行小流量实验。

远期愿景

谱感知的推荐模型扩展

未来可把有效秩作为训练和架构搜索信号,自动调整混合强度、隐藏宽度和深度,形成同时优化精度、表示多样性、成本与公平性的推荐基础模块。

原文摘要

Scaling recommendation models is a central challenge in recommender systems. Recently, RankMixer has emerged as an effective solution, operating on a unified token representation and alternating between token mixing and per-token feedforward networks (P-FFNs) to achieve scalable performance. However, RankMixer suffers from \textit{embedding collapse}, where learned representations have low effective rank, limiting expressivity and underutilizing the expanded representation space. Through empirical analysis and theoretical insights, we identify rigid token mixing and P-FFN modules as the primary causes of this phenomenon, jointly inducing a \textbf{damped oscillatory trajectory} in effective-rank evolution across layers. To address it, we propose RankElastor, a novel architecture that produces spectrum-robust representations with provable collapse mitigation. RankElastor introduces two components: (i) \textbf{parameterized full mixing}, which enables expressive token mixing with improved spectral robustness; and (ii) \textbf{GLU-improved P-FFNs}, which stabilize representation spectra through GLU-style FFN modules. Extensive experiments on large-scale industrial datasets demonstrate that RankElastor consistently improves recommendation performance, mitigates embedding collapse, and exhibits robust scaling behavior. Code is available at this GitHub repository: https://github.com/vasile-paskardlgm/RankElastor

cs.LG cs.IR math.NA