RankUp: Towards High-rank Representations for Large Scale Advertising Recommender Systems

TL;DR

RankUp通过随机置换、多嵌入和全局融合提升表示秩,改善推荐系统性能。

cs.IR 🔴 高级 2026-04-20 42 次浏览
Jin Chen Shangyu Zhang Bin Hu Chao Zhou Junwei Pan Gengsheng Xue Wentao Ning Gengyu Weng Wang Zheng Shaohua Liu Zeen Xu Chengyuan Mai Shijie Quan Tingyu Jiang Lifeng Wang Shudong Huang Chengguo Yin Haijie Gu Jie Jiang
推荐系统 表示学习 模型规模 深层架构 特征增强

核心发现

方法论

本文提出RankUp架构,结合随机置换分割、多嵌入、多全局融合和预训练知识注入,旨在缓解深层模型中的表示崩溃问题。通过 spectral指标有效秩评估表示多样性,验证了该方法在大规模广告推荐中的优越性。具体实现包括随机打乱稀疏特征、扩展嵌入空间、引入全局上下文和跨域预训练嵌入,结合多目标任务进行训练。实验证明RankUp在微信视频号广告平台实现GMV提升,线上AUC和表示秩指标显著优于基线。

关键结果

  • 在微信广告平台上,RankUp实现GMV提升3.41%、4.81%和2.12%,对应不同业务场景。实验证明每个机制都对缓解嵌入崩溃和提升表示多样性起到关键作用,尤其是全局融合和多嵌入策略带来最大增益。通过消除特征间的相关性,模型在深层结构中保持更高的表示秩,提升了模型的表达能力和泛化能力。
  • 在多任务学习环境中,RankUp显著改善了不同任务的表示能力,减少了任务间的干扰。对比传统RankMixer,RankUp在有效秩和AUC指标上均表现优越,验证了其在大规模工业场景中的实用性。 Ablation研究进一步确认了随机置换和跨域预训练的贡献。
  • 在公开数据集和工业数据上,RankUp展现出更强的鲁棒性和泛化能力,尤其在深层网络中保持高秩表现,避免了深层模型常见的表示崩溃问题。这为未来深层推荐模型的设计提供了新思路。

研究意义

该研究突破了深层推荐模型中表示容量有限的瓶颈,提出的RankUp架构显著提升了模型的表达多样性和鲁棒性。通过引入多机制协同作用,有效缓解了深层网络中的表示崩溃问题,为工业大规模推荐系统提供了理论基础和工程方案。其在实际广告平台中的成功应用,验证了深度模型在商业场景中的潜力,为未来个性化推荐的深层架构设计提供了重要参考。该方法不仅提升了推荐效果,也推动了深度表示学习在工业界的应用落地。

技术贡献

本文提出的RankUp架构在深层Transformer基础上引入随机置换、多嵌入、全局融合和跨域知识注入机制,显著增强了表示空间的多样性。通过 spectral指标有效秩评估,验证了模型在深层结构中保持高信息利用率。设计的机制突破了传统RankMixer的有限秩扩展限制,为深层推荐模型提供了新的工程思路。结合多目标任务训练,提升了模型的泛化能力和鲁棒性,为工业大规模推荐系统的深层架构提供了创新方案。

新颖性

本研究首次系统性引入随机置换、多嵌入和全局融合机制,专门针对深层推荐模型中的表示崩溃问题。不同于现有方法仅优化特征交互或增加参数,RankUp从根本上提升潜在空间的多样性和表达能力。其结合Spectral指标评估和多机制协同,提供了理论和实践上的新突破,显著优于传统RankMixer和Transformer变体,推动深层推荐模型的研究前沿。

局限性

  • 尽管RankUp在工业场景中表现优异,但其引入的多机制增加了模型复杂度和训练成本,可能限制在资源有限环境中的应用。
  • 模型在极端稀疏或高维特征空间中仍可能遇到表示崩溃或信息稀释的问题,未来需进一步优化机制以适应更复杂场景。
  • 当前方法主要验证在广告推荐场景,泛化到其他推荐任务或多模态数据仍需验证,未来工作应扩展其适用范围。

未来方向

未来将探索更高效的机制以降低模型复杂度,提升训练速度。同时,计划结合自监督学习和多模态信息,进一步丰富潜在空间的表达能力。还将研究模型在冷启动和长尾场景中的表现,推动深层推荐架构的普适性和可解释性。

AI 总览摘要

推荐系统的深层架构近年来取得显著进展,Transformer基础模型如MetaFormer在模型深度和特征维度扩展中表现出强大潜力。然而,深层模型的表示能力受限于潜在空间的崩溃问题,导致信息利用率下降。本文提出RankUp架构,通过引入随机置换、多嵌入、多全局融合和跨域知识注入,有效提升深层模型的表示多样性和鲁棒性。

在工业广告推荐场景中,RankUp在微信视频号广告平台实现了GMV提升,线上AUC指标优于传统模型。其机制通过打破特征相关性、扩展潜在空间、引入全局上下文和利用预训练知识,缓解了深层网络中的表示崩溃,保持高信息利用率。这些创新不仅提升了模型性能,也为深层推荐架构提供了新思路。

实验结果显示,RankUp在多任务、多场景下表现出优越的泛化能力,验证了其在实际工业环境中的应用价值。未来,研究将继续优化机制,降低复杂度,并结合多模态和自监督技术,推动深层推荐模型的广泛应用。该工作为推荐系统的深层架构设计提供了理论基础和工程实践指南,具有重要的学术和产业意义。

深度分析

研究背景

推荐系统从传统的手工特征交互逐步演进到深度表示学习,Transformer架构成为主流。代表性模型如AutoInt、Hiformer、RankMixer等,验证了模型深度和特征维度的扩展能带来性能提升。然而,随着模型变深,潜在空间的利用率逐渐下降,出现表示崩溃问题,限制了深层模型的潜力。学界通过谱指标如有效秩评估表示多样性,发现深层模型中的表示在不同层表现出振荡式的秩变化,未能实现持续增长。为解决这一瓶颈,研究者开始探索多机制融合、预训练知识注入等新策略,但仍未根本突破潜在空间的限制。

核心问题

深层推荐模型在模型深度增加时,表现出潜在空间的利用率下降,导致信息逐渐集中在低维子空间,影响模型的表达能力和泛化能力。这一问题在工业大规模广告推荐中尤为突出,限制了模型深度的进一步扩展。传统方法多依赖参数扩展或特征交互优化,但未能根本解决潜在空间的崩溃问题。如何在保证模型复杂度的同时,提升潜在空间的多样性和信息利用率,成为当前研究的核心难题。深层模型的潜在空间崩溃不仅影响推荐效果,也限制了模型在多任务、多场景中的应用。

核心创新

本文提出的RankUp架构通过多机制协同创新,解决深层模型中的表示崩溃问题。核心创新包括:•随机置换分割,打破特征相关性,增强潜在空间的多样性;•多嵌入策略,为每个特征引入多个几何视角,丰富表示空间;•全局融合机制,提供全局上下文,增强特征交互能力;•跨域预训练知识注入,结合外部知识提升表达能力;•任务特定解耦,缓解多任务训练中的表示干扰。这些机制共同作用,显著提升模型在深层结构中的表示秩和泛化能力。

方法详解

  • �� 架构基于MetaFormer,加入随机置换分割,打破特征间的相关性,增加潜在空间的多样性;• 采用多嵌入机制,为每个特征分配多个不同的嵌入表,提供多几何视角;• 引入全局Token,通过池化所有特征,提供全局上下文信息;• 跨域预训练嵌入,将外部知识融入模型,丰富潜在空间;• 设计任务特定的Token,缓解多任务训练中的干扰。训练过程中,结合PreNorm和SwiGLU激活,确保梯度稳定,提升训练效率。模型在多任务、多场景下进行验证,采用Spectral指标评估潜在空间利用率,确保深层网络中表示的丰富性。

实验设计

使用微信广告平台的大规模数据集,涵盖1200多特征,进行离线和线上A/B测试。对比基线RankMixer,验证RankUp在GMV和AUC上的提升。通过消融实验,分析每个机制对表示秩和性能的贡献。模型参数设置合理,采用多目标优化,确保多场景适应性。指标包括实时AUC、Spectral有效秩等,验证模型在深层结构中的表现。结果显示,RankUp在不同任务中均优于基线,尤其是全局融合和多嵌入机制带来最大提升。

结果分析

RankUp在微信广告平台实现GMV提升3.41%、4.81%和2.12%,显著优于传统模型。AUC指标也有明显改善,尤其在深层网络中保持高秩表现。消融实验显示,随机置换和跨域预训练对提升潜在空间多样性和模型性能起到关键作用。模型在多任务环境中表现出良好的泛化能力,减少了表示崩溃的发生。整体结果验证了RankUp在工业大规模推荐中的实用性和优越性。

应用场景

该方法适用于大规模广告推荐、内容个性化和多任务场景,特别适合需要深层模型表达丰富、多样的工业应用。通过丰富潜在空间,提升模型对稀疏特征的捕获能力,增强推荐的准确性和鲁棒性。未来可结合多模态信息和自监督学习,进一步拓展其在多场景、多模态推荐中的应用潜力。

局限与展望

尽管RankUp在工业场景中表现优异,但其引入的多机制增加了模型复杂度和训练成本,可能限制在资源有限环境中的应用。此外,模型在极端稀疏或高维特征空间中仍存在潜在崩溃风险。未来需优化机制以降低复杂度,提升泛化能力,并验证在多模态、多任务等更复杂场景中的适应性。

通俗解读 非专业人士也能看懂

想象你在一个工厂里,工人们要把各种零件组装成产品。每个工人负责不同的零件,但他们之间需要合作,确保每个零件都能完美配合。传统的方法就像每个工人只知道自己负责的零件,合作有限,容易出现问题。而RankUp就像引入了一种新工具,让工人们可以随机交换零件,带来更多组合可能,还用一个大屏幕显示所有零件的全局信息,确保每个零件都能找到最合适的位置。这样,工厂的生产线变得更灵活、更高效,制造的产品也更优质。这个方法让系统像一个聪明的工厂一样,能处理更多复杂的任务,生产出更好的“产品”。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏,拼图块有很多不同的形状和颜色。以前的拼图方法就像每个拼图块只能放在固定的位置,限制了你拼出完整画面的可能。而RankUp就像给每个拼图块配备了多个不同的标签,让它们可以在不同的地方试试,找到最适合的拼法,还用一个大镜子显示所有拼图的全局样子,帮助你更好地拼合。这样,你就可以拼出更漂亮、更完整的画面,而且拼图的过程也变得更有趣、更灵活。这个方法让拼图变得更聪明,能应对各种复杂的挑战,就像让你的拼图游戏变成了一个超级大脑!

原文摘要

The scaling laws for recommender systems have been increasingly validated, where MetaFormer-based architectures consistently benefit from increased model depth, hidden dimensionality, and user behavior sequence length. However, whether representation capacity scales proportionally with parameter growth remains unexplored. Prior studies on RankMixer reveal that the effective rank of token representations exhibits a damped oscillatory trajectory across layers, failing to increase consistently with depth and even degrading in deeper layers. Motivated by this observation, we propose RankUp, an architecture designed to mitigate representation collapse and enhance expressive capacity through randomized permutation splitting over sparse features, a multi-embedding paradigm, global token integration and crossed pretrained embedding tokens. RankUp has been fully deployed in large-scale production across Weixin Video Accounts, Official Accounts and Moments, yielding GMV improvements of 3.41%, 4.81% and 2.12%, respectively.

cs.IR