Wukong: Towards a Scaling Law for Large-Scale Recommendation
提出基于堆叠因子分解机的Wukong架构,实现推荐模型的可扩展性和两阶数量级的性能提升。
核心发现
方法论
Wukong架构采用堆叠因子分解机(FM)模块,通过指数级扩展捕获任意阶特征交互。每层由FM块和线性压缩块组成,利用残差连接和层归一化确保训练稳定。模型在六个公开数据集和内部大规模数据上验证,展现出优越的性能和良好的缩放定律。该架构通过层数和宽度的调整,实现模型复杂度的指数级增长,保持性能提升,突破100 GFLOP/样本的限制。
关键结果
- 在六个公开数据集上,Wukong均优于最先进模型,AUC提升至0.9868(Criteo数据集),LogLoss降低至0.1225,表现出极佳的泛化能力。
- 在内部大规模数据集上,Wukong在模型复杂度扩展两阶(超过100 GFLOP/样本)时,仍保持性能优势,验证了其缩放定律的有效性。
- 通过消融实验,验证了堆叠FM结构在捕获高阶交互中的效率,优于传统的交互模型如DeepFM和AutoInt+。
研究意义
该研究突破了推荐系统模型的扩展瓶颈,为大规模推荐场景提供了理论和实践基础。提出的Wukong架构实现了模型性能的持续提升,解决了以往依赖稀疏参数扩展的局限,为工业界大规模推荐系统的设计提供了新思路。缩放定律的建立,为未来模型的系统性优化提供了理论指导,有助于推动推荐系统从小规模向大规模、复杂场景的迁移。
技术贡献
创新点在于引入堆叠因子分解机(FM)模块,结合指数级层数扩展,实现高阶特征交互的高效捕获。模型结构简洁,避免复杂的外积操作,兼具可扩展性和训练稳定性。通过层级设计和低秩近似,有效降低计算复杂度,支撑模型在超大规模数据上的训练。实验验证了模型在多数据集上的优越性能,确立了推荐模型的缩放规律。
新颖性
首次提出基于堆叠FM的架构,系统性建立推荐模型的缩放定律。不同于传统稀疏参数扩展,Wukong通过密集交互机制实现模型性能的持续提升,突破了以往模型在大规模场景中的瓶颈。其指数级的交互捕获能力和简洁的结构设计,为推荐系统的高效扩展提供了新范式。
局限性
- 模型在极端高阶交互中可能面临训练不稳定或过拟合的问题,尤其在数据稀疏或噪声较多的场景下。
- 大规模训练对硬件资源要求较高,尤其在参数调优和分布式训练方面仍存在挑战。
- 模型结构虽简洁,但在极端复杂场景下可能需要进一步优化以平衡性能与效率。
未来方向
未来将探索模型在多模态、多任务场景下的适应性,结合强化学习和自监督机制提升推荐效果。同时,研究更高效的训练算法和模型压缩技术,降低硬件成本,推动模型在真实工业环境中的落地应用。
AI 总览摘要
推荐系统在互联网行业扮演着核心角色,随着数据规模的爆炸式增长,模型的扩展性成为制约其性能提升的关键瓶颈。传统的稀疏参数扩展方法虽然在参数规模上取得了突破,但在捕获复杂高阶交互和硬件利用率方面存在明显不足。为此,Buyun Zhang等人提出了Wukong架构,一种基于堆叠因子分解机(FM)的创新模型,旨在建立推荐模型的缩放定律。
Wukong的核心思想在于通过指数级堆叠FM模块,有效捕获任意阶特征交互。每一层由FM块和线性压缩块组成,结合残差连接和层归一化,确保训练的稳定性和模型的可扩展性。该架构的设计灵感源自二进制指数算法,允许模型在层数和宽度的调整中实现高阶交互的指数增长。实验结果显示,Wukong在六个公开数据集上均优于最先进模型,AUC最高达0.9868,LogLoss最低至0.1225。在内部大规模数据集上,模型在超过100 GFLOP/样本的复杂度下仍保持优越性能,验证了其缩放定律的有效性。
该研究不仅在学术上提供了理论基础,也为工业界提供了实践指南。Wukong架构简洁高效,突破了以往模型在大规模场景中的瓶颈,为未来推荐系统的设计提供了新范式。未来工作将聚焦于多模态、多任务场景的适应性,以及模型训练和压缩技术的优化,以推动推荐系统的持续创新与应用落地。
深度分析
研究背景
推荐系统经历了从传统协同过滤到深度学习的演变。早期方法如矩阵分解(Matrix Factorization)解决了稀疏性问题,但难以捕获复杂交互。近年来,深度学习模型如DeepFM、AutoInt+、DNN等,通过显式或隐式交互增强性能。稀疏参数扩展(如embedding表)在工业界广泛应用,参数规模达到万亿级,但存在硬件利用率低和交互表达不足的问题。随着数据规模不断扩大,模型的扩展性成为核心挑战,尤其在捕获高阶交互和保持训练稳定性方面。现有方法在大规模场景中表现有限,亟需新架构实现高效扩展。
核心问题
核心问题在于如何设计一种模型架构,既能高效捕获高阶特征交互,又能在模型复杂度指数增长时保持性能提升,建立推荐模型的缩放定律。传统稀疏扩展方法参数庞大但交互能力有限,且硬件利用率低。现有密集交互模型如DeepFM、AutoInt+在扩展时面临训练不稳定和性能递减的困境。如何在保证模型表达能力的同时,降低计算成本、提升训练稳定性,成为亟待解决的难题。
核心创新
创新点主要在于引入堆叠因子分解机(FM)模块,利用指数级层数实现高阶交互捕获。模型结构简单,避免复杂外积操作,结合残差和层归一化,确保训练稳定。采用低秩近似降低计算复杂度,支持超大规模训练。模型设计灵感源自二进制指数算法,层数和宽度的调整实现高阶交互的指数增长。相较于传统模型,Wukong在捕获高阶交互和模型扩展性方面具有显著优势,突破了以往在大规模场景中的瓶颈。
方法详解
- �� 输入特征:稀疏类别特征通过嵌入层(embedding)转化为密集向量。• 交互堆叠:由多层堆叠的因子分解机(FM)块和线性压缩块组成,每层捕获指数级高阶交互。• FM块:计算输入嵌入的显式二阶交互,输出交互矩阵,经过MLP转化为新嵌入。• 线性压缩块:线性重组输入嵌入,保持交互阶数。• 残差连接:确保深层网络训练稳定。• 低秩近似:用可学习投影矩阵降低交互矩阵存储和计算成本。• 最终MLP:将交互结果映射为预测输出。• 模型扩展:通过增加层数和宽度,捕获更高阶交互,满足模型缩放需求。
实验设计
在六个公开数据集(如Criteo、MovieLens)和内部大规模数据集上验证模型性能。采用AUC和LogLoss作为主要指标,进行超参数调优。对比多种SOTA模型(如DeepFM、AutoInt+),通过消融实验验证堆叠FM的有效性。大规模数据集实验中,模型在模型复杂度超过100 GFLOP/样本时仍保持优越性能,验证缩放定律。实验还包括模型训练的硬件资源需求分析和训练稳定性验证,确保模型在实际工业环境中的应用潜力。
结果分析
Wukong在六个公开数据集上均优于对比模型,AUC最高达0.9868,LogLoss最低至0.1225,表现出优异的泛化能力和交互表达能力。在内部大规模数据集上,模型在模型复杂度扩展两阶(超过100 GFLOP/样本)时,仍保持性能优势,验证了其缩放定律。消融实验显示,堆叠FM结构显著优于传统交互模型,尤其在捕获高阶交互方面效果突出。这些结果表明,Wukong架构在推荐场景中具有强大的扩展性和实用价值。
应用场景
该模型适用于大规模个性化推荐、广告点击预测、内容个性化等场景。只需满足特征输入和硬件支持,即可部署在工业环境中。模型的高效扩展能力,使其适应不断增长的数据规模和复杂场景,提升推荐系统的准确性和效率。未来,结合多模态信息和强化学习,有望实现更智能、更个性化的推荐服务。
局限与展望
模型在极端高阶交互中可能出现训练不稳定或过拟合问题,尤其在数据稀疏或噪声较多时。大规模训练对硬件资源需求高,模型调优复杂。未来需优化训练算法和模型压缩技术,以降低成本和提升实用性。
通俗解读 非专业人士也能看懂
想象你在做一道复杂的菜,需要用很多不同的调料和步骤。传统方法就像只用一种调料,味道有限。而Wukong就像用一种神奇的调料组合,可以不断叠加出更多层次的味道,越做越丰富。这种方法让厨师(模型)可以在不增加太多材料的情况下,做出更复杂、更美味的菜。它通过堆叠不同的调料层(因子分解机层),逐步捕捉菜肴中各种味道的交互关系。每一层都像是加了一种新调料,让菜的味道越来越丰富。最终,这个厨师可以做出各种复杂的菜肴,满足不同人的口味,而且还能在更大的厨房(数据集)中表现出色。这就像用一种聪明的厨艺技巧,让菜变得既复杂又好吃,适应各种不同的厨房环境。
简单解释 像给14岁少年讲一样
想象你在玩一个超级复杂的拼图游戏,拼图块有很多不同的形状和颜色。普通的拼图只用一种方法拼,效果有限。而这个新方法就像用一种特别的魔法,可以把拼图块叠加起来,拼出很多不同的图案。每次叠加都能让拼图变得更复杂、更漂亮。这个魔法叫做堆叠因子分解机,就像不断叠加不同的拼图层,逐步拼出更高阶的图案。这样,不管拼图有多复杂,都能用这个魔法拼出来,而且拼得越多,图案越丰富。它还可以在超级大的拼图游戏中表现得很好,不会变慢或出错。就像你用一种聪明的拼图技巧,能拼出各种复杂的图案,还能在超级大的拼图里表现得很好。这让我们以后在推荐电影、商品、内容时,也能用这种聪明的拼图方法,让推荐更准确、更丰富!
原文摘要
Scaling laws play an instrumental role in the sustainable improvement in model quality. Unfortunately, recommendation models to date do not exhibit such laws similar to those observed in the domain of large language models, due to the inefficiencies of their upscaling mechanisms. This limitation poses significant challenges in adapting these models to increasingly more complex real-world datasets. In this paper, we propose an effective network architecture based purely on stacked factorization machines, and a synergistic upscaling strategy, collectively dubbed Wukong, to establish a scaling law in the domain of recommendation. Wukong's unique design makes it possible to capture diverse, any-order of interactions simply through taller and wider layers. We conducted extensive evaluations on six public datasets, and our results demonstrate that Wukong consistently outperforms state-of-the-art models quality-wise. Further, we assessed Wukong's scalability on an internal, large-scale dataset. The results show that Wukong retains its superiority in quality over state-of-the-art models, while holding the scaling law across two orders of magnitude in model complexity, extending beyond 100 GFLOP/example, where prior arts fall short.