EST: Towards Efficient Scaling Laws in Click-Through Rate Prediction via Unified Modeling

TL;DR

提出EST架构,通过LCA和CSA实现CTR预测的全序列统一建模,显著提升工业应用性能。

cs.IR 🔴 高级 2026-02-11 40 次浏览
Mingyang Liu Yong Bai Zhangming Chan Sishuo Chen Xiang-Rong Sheng Han Zhu Jian Xu Xinyang Chen
推荐系统 CTR预测 模型扩展 Transformer 工业应用

核心发现

方法论

本文基于CTR预测任务的特性,提出全序列统一建模架构EST,核心包括轻量交叉注意力(LCA)和内容稀疏注意(CSA)。LCA通过剪枝低效自交互,强化跨特征依赖;CSA利用内容相似性动态选择高信号行为。模型输入为非行为特征、用户行为、候选行为及内容特征的融合序列,避免早期信息丢失。实验中采用淘宝广告平台数据,验证模型在参数规模扩大时表现出稳定的幂律增长关系,优于传统分层或部分统一模型。

关键结果

  • 在淘宝广告平台上线后,EST模型实现3.27%的RPM提升和1.22%的CTR增长,超越现有生产基线,验证其工业实用性。
  • 模型规模扩大至数百亿参数时,性能持续提升,符合幂律规律,预测性能与模型参数正相关,具有良好的可扩展性。
  • LCA有效减少冗余计算,CSA提升行为信号利用效率,整体架构实现了高效的全序列建模,显著改善了行为序列长、信息异质的挑战。

研究意义

该研究突破了CTR预测中模型规模扩展的瓶颈,提供了理论与实践结合的统一建模方案。通过引入内容相似性和跨特征交互优先策略,解决了传统模型在大规模场景下的效率与效果难题,为工业推荐系统的规模化提供了可行路径。其幂律增长特性为未来模型设计提供了理论指导,有助于实现更大规模、更高性能的工业应用。

技术贡献

本文的主要技术创新在于:首先,提出基于信息密度异质性分析的全序列统一建模框架,突破了传统分层或局部建模的限制;其次,设计LCA模块,剪枝低价值自交互,强化关键跨特征依赖;再次,提出CSA机制,利用内容相似性动态筛选高信号行为,提升信息利用效率。这些机制使模型在保持高效计算的同时,实现参数规模的线性扩展,提供了理论上的幂律关系保证。

新颖性

本研究首次系统性结合CTR预测中的信息密度不对称性与内容异质性,提出全序列统一建模架构,显著不同于以往的分层或部分统一模型。LCA和CSA的设计充分利用领域特性,突破了Transformer在工业场景中的计算瓶颈,提供了理论与工程的创新结合,为大规模推荐模型提供新思路。

局限性

  • 模型在极端稀疏或内容噪声较高的场景下可能表现有限,因内容相似性依赖可能受噪声干扰。
  • 模型训练和推理仍需较大计算资源,特别是在亿级参数规模下,硬件成本较高。
  • 对于多模态内容的多样性和动态变化,模型适应性和泛化能力仍需进一步验证。

未来方向

未来将探索多模态内容的更深融合机制,提升模型对动态内容变化的适应性。同时,结合联邦学习等技术实现模型的分布式训练,降低硬件成本,推动模型在更广泛工业场景中的应用。还将研究模型的可解释性和鲁棒性,以增强实际部署的可信度。

AI 总览摘要

在推荐系统中,CTR预测作为核心任务,面临大规模、多模态、低延迟的挑战。传统模型多采用早期行为序列压缩或局部建模,导致信息丢失或效率瓶颈。本文提出的EST架构,通过引入LCA和CSA两个模块,实现所有原始输入的全序列统一建模,避免信息损失,显著提升模型性能。

LCA模块通过剪枝低效自交互,强化跨特征依赖,降低冗余计算,确保模型在参数扩展时保持高效。CSA利用内容相似性动态筛选高信号行为,有效利用异质内容信息,提升行为信号的表达能力。这一设计充分考虑CTR任务的异质性和信息密度差异,实现了模型规模与性能的幂律关系。

在淘宝广告平台的实际部署中,EST模型实现了3.27%的RPM提升和1.22%的CTR增长,验证了其工业应用价值。模型的性能随参数规模扩大持续提升,展现出良好的可扩展性,为未来工业推荐系统的规模化提供了理论基础和实践路径。

该研究的创新点在于:1) 基于信息密度异质性分析,提出全序列统一建模架构;2) 设计LCA模块,有效剪枝冗余交互;3) 利用内容相似性实现稀疏注意,提升信息利用效率。这些技术突破为大规模、长序列、多模态的工业推荐模型提供了新思路,推动行业向更高性能、更大规模的目标迈进。

深度分析

研究背景

推荐系统中的CTR预测经历了从传统机器学习到深度学习的演变,代表性模型包括LR、FM、DeepFM、DIN等。随着模型规模扩大,性能不断提升,但面临序列长、信息异质、计算瓶颈等挑战。近年来,Transformer架构被引入,推动模型向全序列建模发展,但在工业场景中仍受限于计算成本和效率,特别是在亿级参数和数千序列长度的场景下。多模态内容和行为序列的异质性也增加了模型设计难度。

核心问题

核心问题在于如何在严格的计算预算内实现模型的规模化扩展,同时保持高效和准确。现有方法多采用早期行为压缩或局部交互,导致信息丢失或模型难以充分利用长序列中的细粒度信号。工业场景要求模型在毫秒级响应下处理数千候选项,传统Transformer难以满足高效性和扩展性需求。

核心创新

创新点包括:1) 基于信息密度不对称性分析,提出全序列统一建模架构,避免早期信息丢失;2) 设计LCA模块,剪枝低价值自交互,强化关键跨特征依赖,降低冗余;3) 引入CSA机制,利用内容相似性动态筛选高信号行为,提升信息利用效率。这些设计充分结合CTR任务的特性,突破了传统Transformer在工业场景中的瓶颈。

方法详解

  • �� 输入:非行为特征N、用户行为B、候选行为Bc及内容特征,全部映射为统一序列。• LCA:在每一层中,通过剪枝自交互,只保留非行为与行为之间的关键交互,减少冗余。• CSA:利用内容相似性(如文本、图片特征)动态选择行为子集,进行稀疏注意,提升信号利用。• 全序列处理:所有特征在单一序列中输入Transformer,避免多阶段压缩。• 训练:采用大规模参数优化,验证模型幂律增长关系。

实验设计

采用淘宝广告平台真实数据,包含亿级用户行为和多模态内容。对比基线包括DIN、AutoInt、Longer、MTGR等。指标为RPM、CTR、AUC。通过参数规模变化,验证模型在不同规模下的性能表现。还进行了消融实验,验证LCA和CSA的贡献。

结果分析

在工业环境中,EST模型实现3.27%的RPM提升和1.22%的CTR增长,优于所有对比模型。模型参数从数亿到百亿级别,性能持续提升,符合幂律规律。LCA显著减少计算冗余,CSA增强内容信号利用,整体架构实现长序列高效建模。

应用场景

该模型适用于大规模工业推荐场景,特别是广告、内容推荐等。只需丰富的行为和内容数据,结合预训练内容表示,便可实现高效预测。部署后能显著提升广告收入和用户体验,满足工业级响应要求。

局限与展望

模型在极端稀疏或内容噪声较高时表现有限,内容相似性依赖可能受干扰。训练和推理成本仍较高,硬件要求大。未来需优化模型鲁棒性和适应性,降低成本,增强泛化能力。

通俗解读 非专业人士也能看懂

想象你在一家大型工厂工作,工厂里有很多不同的机器和工人。每个机器都在做不同的任务,有的生产零件,有的包装产品。你需要安排这些机器的工作顺序,让整个生产线效率最高。传统方法可能只关注某一段时间的生产情况,忽略了前后关系,导致效率低下。而这篇论文就像发明了一种智能调度系统,它能同时考虑所有机器的状态,优先安排最重要的任务,减少空转和浪费。它还会根据内容相似性,动态调整哪些机器需要合作,哪些可以单独工作。这样一来,工厂的生产速度大大提高,成本降低,效果更好。这就像给工厂装上了智能大脑,让它变得更聪明、更快。

简单解释 像给14岁少年讲一样

想象你在学校里组织一个大项目,有很多不同的任务,比如写报告、做演示、收集资料。以前,你可能会只关注某个任务的部分内容,忽略了其他重要信息,结果花了很多时间还不够好。而现在,有个超级聪明的助手,它可以同时看所有任务的内容,帮你优先处理最重要的部分,还会根据资料的相似性,帮你找到最相关的内容。这样,你的工作变得快多了,质量也更高。这就像论文里的方法一样,它用一种聪明的方式,把所有信息都放在一起,优先处理最关键的部分,节省了很多时间和精力,还能做出更好的预测。它就像你的学习助手,让你变得更聪明、更高效!

术语表

Transformer(变换器)

一种深度学习模型架构,擅长处理序列数据,通过注意力机制捕获长距离依赖。

论文中用于全序列建模,支持多模态信息融合。

Content Sparse Attention(内容稀疏注意)

利用内容相似性动态筛选行为子集,减少冗余计算,提高信息利用效率。

核心机制之一,用于提升模型在长序列中的表现。

Lightweight Cross-Attention(轻量交叉注意)

剪枝低效自交互,只保留非行为与行为之间的关键交互,降低冗余。

实现跨特征依赖强化,提升模型效率。

幂律规模关系(Power-law scaling)

模型性能与参数规模呈幂函数关系,规模越大性能越优。

验证模型在不同参数规模下的性能增长规律。

多模态内容(Multimodal content)

包括文本、图片等多种内容形式,丰富信息表达。

行为和内容特征的主要组成部分。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升模型在极端稀疏或噪声环境下的鲁棒性,仍是未来研究重点。
  • 2 多模态内容的动态变化如何更好地融合与适应,尚需深入探索。
  • 3 模型在超大规模参数下的训练效率和硬件成本优化,是行业面临的实际难题。

应用场景

近期应用

工业广告推荐

结合EST模型,提升广告点击率和收入,满足高效低延迟需求,适用于电商平台的实时广告投放。

内容个性化推荐

在内容平台中实现长序列行为建模,提升个性化推荐效果,增强用户体验。

远期愿景

大规模智能推荐系统

实现全场景、多模态、多任务的统一建模架构,推动推荐系统向更大规模、更智能化方向发展。

原文摘要

Efficiently scaling industrial Click-Through Rate (CTR) prediction has recently attracted significant research attention. Existing approaches typically employ early aggregation of user behaviors to maintain efficiency. However, such non-unified or partially unified modeling creates an information bottleneck by discarding fine-grained, token-level signals essential for unlocking scaling gains. In this work, we revisit the fundamental distinctions between CTR prediction and Large Language Models (LLMs), identifying two critical properties: the asymmetry in information density between behavioral and non-behavioral features, and the modality-specific priors of content-rich signals. Accordingly, we propose the Efficiently Scalable Transformer (EST), which achieves fully unified modeling by processing all raw inputs in a single sequence without lossy aggregation. EST integrates two modules: Lightweight Cross-Attention (LCA), which prunes redundant self-interactions to focus on high-impact cross-feature dependencies, and Content Sparse Attention (CSA), which utilizes content similarity to dynamically select high-signal behaviors. Extensive experiments show that EST exhibits a stable and efficient power-law scaling relationship, enabling predictable performance gains with model scale. Deployed on Taobao's display advertising platform, EST significantly outperforms production baselines, delivering a 3.27\% RPM (Revenue Per Mile) increase and a 1.22\% CTR lift, establishing a practical pathway for scalable industrial CTR prediction models.

cs.IR