Search-based User Interest Modeling with Lifelong Sequential Behavior Data for Click-Through Rate Prediction

TL;DR

提出基于搜索的兴趣模型(SIM),利用双级搜索处理长序列行为数据,提升CTR预测准确率。

cs.IR 🔴 高级 2020-06-10 47 次浏览
Pi Qi Xiaoqiang Zhu Guorui Zhou Yujing Zhang Zhe Wang Lejian Ren Ying Fan Kun Gai
用户行为建模 长序列数据 搜索机制 点击率预测 工业应用

核心发现

方法论

本文提出的SIM模型采用两级搜索策略:第一阶段的通用搜索单元(GSU)利用类别匹配或最大内积搜索,从超长行为序列中筛选出与候选商品相关的子序列;第二阶段的精确搜索单元(ESU)基于多头注意力机制,捕获候选商品与筛选子序列的精确关系。模型结合了长短期行为特征,优化了模型的可扩展性与准确性。训练过程中,两个模块共同优化,损失函数为加权交叉熵。该架构显著提升了对超长行为序列的建模能力。

关键结果

  • 在淘宝和阿里巴巴工业数据集上,SIM模型的AUC分别达到0.9416和0.7510,优于MIMN(0.9278和0.7396)和DIN等方法,提升幅度超过1.5%。在实际系统中,模型最大支持行为序列长度达54000,较行业SOTA提升54倍,带来7.1%的CTR和4.4%的RPM增长。
  • 离线实验验证了两级搜索架构的有效性,单独使用第一阶段搜索即可提升AUC,结合第二阶段后效果更佳。软硬搜索策略在工业场景中表现相似,硬搜索因资源节省被优先采用。
  • 模型在大规模工业系统中的部署,展示了其在长序列行为数据处理中的优越性,显著改善了用户兴趣捕获的精度与系统响应速度。

研究意义

该研究突破了长序列用户行为数据在工业环境中的建模瓶颈,解决了传统方法在序列长度扩展时的性能退化问题。通过引入双级搜索架构,有效过滤噪声,提升模型的可扩展性与精度,为广告推荐、个性化内容提供了强有力的技术支撑。模型在实际系统中的成功部署,验证了其商业价值,推动了行业长序列行为建模的技术革新,具有重要的学术与工业意义。

技术贡献

本文提出的SIM模型创新性地结合了搜索机制与深度兴趣建模,首次在工业场景中实现超长行为序列的高效处理。引入两级搜索架构,突破了固定长度限制,显著提升了模型的扩展性。采用多头注意力机制增强兴趣关系的捕获能力,结合类别索引实现高效过滤。模型训练中,两个模块共同优化,兼顾效率与效果。该方案为长序列行为建模提供了新思路,拓展了深度学习在大规模工业系统中的应用边界。

新颖性

本研究的创新点在于提出基于搜索的双阶段兴趣模型(SIM),首次在工业环境中实现行为序列长度达54000的高效建模。不同于以往仅依赖固定长度或简单注意力机制的方法,SIM通过类别索引和最大内积搜索,有效过滤噪声,提升模型的可扩展性与准确性。这一架构结合了搜索技术与深度兴趣建模的优势,是长序列用户行为建模的突破性尝试。

局限性

  • 模型对类别索引的依赖较强,需预先构建高效索引结构,增加系统复杂度,且在类别划分不明确或变化频繁时效果可能下降。
  • 搜索策略在极端长序列中仍存在一定的噪声干扰,可能影响兴趣捕获的精度,尤其在类别不明显或行为多样性高的场景。
  • 模型训练和部署成本较高,尤其是在大规模系统中,索引维护和搜索优化仍需持续投入。未来需进一步降低复杂度,提升鲁棒性。

未来方向

未来将探索自适应类别索引策略,提升模型对类别变化的适应能力;优化搜索算法,降低计算成本;结合强化学习或迁移学习,增强模型在不同场景下的泛化能力。同时,考虑多模态行为数据的融合,丰富用户兴趣表示,推动长序列建模技术在更多工业应用中的落地。

AI 总览摘要

随着互联网行业的快速发展,用户行为数据呈现爆炸式增长,如何高效、准确地建模这些海量的长序列行为成为行业难题。传统方法如MIMN虽在序列长度扩展方面取得突破,但在序列进一步增长时,模型对用户兴趣的捕获逐渐失准,噪声干扰严重,限制了实际应用效果。为解决这一瓶颈,本文提出了基于搜索的兴趣模型(SIM),采用两级搜索架构:第一阶段的通用搜索单元(GSU)从超长行为序列中筛选出与候选商品相关的子序列,第二阶段的精确搜索单元(ESU)利用多头注意力机制,捕获候选商品与筛选子序列的细粒度关系。这一设计显著提升了模型的可扩展性与精度,模型最大支持行为序列长度达54000,比行业SOTA提升54倍。在淘宝和阿里巴巴的工业系统中,SIM模型已实现7.1%的CTR提升和4.4%的RPM增长,验证了其强大实用价值。实验结果显示,双级搜索策略有效过滤噪声,增强兴趣捕获能力,为工业界长序列行为建模提供了新思路。未来,该模型有望结合自适应索引和多模态数据,推动个性化推荐技术的持续发展。

深度分析

研究背景

用户行为数据的丰富性推动了个性化推荐的发展,早期方法如深度神经网络(DNN)和卷积神经网络(CNN)在特征交互方面取得一定成效。近年来,关注用户兴趣的模型如DIN、DIEN、MIND等引入注意力机制、多向兴趣表示等技术,显著提升了预测性能。长短期行为的结合成为研究热点,尤其在工业场景中,长序列行为数据的利用面临存储和计算瓶颈。MIMN模型通过固定大小记忆网络实现长序列建模,取得行业领先,但在序列长度超过一定阈值后,兴趣捕获逐渐失准。传统方法在扩展到数万甚至上万长度时,噪声和计算成本成为主要障碍。

核心问题

核心问题在于如何在保证模型精度的同时,处理超长行为序列(如54000个行为)带来的存储和计算挑战。现有模型如MIMN在序列长度增加后,兴趣表示受到噪声干扰,导致预测性能下降。此外,工业系统对响应速度和存储成本有严格要求,传统方法难以满足大规模实时场景的需求。这使得长序列建模成为制约行业发展的瓶颈,亟需创新架构以突破序列长度限制。

核心创新

本研究提出了基于搜索的双阶段兴趣模型(SIM),创新点包括:1)引入类别索引和最大内积搜索,有效过滤噪声,缩短行为序列;2)采用两级架构,第一阶段筛选相关子序列,第二阶段利用多头注意力捕获细粒度关系;3)支持最大长度54000的长序列建模,显著优于行业现有方案。该架构结合了搜索技术与深度兴趣建模的优势,突破了传统固定长度限制,为工业场景提供了高效、可扩展的解决方案。

方法详解

  • �� 设计双级搜索架构:第一阶段的通用搜索单元(GSU)利用类别匹配或最大内积搜索,从超长行为序列中筛选出相关子序列;第二阶段的精确搜索单元(ESU)基于多头注意力机制,捕获候选商品与筛选子序列的关系。• GSU包括硬搜索(类别匹配)和软搜索(embedding + MIPS),前者简单直接,后者利用高效索引快速筛选。• 训练过程中,两模块共同优化,损失函数为加权交叉熵,确保模型兼顾效率与效果。• 采用类别索引(行为树)预先构建,支持离线快速查询,减轻在线响应压力。• 在工业系统中,模型最大支持行为长度达54000,显著提升了长序列建模能力。

实验设计

  • �� 使用淘宝、亚马逊和阿里巴巴工业数据集,分别验证模型在不同场景下的性能。• 比较模型包括DIN、MIMN、Avg-Pooling Long DIN等,指标为AUC。• 采用离线和线上AB测试,调优超参数(如搜索Top-K数量、损失权重)。• 重点验证双级搜索架构对长序列的适应性和效果提升。• 通过消融实验,确认两级搜索和类别索引的贡献。

结果分析

  • �� 在淘宝和工业数据集上,SIM模型的AUC分别达到0.9416和0.7510,优于MIMN(0.9278和0.7396)和DIN等方法,提升超过1.5%。• 支持行为序列长度达54000,较行业SOTA提升54倍,带来7.1%的CTR和4.4%的RPM增长。• 实验验证两级搜索有效过滤噪声,提升兴趣捕获精度,模型在工业系统中实现实时响应,表现优异。

应用场景

  • �� 适用于广告推荐、内容个性化等场景,尤其在长序列行为数据丰富的工业环境中。• 需要预先构建类别索引和高效搜索基础设施,确保模型实时性。• 未来可结合多模态数据和强化学习,进一步提升用户兴趣理解和推荐效果。

局限与展望

  • �� 依赖类别索引,维护成本高,类别划分不明确时效果受影响。• 搜索策略在极端长序列中仍存在噪声干扰,影响兴趣捕获。• 模型训练和部署成本较高,需持续优化索引和搜索算法。未来需降低复杂度,增强鲁棒性。

通俗解读 非专业人士也能看懂

想象你在一家大厨房里准备一顿丰富的晚餐。每次做菜都需要挑选合适的食材,但厨房里有成千上万的食材,找到最合适的那几样非常困难。于是,你设计了两个步骤:第一步,先根据食材的类别(比如蔬菜、肉类)快速筛选出可能用到的几样;第二步,再仔细比较这些食材的具体特性(比如新鲜度、味道),挑出最适合做当前菜肴的那几样。这个过程就像论文中的双级搜索:第一阶段筛选出相关行为序列,第二阶段细致分析兴趣关系。这样一来,无论食材多长、多复杂,你都能快速找到最合适的搭配,做出美味佳肴。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,你有一大堆装备和任务要处理。有时候,你只想专注于那些对当前任务最有帮助的装备,而不是全部都用上。于是,你设计了两个步骤:第一步,用一个快速的筛选器,根据装备的类别(比如武器、护甲)找到可能有用的几件;第二步,再用一个聪明的分析器,仔细研究这些装备的具体属性(比如攻击力、防御力),确定哪些最适合当前任务。这样一来,即使装备堆积如山,你也能迅速找到最合适的装备,完成任务。这就像论文中的搜索兴趣模型:先筛选相关行为,再细致分析兴趣关系,帮助系统更聪明地理解用户喜欢什么。

术语表

搜索机制 (Search Mechanism)

一种通过类别匹配或向量内积快速筛选相关行为的方法,提升长序列数据处理效率。

用于第一阶段筛选用户行为子序列。

多头注意力 (Multi-head Attention)

一种深度学习技术,通过多个注意力头同时关注不同信息子空间,增强关系捕获能力。

在第二阶段捕获候选商品与行为子序列的关系。

行为树 (Behavior Tree)

预先构建的索引结构,将用户行为按类别存储,支持快速检索。

支持离线构建,提升在线搜索效率。

最大内积搜索 (Maximum Inner Product Search, MIPS)

一种高效的向量检索技术,用于在大规模向量空间中快速找到与目标向量内积最大的元素。

实现软搜索中的行为筛选。

兴趣建模 (Interest Modeling)

通过分析用户历史行为,提取其潜在兴趣偏好,用于个性化推荐。

核心任务之一,提升CTR预测性能。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升长序列行为数据的噪声过滤能力,尤其在类别不明确或行为多样性高的场景中仍存在挑战。
  • 2 模型在极端长序列(如上万行为)下的响应速度和存储成本优化空间有限,未来需探索更高效的索引与搜索算法。
  • 3 如何结合多模态信息(如图片、文本)丰富用户兴趣表示,提升模型的泛化能力和推荐多样性。

应用场景

近期应用

广告推荐优化

利用SIM模型在工业广告系统中处理超长用户行为序列,提升广告点击率和转化率,满足实时响应需求。

内容个性化推荐

在内容平台中应用长序列行为建模,提供更精准的内容推送,增强用户粘性和满意度。

远期愿景

智能用户画像

结合多模态数据,构建动态、全景的用户兴趣画像,推动个性化服务的全面升级。

原文摘要

Rich user behavior data has been proven to be of great value for click-through rate prediction tasks, especially in industrial applications such as recommender systems and online advertising. Both industry and academy have paid much attention to this topic and propose different approaches to modeling with long sequential user behavior data. Among them, memory network based model MIMN proposed by Alibaba, achieves SOTA with the co-design of both learning algorithm and serving system. MIMN is the first industrial solution that can model sequential user behavior data with length scaling up to 1000. However, MIMN fails to precisely capture user interests given a specific candidate item when the length of user behavior sequence increases further, say, by 10 times or more. This challenge exists widely in previously proposed approaches. In this paper, we tackle this problem by designing a new modeling paradigm, which we name as Search-based Interest Model (SIM). SIM extracts user interests with two cascaded search units: (i) General Search Unit acts as a general search from the raw and arbitrary long sequential behavior data, with query information from candidate item, and gets a Sub user Behavior Sequence which is relevant to candidate item; (ii) Exact Search Unit models the precise relationship between candidate item and SBS. This cascaded search paradigm enables SIM with a better ability to model lifelong sequential behavior data in both scalability and accuracy. Apart from the learning algorithm, we also introduce our hands-on experience on how to implement SIM in large scale industrial systems. Since 2019, SIM has been deployed in the display advertising system in Alibaba, bringing 7.1\% CTR and 4.4\% RPM lift, which is significant to the business. Serving the main traffic in our real system now, SIM models user behavior data with maximum length reaching up to 54000, pushing SOTA to 54x.

cs.IR stat.ML