HyFormer: Revisiting the Roles of Sequence Modeling and Feature Interaction in CTR Prediction

TL;DR

HyFormer结合序列建模与特征交互,创新性引入全局Token,显著提升CTR预测性能。

cs.IR 🔴 高级 2026-01-19 42 次浏览
Yunwen Huang Shiyong Hong Xijun Xiao Jinqiu Jin Xuanyuan Luo Zhe Wang Zheng Chai Shikang Wu Yuchao Zheng Jingjian Lin
推荐系统 Transformer 序列建模 特征交互 工业应用

核心发现

方法论

HyFormer采用统一的混合Transformer架构,核心包括Query Decoding和Query Boosting两个模块。前者利用全局Token对长序列进行解码,增强序列表示;后者通过MLP-Mixer式的Token混合,强化异质特征间的交互。模型在多层堆叠中交替执行,形成双向信息流,实现早期深层交互。具体算法结合Transformer的多头交叉注意力机制,支持多序列建模,优化全局语义表达。实验中,模型在亿级工业数据集上超越LONGER和RankMixer,参数和FLOPs预算下性能提升3-5%,且表现出良好的扩展性。在线A/B测试显示,CTR提升达2.3%,转化率提升1.8%,验证其实用性。

关键结果

  • 在工业数据集上,HyFormer在参数相当、FLOPs相似条件下,准确率提升3.2%,AUC达0.812,优于LONGER和RankMixer,尤其在长序列和高维特征场景中优势明显。
  • 模型展现出优越的扩展性,参数增加50%时,性能提升约1.5%,FLOPs增加20%仍保持较好效果,验证了其良好的可扩展性。
  • 在线A/B测试中,CTR提升2.3%,转化率提升1.8%,显著优于现有工业模型,验证了其在高流量场景中的实用价值。

研究意义

该研究突破了传统序列建模与特征交互的单向、后期融合限制,提出一体化架构,增强模型表达能力与扩展性。对工业推荐系统具有重要意义,解决长序列信息利用不足、特征交互浅层化等核心难题,推动大规模推荐模型的性能提升与应用普及。

技术贡献

提出HyFormer架构,创新性引入全局Token机制,结合Query Decoding和Query Boosting实现深层次双向交互。模型支持多序列、多模态信息的联合建模,突破传统两阶段流水线的限制,提升模型容量与效率。算法上,结合Transformer的多头交叉注意力与MLP-Mixer技术,优化序列解码与特征融合流程,提供理论保证与工程实现路径。

新颖性

首次将全局Token引入长序列建模,打破序列压缩后再交互的单向限制,实现序列与特征的早期深度融合。相较于现有OneTrans和MTGR,HyFormer在模型结构上实现了真正的端到端统一,显著提升模型表达能力和扩展性。

局限性

  • 模型在极长序列(超过数万行为)场景下仍面临序列信息稀释和计算成本上升的问题,需进一步优化序列编码策略。
  • 全局Token的数量和质量依赖于特征设计,可能在某些复杂场景中影响效果,需结合自动特征选择机制。
  • 模型训练和推理复杂度较高,实际部署中需平衡性能与效率,未来需探索更轻量化方案。

未来方向

未来将探索多模态、多任务联合建模,提升模型对多源信息的融合能力。还将研究更高效的序列编码技术,降低计算成本。同时,结合强化学习或因果推断,增强模型的解释性和鲁棒性,推动工业推荐系统的智能化升级。

AI 总览摘要

在工业推荐系统中,长序列用户行为和异质特征的联合建模一直是核心难题。传统架构采用序列压缩后再进行特征交互,存在表达能力不足和扩展性差的问题。本文提出HyFormer,一种创新的混合Transformer架构,通过引入全局Token实现序列与特征的深度早期交互。模型由Query Decoding和Query Boosting两个模块组成,前者利用多头交叉注意力对长序列进行解码,增强序列表示;后者通过MLP-Mixer式的Token混合,强化异质特征间的交互。多层堆叠实现双向信息流,优化模型表达能力。实验在亿级工业数据集上,HyFormer超越现有长序列模型和特征交互模型,参数和FLOPs预算下性能提升3-5%,且表现出良好的扩展性。在线A/B测试中,CTR提升2.3%,转化率提升1.8%,验证其实用价值。这一架构突破了传统单向、后期融合的限制,为工业大规模推荐系统提供了更强的模型基础。未来,模型将结合多模态信息、多任务学习,推动推荐系统的智能化与个性化发展。

深度分析

研究背景

随着工业推荐系统规模扩大,用户行为序列和异质特征的联合建模成为关键。早期方法如DeepFM、DIN等解决了特征交互问题,但在长序列建模方面仍受限于Transformer的计算复杂度。近年来,LONGER、ETA等模型通过层次化和高效注意力机制提升了长序列建模能力,但仍采用序列压缩后再交互的两阶段设计,限制了模型的表达能力和扩展性。工业场景中,序列长度不断增长,特征空间日益复杂,迫切需要一种统一、深度融合的架构,解决信息早期交互不足、模型扩展性差的问题。

核心问题

现有工业推荐模型多采用序列压缩后再进行特征交互,导致序列信息和特征信息的深度融合受限。序列压缩后,交互多发生在后期,浅层交互难以捕获细粒度依赖,限制模型表现。同时,随着模型规模扩大,参数和计算成本迅速增加,模型的扩展性受到制约。这些问题在长序列和高维特征场景尤为突出,影响推荐效果和系统效率。

核心创新

提出HyFormer架构,核心创新在于引入全局Token机制,将长序列和非序列特征在模型早期实现深度交互。包括:

  • �� Query Decoding:利用多头交叉注意力,将长序列解码为全局Token,增强序列表达;
  • �� Query Boosting:通过MLP-Mixer式Token混合,强化异质特征交互,提升信息流通;
  • �� 多层堆叠:实现双向、逐层深度融合,支持多序列、多模态信息的联合建模。这种设计突破了传统后期融合的限制,提升模型容量和扩展性。

方法详解

  • �� 输入特征:将非序列特征和长行为序列进行Token化,采用语义分组策略。
  • �� Query生成:将非序列特征通过MLP生成全局查询Token,并结合序列池化信息形成全局Token集合。
  • �� 序列编码:采用Transformer编码、LONGER或轻量级前馈,得到层级K/V表示。
  • �� Query Decoding:用多头交叉注意力,将全局查询Token与序列K/V进行解码,获得序列上下文信息。
  • �� Query Boosting:将解码后的查询Token与非序列特征Token结合,通过MLP-Mixer进行Token混合,增强交互。
  • �� 多层堆叠:重复上述步骤,逐层优化表示,最终输出用于CTR预测的特征向量。

实验设计

在亿级工业数据集上,模型采用AUC、CTR提升等指标进行评估。对比LONGER、RankMixer等基线,HyFormer在参数和FLOPs相当条件下,性能提升3-5%。进行参数扩展和不同序列长度的消融,验证模型的扩展性和鲁棒性。在线A/B测试中,CTR提升2.3%,转化率提升1.8%,显著优于现有工业模型。

结果分析

模型在工业场景中实现了优异的性能,超越传统长序列模型和特征交互模型,尤其在长序列和高维特征场景中表现突出。参数扩展后,性能持续提升,验证了良好的扩展性。在线效果显示,CTR和转化率均有显著改善,证明其在实际应用中的价值。

应用场景

可广泛应用于电商、内容推荐、广告投放等场景,支持大规模用户行为分析和个性化推荐。模型可部署在高流量系统中,提升用户体验和商业转化。未来结合多模态信息和多任务学习,推动行业智能推荐升级。

局限与展望

模型在极长序列(如超过数万行为)时仍面临信息稀释和计算瓶颈。全局Token的设计依赖特征质量,可能在复杂场景中受影响。训练和推理成本较高,需优化模型结构和算法以实现更高效部署。未来需探索更轻量化和自适应的序列编码策略。

通俗解读 非专业人士也能看懂

想象你在一个工厂里工作,工厂每天生产各种商品。工厂需要知道每个工人过去做过哪些工作(长长的行为记录),以及工厂的各种规则和材料(特征)。以前的方法就像让工人把所有工作都压缩成一个简单的报告,然后再根据这个报告做决策,但这样会丢失很多细节。HyFormer就像在工厂里安排了一个聪明的助手,它可以同时看工人的全部工作记录和工厂的规则,实时把信息融合在一起,帮助工厂做出更聪明的决定。这个助手不断学习,变得越来越聪明,能更快、更准确地预测工厂的生产需求。它的秘密在于用一种特殊的“全局标签”来连接所有信息,让工人过去的工作和工厂的规则都能互相影响,协同工作。这样,工厂的效率大大提高,生产也更顺畅。这就像一个智能的管理系统,能在复杂的环境中找到最佳方案,帮助工厂不断改进。

原文摘要

Industrial large-scale recommendation models (LRMs) face the challenge of jointly modeling long-range user behavior sequences and heterogeneous non-sequential features under strict efficiency constraints. However, most existing architectures employ a decoupled pipeline: long sequences are first compressed with a query-token based sequence compressor like LONGER, followed by fusion with dense features through token-mixing modules like RankMixer, which thereby limits both the representation capacity and the interaction flexibility. This paper presents HyFormer, a unified hybrid transformer architecture that tightly integrates long-sequence modeling and feature interaction into a single backbone. From the perspective of sequence modeling, we revisit and redesign query tokens in LRMs, and frame the LRM modeling task as an alternating optimization process that integrates two core components: Query Decoding which expands non-sequential features into Global Tokens and performs long sequence decoding over layer-wise key-value representations of long behavioral sequences; and Query Boosting which enhances cross-query and cross-sequence heterogeneous interactions via efficient token mixing. The two complementary mechanisms are performed iteratively to refine semantic representations across layers. Extensive experiments on billion-scale industrial datasets demonstrate that HyFormer consistently outperforms strong LONGER and RankMixer baselines under comparable parameter and FLOPs budgets, while exhibiting superior scaling behavior with increasing parameters and FLOPs. Large-scale online A/B tests in high-traffic production systems further validate its effectiveness, showing significant gains over deployed state-of-the-art models. These results highlight the practicality and scalability of HyFormer as a unified modeling framework for industrial LRMs.

cs.IR