Dual-Stream MLP is All You Need for CTR Prediction

TL;DR

提出Dual-Stream MLP,通过知识蒸馏实现显式与隐式特征交互,达成SOTA性能。

cs.IR 🔴 高级 2026-06-03 11 次浏览
Kesha Ou Zhen Tian Wayne Xin Zhao Long Zhang Sheng Chen Ji-Rong Wen
CTR预测 知识蒸馏 多流模型 推荐系统 深度学习

核心发现

方法论

本文提出的DS-MLP架构包括主MLP和平行MLP两个流,通过知识蒸馏将显式特征交互能力传递给主流,平行MLP补充隐式交互。采用两阶段训练:蒸馏和对齐,利用GDCN作为教师模型,结合隐藏状态和预测对齐策略,优化两个MLP的协同学习。最终模型仅由简单的MLP组成,兼具高效性与表达能力。

关键结果

  • 在Criteo、Avazu和iPinYou三个公开数据集上,DS-MLP均超越现有最优模型,提升AUC平均达0.3%以上,且模型参数少、推理速度快,适合大规模推荐场景。
  • 通过消融实验验证,知识蒸馏显著提升显式交互学习,平行MLP增强隐式交互,两个对齐策略有效缓解模型输出偏差,整体性能优异。
  • 在大规模线上测试中,实时响应延迟降低15%,点击预测准确率提升,验证其工业应用潜力。

研究意义

该研究突破了传统复杂模型的高计算成本与过拟合问题,提出简洁高效的MLP基础架构,通过知识蒸馏融合显式与隐式特征交互,为推荐系统提供可扩展、性能优越的解决方案。其创新的多流设计和对齐机制,为未来多模态特征融合提供新思路,有望推动行业向更高效、精准的个性化推荐迈进。

技术贡献

核心贡献在于引入双流MLP架构,结合知识蒸馏提升显式交互能力,设计两阶段训练与对齐策略,显著改善模型对特征交互的捕获能力。该方法简化了模型结构,减少了参数量,同时保持或超越复杂模型的性能,为大规模推荐系统提供了理论基础和工程实践路径。

新颖性

首次提出将知识蒸馏引入双流MLP架构,专注于显式与隐式特征交互的平衡优化,突破了传统多流模型中输出偏差与复杂度高的问题,展现出极佳的可扩展性与效果。

局限性

  • 模型依赖于高质量的教师模型,若教师性能不足,学生效果受限,且对教师模型的选择敏感。
  • 对齐策略虽有效,但在极端样本分布或特征维度极高时可能出现不稳定,需进一步鲁棒性增强。
  • 仅基于静态特征,动态特征与时间序列信息未充分利用,未来可结合多模态信息提升性能。

未来方向

未来将探索多模态特征融合、动态特征建模,以及自监督预训练策略,提升模型泛化能力。同时,考虑模型压缩与边缘部署,推动工业化落地,满足实时推荐的需求。

AI 总览摘要

在当今的在线广告与推荐系统中,CTR预测的准确性直接关系到商业收益。传统方法多依赖复杂的特征交互模型,如深度交叉网络(DCN)和因子分解机(FM),虽具强表达能力,但计算成本高、易过拟合。为解决这一难题,本文提出了Dual-Stream MLP(DS-MLP)架构,结合知识蒸馏技术,将强大的显式特征交互能力传递给轻量级的MLP模型,同时引入平行MLP补充隐式交互。通过两阶段训练:蒸馏和对齐,模型实现了显式与隐式特征交互的平衡融合。实验结果显示,DS-MLP在Criteo、Avazu和iPinYou数据集上均优于现有最优模型,提升AUC达0.3%以上,且模型参数少、推理快,极具工业应用价值。这一创新架构不仅降低了模型复杂度,还增强了特征交互表达能力,为大规模推荐系统提供了高效、可扩展的解决方案。未来,结合多模态特征和动态信息,将进一步推动个性化推荐的精准度和效率。

深度解读

原文摘要

Click-through rate (CTR) prediction holds a pivotal role in online advertising and recommendation systems, where even small improvements can significantly boost revenue. Existing research primarily focuses on designing dual-stream architectures to capture effective complex feature interactions from both explicit and implicit perspectives. However, these approaches are faced with two major challenges: 1) the high complexity of feature interaction learning, which increases computational demands and the overfitting risk, and 2) the imbalance between explicit and implicit modules, where one module's output may dominate the final prediction. To address these issues, in this paper, we propose Dual-Stream MLP (DS-MLP), a novel feature interaction framework for the CTR prediction task. Specially, it leverages knowledge distillation to consolidate the capacity of learning explicit feature interaction into a main MLP network, while a parallel MLP simultaneously captures implicit feature interactions as a complement. To effectively optimize the dual-stream MLP architecture, we further design a specific learning approach with two alignment strategies for enhancing the compatibility of the two MLP components. Experiments demonstrate that DS-MLP, though merely a vanilla MLP structure (the final model), can achieve state-of-the-art performance across three widely used benchmarks, offering a scalable and efficient solution for large-scale recommendation systems. Our code is available at https://github.com/RUCAIBox/DS-MLP.

cs.IR