Building a User Foundation Model for the Open Web

TL;DR

提出一种用户基础模型,通过自监督学习提升开放网络的点击率预测,CTR提高2.13%。

cs.LG 🔴 高级 2026-07-30 3 次浏览
Solal Vernier Ivan Can Arisoy Merwan Barlier Blaž Škrlj
用户基础模型 自监督学习 开放网络 实时竞价 CTR预测

核心发现

方法论

该研究提出了一种用户基础模型,利用自监督学习方法对用户浏览历史进行预训练。模型使用Transformer编码器,结合掩码语言模型和序列级对比目标进行预训练,然后在点击预测任务上进行微调。通过优化编码器的预训练流程,模型在生产环境中展示了显著的性能提升。

关键结果

  • 在生产竞价赢率模型中,编码器表示提高了1.197%的RIG,在CTR排序器中提高了1.354%的RIG。
  • 7天的在线A/B测试显示CTR提高了2.13%,eCPC降低了1.13%。
  • 在无历史数据的情况下,模型在离线测试中提高了0.99%的RIG。

研究意义

该研究在开放网络环境下展示了用户基础模型的可行性,解决了用户身份分散和历史数据缺乏的问题。通过自监督学习,模型能够在缺乏连续用户历史的情况下,仍然提供有效的用户表示,提升了广告推荐系统的性能。

技术贡献

技术贡献包括在工业环境中应用LLM优化编码器预训练流程,以及在开放网络环境中首次展示了用户基础模型的有效性。模型在无历史数据和有历史数据的情况下均表现出色,证明了其泛化能力。

新颖性

该研究首次在开放网络环境中应用用户基础模型,通过自监督学习解决了用户身份分散的问题,与现有方法相比,提供了新的解决方案。

局限性

  • 模型在用户历史数据极其稀疏的情况下,性能可能受到影响。
  • 需要在不同的网络环境中进行更多的验证。

未来方向

未来工作可以探索更复杂的用户行为建模,以及在不同的广告平台上验证模型的泛化能力。

AI 总览摘要

在开放网络的实时竞价环境中,用户身份通常是分散且不持久的,这给广告推荐系统带来了挑战。现有的方法依赖于稳定的用户身份和连续的历史数据,而这在开放网络中并不适用。

为了解决这个问题,研究者们提出了一种用户基础模型,通过自监督学习对用户的浏览历史进行预训练。该模型使用Transformer编码器,结合掩码语言模型和序列级对比目标进行预训练,然后在点击预测任务上进行微调。

实验结果显示,该模型在生产环境中显著提高了CTR和降低了eCPC,证明了其在开放网络环境中的有效性。这一研究为广告推荐系统在数据稀缺的环境中提供了新的解决方案。

深度分析

研究背景

随着互联网的发展,广告推荐系统在电子商务和社交平台中取得了显著的成功。然而,这些系统通常依赖于稳定的用户身份和丰富的历史数据。在开放网络的实时竞价环境中,用户身份分散且不持久,历史数据的缺乏使得传统方法难以适用。

核心问题

开放网络环境中,用户身份分散且不持久,历史数据缺乏,导致广告推荐系统难以有效地进行用户建模和个性化推荐。这一问题的解决对于提高广告投放的精准性和用户体验至关重要。

核心创新

研究提出了一种用户基础模型,通过自监督学习对用户浏览历史进行预训练。该模型利用Transformer编码器,结合掩码语言模型和序列级对比目标进行预训练,然后在点击预测任务上进行微调。与现有方法相比,该模型能够在缺乏连续用户历史的情况下,仍然提供有效的用户表示。

方法详解

  • �� 使用Transformer编码器进行用户浏览历史的预训练。
  • �� 结合掩码语言模型和序列级对比目标进行预训练。
  • �� 在点击预测任务上进行微调。
  • �� 使用LLM优化编码器的预训练流程。

实验设计

实验在开放网络的实时竞价环境中进行,使用了多种数据集进行验证。模型在生产竞价赢率模型和CTR排序器中均表现出色,并通过7天的在线A/B测试验证了其有效性。

结果分析

模型在生产竞价赢率模型中提高了1.197%的RIG,在CTR排序器中提高了1.354%的RIG。在线A/B测试显示CTR提高了2.13%,eCPC降低了1.13%。

应用场景

该模型可用于广告推荐系统,特别是在用户身份分散且历史数据缺乏的开放网络环境中。它能够提高广告的精准投放和用户体验。

局限与展望

模型在用户历史数据极其稀疏的情况下,性能可能受到影响。此外,需要在不同的网络环境中进行更多的验证,以确保模型的泛化能力。

通俗解读 非专业人士也能看懂

想象你在一个图书馆里,图书馆员需要根据你的借阅历史来推荐新书。但问题是,你每次来都用不同的身份,图书馆员无法追踪你的完整历史。我们的模型就像一个聪明的图书馆员,能够从你每次借书的记录中学习,即使你用不同的身份,也能给你推荐你喜欢的书。

简单解释 像给14岁少年讲一样

想象一下,你在玩一个游戏,每次你都用不同的角色进入游戏。游戏需要根据你的游戏风格来推荐装备。我们的模型就像一个超级聪明的AI助手,能够从你每次的游戏记录中学习,即使你用不同的角色,也能给你推荐最适合的装备!

术语表

用户基础模型

一种通过自监督学习对用户行为进行建模的方法。

用于在开放网络环境中进行用户建模。

自监督学习

一种机器学习方法,利用未标注数据进行模型训练。

用于对用户浏览历史进行预训练。

Transformer编码器

一种用于处理序列数据的深度学习模型。

用于对用户浏览历史进行编码。

掩码语言模型

一种通过掩盖部分输入数据进行训练的语言模型。

用于预训练用户基础模型。

序列级对比目标

一种通过对比不同序列表示进行训练的目标。

用于增强模型的序列表示能力。

开放问题 这项研究留下的未解疑问

  • 1 如何在极其稀疏的用户历史数据下提高模型性能?
  • 2 如何在不同的网络环境中验证模型的泛化能力?

应用场景

近期应用

广告推荐系统

可用于提高广告的精准投放和用户体验,尤其在开放网络环境中。

远期愿景

跨平台用户建模

实现跨平台的用户行为建模,提高个性化推荐的准确性。

原文摘要

User foundation models have demonstrated strong results in e-commerce and social recommendation, but most industrial deployments assume environments where user identity is stable and persistent. Open-web real-time bidding (RTB) operates on a structurally different data distribution: user identity is fragmented and non-persistent across browsing sessions, and the availability of browsing history depends on user privacy choices. Consequently, a significant portion of traffic carries no historical data, and available records often consist of relatively short, disjointed sessions. As a result, historical signals in this domain are typically represented as aggregated counters and recency buckets, leaving the sequential structure unexploited. To address this limitation, we present a user foundation model that applies self-supervised learning on user browsing histories and show that the learned representation improves multiple downstream production tasks, demonstrating the viability of this approach on the open web. We pre-train a Transformer encoder with masked language modeling and a sequence-level contrastive objective, then fine-tune it on the click prediction task. We optimize the encoder's pre-training pipeline with an LLM-in-the-loop search over a curated catalog of reviewable, code-level edits (lifters), instantiating the LLM-as-optimizer paradigm in an industrial setting. The same encoder representation yields +1.197% RIG on the production bid win-rate model and +1.354% RIG on the production CTR ranker; a 7-day live A/B test confirms +2.13% CTR, -1.13% eCPC (80% CI excluding zero on both metrics).

cs.LG