Impression Share Prediction: An Offline Evaluation Task for Ranking Systems

TL;DR

提出离线评价新任务——印象份额预测,利用观察数据实现模型在不同目标桶中的印象分布预测,提升离线评估的前瞻性。

cs.IR 🔴 高级 2026-08-18 83 次浏览
Mohsen Malmir Houssam Nassif Danish Nasir Shaikh Taher Rahgooy Murat Ali Bayir
离线评价 排序系统 因果模型 反事实预测 拍卖动态

核心发现

方法论

本文提出基于结构因果模型的离线印象份额预测框架,通过分析模型预测与交付容量的关系,识别反事实效果。利用观察数据中的模型置信信号和系统状态,训练随机森林和编码器条件模型,预测候选模型在未上线状态下的印象分布。该方法无需逆概率加权或平衡表示,直接从观测数据中识别因果效应。实验中,随机森林在已见模型上将L1误差降低49%,在未见模型的前一小时内,编码器模型通过模拟拍卖动态实现22%的误差改善。

关键结果

  • 在训练模型的已见数据上,随机森林模型将L1误差从基线的值降低了49%,显著提升预测精度,验证了模型在分布内的有效性。
  • 对于未见模型,尤其是在首次上线的前一小时,随机森林表现略低于基线,反映系统容量状态仍受先前模型影响。引入编码器模型后,模拟两小时拍卖动态,误差提升22%,有效缓解了初期的预测偏差。
  • 多模型家族数据验证显示,该方法在不同模型架构和系统状态下均表现出较强的鲁棒性,尤其在模型刚上线时的预测误差明显减小,展现出良好的实际应用潜力。

研究意义

该研究填补了离线评价中无法提前识别印象份额偏移的空白,为模型上线前提供了重要的行为洞察。通过结构因果模型,系统性地理解模型预测、交付容量与印象分配的关系,有助于优化广告投放、内容推荐等场景中的模型选择与调优,减少上线后因份额偏移带来的潜在损失。这一方法的提出,为离线评估的科学性和前瞻性提供了新的思路,推动了推荐系统、广告系统等领域的理论与实践发展。

技术贡献

本文的核心技术贡献在于提出基于结构因果模型的印象份额反事实预测框架,突破了传统离线指标只衡量预测准确性的限制。通过明确模型预测与系统容量的关系,识别出因果效应,避免了逆概率加权等复杂操作。结合早期交互信号和系统状态,设计了随机森林和编码器条件模型,有效提升了未见模型的预测性能。实验验证显示,该方法在多模型家族中实现了显著的误差降低,为离线评估提供了可操作的工具,具有广泛的适用性和扩展潜力。

新颖性

本研究的创新点在于首次将结构因果模型引入离线印象份额预测任务,明确模型预测、交付容量与印象分配的因果关系,识别反事实效果。不同于传统的离线指标仅关注预测准确性,本文关注模型在系统中的实际行为表现,特别是在模型刚上线的关键时刻。引入模拟拍卖动态的编码器架构,突破了单一快照预测的局限,有效缓解了未见模型的预测偏差。这些创新为离线评估提供了全新的理论基础和实践路径。

局限性

  • 该方法依赖于观察数据中的系统状态和模型信心信号,若数据采集不完整或存在偏差,可能影响预测效果。
  • 在模型刚上线的前一小时,系统容量状态尚未充分反映新模型的影响,导致预测偏差较大,尽管引入模拟动态有所改善。
  • 模型训练和预测过程需要大量历史数据和计算资源,实际部署中可能面临效率和规模的挑战。

未来方向

未来工作将集中在扩展模型的动态预测能力,结合贝叶斯或序列模型实现多步滚动预测,缓解误差累积问题。同时,探索更丰富的系统特征和多模态信号,提高未见模型的预测准确性。此外,将该框架应用于多目标优化、多系统环境中,验证其泛化能力和实用性,推动离线评估方法的理论完善和行业落地。

AI 总览摘要

在推荐系统和广告投放领域,模型上线前的离线评估一直是关键环节。传统指标如预测准确率,虽然在衡量模型能力方面具有一定价值,但无法反映模型在实际系统中的行为变化,尤其是印象份额的偏移。模型可能在离线指标上表现优异,却在上线后导致目标桶分布的偏移,从而影响整体的业务效果。为解决这一难题,本文提出了印象份额预测(Impression Share Prediction)作为一种新的离线评估任务,旨在提前预测候选模型在系统中的印象分布情况。

该方法基于结构因果模型,明确模型预测、交付容量与印象分配之间的因果关系,从观察数据中识别反事实效果。通过分析模型置信信号和系统状态,训练随机森林和编码器条件模型,能够在模型未上线时,准确预测其未来的印象份额分布。实验结果显示,在已见模型上,随机森林模型将L1误差降低了49%,验证了其高效性。而在未见模型的首次上线前一小时,预测误差较大,反映系统容量状态尚未充分反映新模型的影响。引入模拟拍卖动态的编码器架构,模拟两小时的系统演化,显著改善了预测偏差,提升了22%的误差表现。

这项工作不仅丰富了离线评价的理论体系,也为实际应用提供了强有力的工具。通过提前识别潜在的印象份额偏移,企业可以在模型正式上线前进行优化调整,降低风险,提升整体业务效益。未来,研究将继续探索多步动态预测、系统特征丰富化以及多系统环境的适应性,推动离线评估技术的持续发展和行业应用落地。

深度分析

研究背景

推荐系统和广告投放的核心目标是最大化用户体验与商业价值。传统的离线评价指标如AUC、GAUC、信息增益等,主要衡量模型在已知数据上的预测准确性。然而,这些指标未能反映模型在实际系统中的行为变化,尤其是模型上线后对不同目标桶(如点击、观看、转化)的印象份额分布。近年来,随着系统复杂度的提升,研究者开始关注模型在系统中的实际影响,包括印象偏移、容量调度和拍卖机制。已有工作如逆向概率加权(IPW)和偏见校正,试图减少偏差,但仍难以提前预测模型上线后的份额偏移。本文的创新在于引入结构因果模型,从系统的因果关系出发,识别模型预测与容量状态对印象分配的影响,为离线评估提供了新的理论基础。

核心问题

核心问题在于如何在模型未上线前,准确预测其在实际系统中的印象份额分布。传统离线指标无法捕捉模型引入后系统容量和拍卖机制的变化,导致上线后出现预期外的份额偏移,影响业务目标。现有方法多依赖于模型预测的准确性,忽视了系统交互和容量调度的复杂性。特别是在模型刚上线的前一小时,系统容量状态尚未被新模型充分反映,预测偏差较大。这一问题的解决对于提前识别潜在风险、优化模型策略具有重要意义,但因系统的复杂性和反事实性质,难以实现有效预测。

核心创新

本研究的创新点在于提出基于结构因果模型的印象份额反事实预测框架,明确模型预测、交付容量与印象分配的因果关系,避免了传统方法中对偏差校正的依赖。引入模拟拍卖动态的编码器架构,结合早期交互信号,有效缓解未见模型在初期的预测偏差。这一方法不仅提供了更准确的预测工具,还丰富了因果推断在推荐系统中的应用场景,为未来系统级优化提供理论支撑。与以往仅关注预测准确性的离线指标不同,本文强调模型行为的系统性理解,推动离线评估向更具前瞻性和系统性的方向发展。

方法详解

  • �� 观察系统状态:收集历史A/B测试中的每小时印象份额、模型置信信号和系统容量状态。
  • �� 构建因果模型:定义模型状态(预测分布)、印象份额和容量状态的时间变化关系,利用结构因果图(DAG)描述因果路径。
  • �� 识别反事实效果:证明在无后门路径条件下,模型预测对印象份额的因果效应可以从观察数据中识别,无需逆向概率加权。
  • �� 特征设计:提取模型置信信号(如置信直方图、均值、方差)和系统容量(如剩余容量、消费容量、调节系数)作为输入特征。
  • �� 模型训练:使用随机森林(RF)和编码器条件模型(Transformer)对特征进行训练,预测未来24小时内的印象份额。
  • �� 预估与验证:在已见模型和未见模型上进行验证,比较预测误差和系统实际表现,分析不同时间段的预测效果。

实验设计

  • �� 数据集:从真实广告平台的A/B测试中采集150个候选模型的每小时快照,覆盖约五周时间,包含1.8百万样本。
  • �� 训练与测试:按时间划分,训练集包含前五周,测试集包括后续两周,区分已见和未见模型。
  • �� 评估指标:主要使用L1距离衡量预测误差,次要指标为斯皮尔曼秩相关系数。
  • �� 模型对比:比较随机森林和编码器条件模型在不同模型类别和系统状态下的表现,分析特征贡献。
  • �� 关键超参数:随机森林采用100棵树,编码器采用2层Transformer,训练采用KL散度损失和AdamW优化。
  • �� Ablation研究:逐步剔除特征组,验证模型性能变化,确认模型置信信号和系统状态的贡献。

结果分析

  • �� 在已见模型上,随机森林模型将L1误差降低了49%,显著优于基线,验证了在分布内的预测能力。
  • �� 在未见模型的首次上线前一小时,随机森林表现略低于基线,反映系统容量尚未充分反映新模型的影响。引入模拟动态的编码器模型后,误差在0-1小时内改善22%,有效缓解了初期偏差。
  • �� 长期来看,编码器模型在多小时和多天后,逐步追赶甚至超越随机森林,显示出其在动态系统中的优势。整体而言,模型在不同时间段和模型类别中表现出较强的鲁棒性,验证了其广泛适用性。

应用场景

  • �� 广告平台:提前预测广告模型上线后在不同目标桶中的印象分布,帮助优化投放策略,降低风险。
  • �� 内容推荐:在内容排序系统中,预测不同内容类别的曝光份额,提升用户体验和商业转化。
  • �� 资源调度:在多目标、多系统环境中,提前识别潜在偏移,优化系统容量和调度策略。
  • �� 业务决策:为产品经理提供模型上线前的行为洞察,辅助决策制定。

局限与展望

  • �� 依赖观察数据的完整性和准确性,若数据偏差或缺失,可能影响预测效果。
  • �� 在模型刚上线的前一小时,系统容量状态尚未充分反映新模型的影响,导致预测偏差较大。
  • �� 计算成本较高,特别是在大规模系统中,模型训练和动态模拟需要大量资源。未来需优化模型效率和特征提取方法。

通俗解读 非专业人士也能看懂

想象你在管理一个大型工厂,这个工厂每天生产不同类型的商品,比如电子产品、衣服和食品。每个商品类别代表一个目标桶。工厂的生产能力有限,工厂经理会根据订单和市场需求调整生产计划。现在,你想提前知道,如果你引入一个新生产线(相当于新模型),它会在不同类别中生产出多少商品。传统的方法就像只看过去的订单数据,估算新生产线的表现,但不能提前知道它会偏向哪个类别。

这篇研究就像是给你一套智能助手,它可以根据工厂的当前状态(剩余资源、已有订单)和新生产线的设计(模型预测信号),模拟未来几小时甚至几天的生产情况。这个助手用了一种叫结构因果模型的方法,理解不同因素之间的关系,比如新生产线的设计会影响哪个类别的商品产量,以及资源的消耗情况。

通过这些模拟,你可以在正式启用新生产线之前,提前知道它会偏向哪个类别,避免生产过多或过少某一类商品。这就像提前做了个“预演”,帮助你优化资源分配和生产计划,减少风险,提升效率。这种方法不仅可以应用在工厂管理,还能用在广告投放、内容推荐等各种需要提前预测系统行为的场景中。它让我们在“开工”之前,就能洞察未来的表现,从而做出更明智的决策。

简单解释 像给14岁少年讲一样

想象你在学校里组织一个新俱乐部,你想知道这个俱乐部会吸引到多少学生参加,以及他们会喜欢做什么。可是,你还没有正式开始招人,只是听说一些学生对这个俱乐部感兴趣。你想提前知道,如果你开始宣传,多少学生会加入,大家会更喜欢参加哪些活动。传统的方法就像是问问几个学生的意见,然后猜猜大概会有多少人加入,但不能很准确地预测。

这篇研究就像是有个聪明的机器人助手,它可以根据你目前的准备情况(比如你已经发出的宣传、学生们的兴趣程度)模拟未来几天的情况。这个机器人用了一种叫因果模型的方法,理解你做的宣传和学生兴趣之间的关系,还会考虑学校的整体情况(比如学校的活动多不多、天气好不好)。

通过这些模拟,你可以提前知道,如果你开始宣传,可能会吸引到多少学生,哪些活动会更受欢迎。这样你就可以提前调整策略,比如多宣传某个活动,少宣传另一个,确保大家都满意。这就像提前做了个“预演”,帮你避免宣传不够或者太多,浪费资源,也让你的俱乐部更成功。这种方法不仅适合学校,还可以用在广告、推荐内容等地方,帮助企业和平台提前了解模型上线后会发生什么,避免出现意料之外的问题。它让我们在行动之前,就能看到未来的样子,做出更聪明的决定。

术语表

结构因果模型 (Structural Causal Model)

一种描述系统中变量之间因果关系的数学模型,帮助识别反事实效果。

用来分析模型预测、容量和印象分配的因果关系。

反事实 (Counterfactual)

在未发生实际事件的情况下,推测如果条件不同会产生什么样的结果。

用于预测新模型上线后系统中的印象份额。

印象份额 (Impression Share)

在广告或推荐系统中,某一目标类别获得的曝光比例。

衡量模型在不同目标桶中的分布情况。

系统容量 (Delivery Capacity)

系统在一定时间内能处理的最大曝光量或资源。

影响印象分配和模型行为。

随机森林 (Random Forest)

一种集成学习算法,通过多棵决策树投票进行预测。

用于预测模型在不同目标桶中的印象份额。

编码器-条件模型 (Encoder-Conditioned Model)

结合时间序列动态信息和模型状态的深度学习模型。

模拟拍卖动态,改善未见模型的预测效果。

拍卖动态 (Auction Dynamics)

描述广告或内容拍卖中出价、竞价和分配的系统演变过程。

用于模拟系统未来的印象份额变化。

L1误差 (L1 Error)

预测值与真实值差的绝对值之和,用于衡量模型预测的准确性。

作为评估印象份额预测的主要指标。

斯皮尔曼秩相关 (Spearman Rank Correlation)

衡量两个变量秩次一致性的非参数指标。

评估预测的目标桶排序一致性。

系统性偏移 (Systematic Shift)

模型上线后目标分布的偏离,可能影响业务效果。

需要提前预测以规避风险。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端系统状态下保持预测的鲁棒性,尤其是在新模型上线初期,仍需深入研究。
  • 2 降低模型复杂度和计算成本,提升实际应用中的效率,是未来的关键方向。
  • 3 多目标、多系统环境中的联合优化策略尚未成熟,未来需探索多目标协调机制。
  • 4 反事实因果模型在复杂系统中的验证和稳健性提升,是未来研究的重要方向。
  • 5 模型迁移和跨平台适应性不足,如何实现不同场景的快速迁移,是行业内的难点。

应用场景

近期应用

广告投放优化

提前预测广告模型上线后在不同目标类别中的曝光比例,帮助广告平台调整预算和出价策略,降低风险,提升ROI。

内容推荐系统

在内容排序前,预测不同内容类别的曝光份额,优化内容分发策略,提升用户满意度和平台收益。

系统容量调度

在多目标、多系统环境中,提前识别潜在偏移,合理调配系统资源,确保关键目标的达成。

远期愿景

智能系统调控

构建全自动化的系统调控框架,通过持续预测和调整,实现系统行为的最优平衡。

行业标准制定

推动印象份额预测成为行业内的标准评估工具,为不同平台和系统提供统一的评价指标和优化方案。

原文摘要

Offline evaluation is a major gateway before online evaluation of ranking models in A/B testing. Standard offline metrics measure predictive accuracy, but are only a surrogate for downstream utility: a model can improve them while redistributing impressions across objective buckets in ways that degrade downstream utility. No offline method surfaces these impression share shifts before online evaluation. We propose \emph{impression share prediction} as an offline evaluation task: given a candidate ranking model, predict the distribution of impressions it would produce across objective buckets - impressions grouped by optimization goal (e.g., click, video view). The task is inherently counterfactual, since the candidate has never served live traffic. We propose a structural causal model of how model predictions and delivery capacity jointly determine impression allocation, and show the counterfactual effect is identified from observational data. Building on this, we develop a statistical learning framework that predicts impression shares from a candidate's early-interaction confidence signals and current system state, trained on historical data. On data from multiple ranking model families, a Random Forest reduces L1 error by 49\% over a constant baseline for models seen during training. For held-out models, evaluated by time since first appearance, the first hour is the closest analog to true online evaluation and the hardest: the Random Forest falls below the baseline because the capacity state still reflects the prior model. An encoder-conditioned architecture that simulates a 2-hour rollout over recent auction dynamics recovers $+$22\% L1 in this regime.

cs.IR

参考文献 (20)

Batch learning from logged bandit feedback through counterfactual risk minimization

Adith Swaminathan, T. Joachims

2015 403 引用

Interference Among First-Price Pacing Equilibria: A Bias and Variance Analysis

Luofeng Liao, Christian Kroer, Sergei Leonenkov 等

2024 7 引用 查看解读 →

Causality

Giri Narasimhan

2019 3895 引用

Widespread Flaws in Offline Evaluation of Recommender Systems

Balázs Hidasi, Ádám Tibor Czapp

2023 42 引用 查看解读 →

Distributional Offline Policy Evaluation with Predictive Error Guarantees

Runzhe Wu, Masatoshi Uehara, Wen Sun

2023 23 引用 查看解读 →

A Time Series is Worth 64 Words: Long-term Forecasting with Transformers

Yuqi Nie, Nam H. Nguyen, Phanwadee Sinthong 等

2022 4297 引用 查看解读 →

Unbiased offline evaluation of contextual-bandit-based news article recommendation algorithms

Lihong Li, Wei Chu, John Langford 等

2010 623 引用 查看解读 →

An Empirical Study of Selection Bias in Pinterest Ads Retrieval

Yuan Wang, Peifeng Yin, Zhiqiang Tao 等

2023 9 引用

Logarithmic Smoothing for Pessimistic Off-Policy Evaluation, Selection and Learning

Otmane Sakhi, Imad Aouali, Pierre Alquier 等

2024 19 引用 查看解读 →

Doubly Robust Estimation for Correcting Position Bias in Click Feedback for Unbiased Learning to Rank

Harrie Oosterhuis

2022 50 引用 查看解读 →

A Probabilistic Position Bias Model for Short-Video Recommendation Feeds

Olivier Jeunen

2023 21 引用 查看解读 →

A Field Guide for Pacing Budget and ROS Constraints

S. Balseiro, Kshipra Bhawalkar, Zhe Feng 等

2023 13 引用 查看解读 →

Algorithm Adaptation Bias in Recommendation System Online Experiments

Chen Zheng, Zhenyu Zhao

2025 1 引用 查看解读 →

Statistical Inference and A/B Testing for First-Price Pacing Equilibria

Luofeng Liao, Christian Kroer

2023 12 引用 查看解读 →

Counterfactual Evaluation of Ads Ranking Models through Domain Adaptation

Mohamed A. Radwan, Himaghna Bhattacharjee, Quinn Lanners 等

2024 6 引用 查看解读 →

Learning in Repeated Auctions with Budgets: Regret Minimization and Equilibrium

2017 248 引用

Wide & Deep Learning for Recommender Systems

Heng-Tze Cheng, L. Koc, Jeremiah Harmsen 等

2016 4258 引用 查看解读 →

Pacing Equilibrium in First-Price Auction Markets

Vincent Conitzer, Christian Kroer, D. Panigrahi 等

2018 110 引用 查看解读 →

Doubly Robust Policy Evaluation and Learning

Miroslav Dudík, John Langford, Lihong Li

2011 833 引用 查看解读 →

Estimation of Subsidiary Performance Metrics under Optimal Policies

Zhaoqi Li, Houssam Nassif, Alex Luedtke

2024 6 引用 查看解读 →