Choosing Online Experiment Designs under Interference in Ads, Recommendations, and Member-Experience Systems

TL;DR

该研究提出了一种干扰感知实验设计框架,选择在广告、推荐系统中的实验设计,Criteo广告上风险1.295。

stat.ML 🔴 高级 2026-05-25 4 次浏览
Prashant Shekhar Caroline Howard
实验设计 广告系统 推荐系统 干扰机制 鲁棒性

核心发现

方法论

本文提出了一种基于机制鲁棒设计决策的实验设计框架,考虑了六种可实施设计,通过最坏情况规划风险进行比较。风险因素包括暴露偏差、分配单元方差、最小可检测效应、污染或延续、操作成本和估计量不匹配。使用Wasserstein距离来量化设计偏差,并在Lipschitz暴露响应下提供几何保证。

关键结果

  • 在Criteo广告数据集上,选择用户随机化设计,维度无量纲鲁棒风险为1.295。
  • 在Open Bandit bts/men数据集上,选择切换设计,风险为2.105。
  • 在KuaiRand数据集上,选择集群随机化设计,风险为2.240。

研究意义

该研究为广告、推荐和会员体验系统中的在线实验设计提供了新的视角,特别是在干扰机制不确定的情况下。通过考虑多种可能的干扰机制,研究提出了一种能够在不确定性中做出鲁棒设计选择的方法。这一方法对于提高实验设计的准确性和可靠性具有重要意义,尤其是在现代复杂系统中。

技术贡献

本文的技术贡献在于提出了一种新的实验设计选择框架,能够在干扰机制不确定的情况下进行鲁棒选择。通过引入Wasserstein距离来量化设计偏差,并提供了在Lipschitz暴露响应下的几何保证。此外,提出的选择器算法能够在有限的设计目录中进行精确恢复和过度风险控制。

新颖性

该研究首次将干扰机制的不确定性纳入实验设计选择问题中,提出了基于Wasserstein距离的几何方法来量化设计偏差。与现有工作相比,该方法能够在多种干扰机制下提供鲁棒的设计选择。

局限性

  • 该方法在需要大量历史数据和产品知识来构建不确定性集时可能受到限制。
  • 在某些情况下,设计选择可能依赖于特定的风险权重设置。

未来方向

未来工作可以探索如何在更大规模的设计目录中应用该框架,以及如何在实际应用中更好地估计不确定性集。

AI 总览摘要

在广告、推荐和会员体验系统中,在线实验设计通常在干扰机制尚不明确时进行规划。现有方法在干扰机制不确定的情况下,难以选择合适的实验设计。本文提出了一种基于机制鲁棒设计决策的实验设计框架,考虑了六种可实施设计,通过最坏情况规划风险进行比较。风险因素包括暴露偏差、分配单元方差、最小可检测效应、污染或延续、操作成本和估计量不匹配。使用Wasserstein距离来量化设计偏差,并在Lipschitz暴露响应下提供几何保证。实验结果表明,该选择器在不同的数据集上给出了不同的设计建议。在Criteo广告数据集上,选择用户随机化设计,维度无量纲鲁棒风险为1.295;在Open Bandit bts/men数据集上,选择切换设计,风险为2.105;在KuaiRand数据集上,选择集群随机化设计,风险为2.240。该研究为广告、推荐和会员体验系统中的在线实验设计提供了新的视角,特别是在干扰机制不确定的情况下。通过考虑多种可能的干扰机制,研究提出了一种能够在不确定性中做出鲁棒设计选择的方法。这一方法对于提高实验设计的准确性和可靠性具有重要意义,尤其是在现代复杂系统中。未来工作可以探索如何在更大规模的设计目录中应用该框架,以及如何在实际应用中更好地估计不确定性集。

深度分析

研究背景

在广告、推荐和会员体验系统中,在线实验设计是产品和机器学习决策的核心。然而,现代系统中干扰机制的复杂性使得实验设计变得困难。现有方法通常假设干扰机制已知,但在实际应用中,干扰机制往往是不确定的。

核心问题

核心问题在于如何在干扰机制不确定的情况下选择合适的实验设计。干扰机制可能通过预算、库存、生产者曝光、图形溢出或时间延续传播,使得随机化设计本身成为统计决策。

核心创新

本文的核心创新在于提出了一种基于机制鲁棒设计决策的实验设计框架。通过考虑多种可能的干扰机制,研究提出了一种能够在不确定性中做出鲁棒设计选择的方法。

方法详解

  • �� 提出了一种新的实验设计选择框架,能够在干扰机制不确定的情况下进行鲁棒选择。
  • �� 引入Wasserstein距离来量化设计偏差,并提供了在Lipschitz暴露响应下的几何保证。
  • �� 提出的选择器算法能够在有限的设计目录中进行精确恢复和过度风险控制。

实验设计

实验设计使用了Criteo、Open Bandit和KuaiRand等公共数据集。选择器在这些数据集上进行测试,评估不同设计在不同干扰机制下的表现。

结果分析

实验结果表明,选择器在不同的数据集上给出了不同的设计建议。在Criteo广告数据集上,选择用户随机化设计,维度无量纲鲁棒风险为1.295;在Open Bandit bts/men数据集上,选择切换设计,风险为2.105;在KuaiRand数据集上,选择集群随机化设计,风险为2.240。

应用场景

该框架可直接应用于广告、推荐和会员体验系统中的在线实验设计,特别是在干扰机制不确定的情况下。

局限与展望

该方法在需要大量历史数据和产品知识来构建不确定性集时可能受到限制。在某些情况下,设计选择可能依赖于特定的风险权重设置。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,你需要选择一种方法来烹饪,但你不知道食材的具体特性。本文的方法就像是提供了一套不同的烹饪方法,每种方法都有其优缺点。你需要根据食材的可能特性来选择最合适的方法。通过这种方式,即使你不知道食材的具体特性,你也能做出美味的菜肴。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你需要选择一个角色来完成任务,但你不知道敌人的具体特点。本文的方法就像是提供了一套不同的角色,每个角色都有其优缺点。你需要根据敌人的可能特点来选择最合适的角色。通过这种方式,即使你不知道敌人的具体特点,你也能成功完成任务。

术语表

Wasserstein距离

一种用于度量两个概率分布之间差异的距离,常用于量化设计偏差。

用于量化设计偏差,确保设计与启动暴露分布的接近性。

Lipschitz暴露响应

一种假设,描述了暴露响应的变化速率,确保设计偏差的几何保证。

用于提供设计偏差的几何保证。

暴露偏差

由于设计选择导致的暴露分布与目标暴露分布之间的差异。

作为规划风险的一个组成部分。

分配单元方差

用于衡量实验设计中分配单元的方差,影响实验的检测能力。

用于评估实验设计的检测能力。

最小可检测效应

实验设计中能够检测到的最小效应大小,影响实验的灵敏度。

用于评估实验设计的灵敏度。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模的设计目录中应用该框架?
  • 2 如何在实际应用中更好地估计不确定性集?

应用场景

近期应用

广告系统优化

广告商可以使用该框架在不确定的干扰机制下优化广告投放策略,提高广告效果。

远期愿景

推荐系统改进

推荐系统可以利用该框架在不确定的干扰机制下优化推荐算法,提高用户体验。

原文摘要

Online experiments in ads, recommendation, and member-experience systems are often planned before the dominant interference mechanism is known. A treatment may propagate through budgets, inventory, producer exposure, graph spillovers, or temporal carryover, making the randomization design itself a statistical decision. We formulate this problem as robust design selection over uncertain exposure mechanisms. Given a finite catalog of six implementable designs, the selector compares each design by worst-case planning risk over an ambiguity set. The risk combines exposure bias, assignment-unit variance, minimum detectable effect, contamination or carryover, operational cost, and estimand mismatch. For theoretical justification, the paper develops a geometry-aware guarantee, stating that design bias is bounded by Wasserstein distance to the launch exposure distribution, and this penalty is minimax tight under Lipschitz exposure response. We also prove finite-catalog approximation and a robust selector theorem with excess-risk control, exact recovery under separation, and certified shortlists when the risk surface is flat. Empirically, the same selector gives different recommendations across samples from public datasets. It selects user-randomization on Criteo ads with dimensionless robust risk 1.295, switchbacks on Open Bandit-bts/men with risk 2.105, and cluster-randomization on KuaiRand with risk 2.240. The Open Bandit case stresses known but uneven logging support, with propensities from 0.00006 to 0.594 and a 5.17% IPS effective-sample share. Overall, the paper contributes an interference-aware experiment design framework based on mechanism-robust design decisions, where the output is either a justified design choice or an uncertainty shortlist.

stat.ML cs.LG