LOTTERY: Learning from Reference-Only Samples in Two-Sample Testing under Size Asymmetry

TL;DR

LOTTERY方法利用参考样本在样本不对称的双样本检验中实现高效检测。

stat.ML 🔴 高级 2026-06-07 11 次浏览
Xunye Tian Zhijian Zhou Liuhua Peng Feng Liu
双样本检验 参考样本 不对称 机器学习 统计学

核心发现

方法论

LOTTERY方法通过仅使用丰富的参考样本来学习参考依赖表示,捕捉全局和局部结构,并通过不确定性指导原则自适应加权。理论上,建立了基于置换的I型错误控制,并证明了聚合检验的一致性:当样本量增加时,只要表示集包含至少一个一致表示,检验功效就会收敛到1。

关键结果

  • 在多种基准测试中,LOTTERY方法在保持I型错误控制的同时表现出色,尤其是在样本不对称情况下,其检验功效显著提高。
  • 在合成和实际数据集上的实验表明,LOTTERY方法在极端不对称设置中具有稳定的功效提升。
  • 通过不确定性加权选择机制,LOTTERY方法在有限样本情况下也能保持高效性能。

研究意义

LOTTERY方法在样本不对称的情况下提供了一种有效的双样本检验解决方案,特别适用于实际应用中查询样本极为稀少的场景。它不仅在理论上提供了I型错误控制和检验功效一致性,还在实践中展示了强大的性能。这一方法为机器学习模型的监控和异常检测提供了新的思路。

技术贡献

LOTTERY方法通过参考样本学习多种参考依赖表示,并通过不确定性加权机制进行聚合,避免了传统方法中对查询样本的依赖。这种方法不仅在理论上提供了新的保证,还在工程上开辟了新的可能性,尤其是在数据不对称的情况下。

新颖性

LOTTERY方法首次在双样本检验中引入了仅依赖参考样本的学习框架,突破了传统方法对查询样本的依赖,特别适用于样本不对称的场景。

局限性

  • LOTTERY方法在查询样本极为稀少的情况下可能会受到参考样本选择的影响。
  • 在某些特定的分布偏差下,方法的功效可能会降低。

未来方向

未来的研究可以探索在不同数据分布和应用场景下LOTTERY方法的适用性,并进一步优化不确定性加权机制以提高方法的鲁棒性。

AI 总览摘要

在现代机器学习中,双样本检验是一个核心工具,用于判断两个样本是否来自相同的分布。然而,在样本不对称的情况下,传统方法往往失效。LOTTERY方法通过仅使用丰富的参考样本来学习参考依赖表示,捕捉全局和局部结构,并通过不确定性指导原则自适应加权。实验结果表明,LOTTERY方法在多种基准测试中表现出色,尤其是在样本不对称情况下,其检验功效显著提高。这一方法为机器学习模型的监控和异常检测提供了新的思路,具有重要的学术和实际意义。尽管如此,LOTTERY方法在某些特定的分布偏差下可能会受到限制,未来的研究可以进一步优化不确定性加权机制以提高方法的鲁棒性。

深度分析

研究背景

双样本检验在机器学习中被广泛应用于检测数据集漂移、模型监控等场景。传统方法如最大均值差异(MMD)依赖于核方法,通过比较两个样本的核均值嵌入来判断分布差异。然而,在样本不对称的情况下,这些方法往往失效,因为它们需要对查询样本进行训练和测试分割。

核心问题

在实际应用中,常常会遇到样本不对称的情况:参考样本丰富,而查询样本极为稀少。这种情况下,传统的训练-测试分割方法会导致不稳定的差异性和低功效,无法有效检测分布差异。

核心创新

LOTTERY方法通过仅使用参考样本来学习多种参考依赖表示,避免了对查询样本的依赖。通过不确定性加权机制,LOTTERY方法能够在样本不对称的情况下保持高效性能,突破了传统方法的局限。

方法详解

  • �� 学习参考依赖表示:使用丰富的参考样本学习全局和局部结构。

  • �� 不确定性加权:通过不确定性指导原则自适应加权不同的表示。

  • �� 置换检验:使用置换检验控制I型错误。

实验设计

实验在多种合成和实际数据集上进行,评估LOTTERY方法在样本不对称情况下的性能。基准测试包括不同的分布偏差和样本大小设置,结果表明LOTTERY方法在保持I型错误控制的同时,显著提高了检验功效。

结果分析

LOTTERY方法在多种基准测试中表现出色,尤其是在样本不对称情况下,其检验功效显著提高。通过不确定性加权选择机制,LOTTERY方法在有限样本情况下也能保持高效性能。

应用场景

LOTTERY方法适用于机器学习模型的监控和异常检测,特别是在查询样本极为稀少的场景。它可以帮助识别模型行为的分布偏差,防止因分布漂移或隐私泄露导致的潜在故障。

局限与展望

LOTTERY方法在查询样本极为稀少的情况下可能会受到参考样本选择的影响。在某些特定的分布偏差下,方法的功效可能会降低。未来的研究可以进一步优化不确定性加权机制以提高方法的鲁棒性。

通俗解读 非专业人士也能看懂

想象你在一个大型超市里,超市里有很多种商品(参考样本),而你手里只有几个购物清单(查询样本)。传统的方法需要你用购物清单来训练一个购物策略,但这在清单很少时不太可靠。LOTTERY方法就像是一个聪明的购物助手,它只需观察超市里的商品,就能帮你找到最适合的购物策略,而不需要依赖你的购物清单。这种方法特别适合那些购物清单很少的情况,因为它能充分利用超市里的丰富商品信息来做出最优选择。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你有很多金币(参考样本),但只有几个钻石(查询样本)。传统的方法需要你用钻石来升级装备,但钻石太少了,可能不够用。LOTTERY方法就像是一个游戏外挂,它只需要利用你的金币,就能帮你找到最好的升级策略,而不需要用到钻石。这种方法特别适合那些钻石很少的情况,因为它能充分利用金币来提升你的游戏体验。

术语表

双样本检验 (Two-Sample Testing)

用于判断两个样本是否来自相同分布的方法。

LOTTERY方法用于在样本不对称情况下的双样本检验。

参考依赖表示 (Reference-Dependent Representation)

仅使用参考样本学习的表示,用于捕捉分布的全局和局部结构。

LOTTERY方法通过参考依赖表示来检测分布差异。

不确定性加权 (Uncertainty Weighting)

根据表示的稳定性和灵敏度对其进行加权的方法。

LOTTERY方法使用不确定性加权来提高检验功效。

置换检验 (Permutation Test)

通过随机置换样本来评估统计量显著性的方法。

LOTTERY方法使用置换检验来控制I型错误。

最大均值差异 (Maximum Mean Discrepancy)

一种基于核方法的双样本检验统计量。

LOTTERY方法与传统的MMD方法进行比较。

开放问题 这项研究留下的未解疑问

  • 1 LOTTERY方法在极端不对称情况下的性能边界尚未完全探索。
  • 2 不确定性加权机制在不同数据分布下的适用性需要进一步研究。

应用场景

近期应用

模型监控

LOTTERY方法可用于实时监控机器学习模型的行为,检测分布偏差。

异常检测

在数据流中识别异常事件,特别是在查询样本稀少的情况下。

远期愿景

自动化数据审核

通过LOTTERY方法实现对大规模数据集的自动化审核,确保数据质量和一致性。

原文摘要

Data-adaptive two-sample testing assesses if two samples come from the same distribution, using a discrepancy learned from the data (e.g., via kernel-based feature representations). Such methods typically rely on data splitting to decouple learning from testing and control type I error. However, this paradigm is ill-suited to few-shot settings with severe sample-size imbalance: abundant reference samples are available, while only a handful of query samples arrive. In this paper, we show how this imbalance can be leveraged constructively. Using abundant reference data, we learn reference-dependent representations that summarize salient structure of the reference distribution and provide informative signals for detecting departures. We incorporate a collection of representation families that capture both global and local structure, and adaptively weight them using only reference samples via an uncertainty-guided principle. Theoretically, we establish permutation-based type I error control and show consistency of the aggregated test: as the sample sizes grow, the test power converges to one whenever the representation set contains at least one consistent representation. Empirically, our aggregation achieves strong performance across a range of benchmarks while retaining type I error control.

stat.ML cs.LG