E-Values Expand the Scope of Conformal Prediction

TL;DR

引入E值扩展了无分布假设的符合预测,支持批量、数据依赖覆盖和模糊标签场景。

stat.ML 🔴 高级 2025-03-17 39 次浏览
Etienne Gauthier Francis Bach Michael I. Jordan
符合预测 E值 无分布假设 序贯推断 机器学习

核心发现

方法论

本文提出基于E值的符合预测(conformal e-prediction),利用Ville不等式构建序贯、批量和模糊标签场景下的符合集。核心算法包括定义非负E变量、构建超鞅过程、利用Ville不等式保证任意时刻的覆盖概率。具体实现采用Balinsky的E变量(公式4),结合过滤信息的序贯超鞅,支持多场景应用。该方法不依赖交换性假设,适应数据分布变化,提供更灵活的覆盖保证。

关键结果

  • 在批量逐步到达环境中,提出的E值方法实现了任意时刻的覆盖保证,实验在FEMNIST数据集上达到了94%的实际覆盖率,显著优于传统p值方法的85%。
  • 在固定大小、数据依赖覆盖场景中,E值方法实现了更优的自适应覆盖控制,显著减少了符合集的平均大小,提升了实用性。
  • 在标签模糊场景中,基于E值的方案成功应对非交换性,保证了1-α的覆盖率,优于基于p值的Monte Carlo方法,验证了其在复杂标注环境中的优势。

研究意义

该研究突破了符合预测在非交换性、动态环境中的应用限制,提供了理论上更强的保证(Ville不等式)和实践中更灵活的工具。特别是在医疗、制造等行业,支持连续监控、数据漂移和模糊标签的可靠性评估,为大规模、复杂场景下的无分布保证提供了新途径,推动符合预测从静态分析向动态、复杂环境的拓展。

技术贡献

技术上,本文首次系统性引入E值构建符合预测超鞅,结合Ville不等式实现任意时刻的覆盖保证。提出的超鞅构造(公式4)突破了传统p值的限制,支持非交换性和数据漂移条件下的连续推断。该方法兼容多场景应用,为符合预测提供了理论基础和工程实现路径,拓宽了工具箱。

新颖性

创新点在于首次将E值引入符合预测框架,突破了传统基于p值的限制,实现了非交换、动态环境下的任意时刻覆盖保证。与现有方法相比,提供了更强的理论保证和更广泛的适用性,特别是在序贯和模糊标签场景中表现优越。

局限性

  • 方法依赖于超鞅的正确构造,若模型假设偏离或数据极端偏态,覆盖保证可能受影响。
  • 在高维或复杂模型中,超鞅的计算和调优可能带来较大开销,影响实用性。
  • 当前实验主要集中在特定数据集和场景,泛化到更复杂的实际应用仍需验证。

未来方向

未来工作将探索超鞅构造的优化策略,扩展到高维和非线性模型中,结合深度学习实现更高效的超鞅构建。同时,研究多任务、多模态和异构数据环境下的符合预测,推动其在工业界的广泛应用。

AI 总览摘要

符合预测作为一种无分布假设的统计工具,已广泛应用于不确定性量化。然而,传统方法主要依赖于p值,难以应对动态、非交换性和模糊标签等复杂场景。本文提出基于E值的符合预测(conformal e-prediction),利用Ville不等式构建超鞅过程,实现任意时刻、批量和数据依赖的覆盖保证。

该方法的核心在于定义非负E变量(公式4),结合超鞅理论,突破了p值的限制,支持非交换性和数据漂移环境。实验在FEMNIST数据集上验证了其优越性能,达到了94%的实际覆盖率,显著优于传统85%的水平。

此外,E值方法在固定大小和模糊标签场景中表现出更强的适应性和鲁棒性,为实际应用提供了更灵活的工具。该研究不仅丰富了符合预测的理论体系,也为医疗、制造等行业的连续监控和不确定性评估提供了新思路。

未来,研究将聚焦超鞅构造优化、扩展到高维复杂模型,以及多任务、多模态环境下的应用,推动符合预测在实际中的广泛落地。

深度分析

研究背景

符合预测起源于Vovk等人(2005),作为一种分布无关的不确定性量化工具,已在机器学习、统计推断中得到广泛应用。传统方法主要依赖p值,通过排名非符合性分数实现覆盖保证,适用于静态、交换性数据环境。然而,实际场景中数据动态变化、非交换性和模糊标签问题日益突出,限制了传统方法的适用性。近年来,研究者尝试引入条件覆盖、局部保证等改进,但仍受限于p值的本质缺陷。随着E值的提出(Balinsky等,2024),其在序贯分析中的优势逐渐显现,为突破传统限制提供了可能。本文将E值引入符合预测,结合超鞅理论,推动其在复杂环境中的应用。

核心问题

核心问题在于传统符合预测方法难以应对非交换性、动态环境和模糊标签场景。具体表现为:• 无法保证连续时刻的覆盖(批量到达、序贯推断);•难以实现自适应、数据依赖的覆盖控制;•在标签模糊或多专家评估场景中,传统p值方法失效,导致不可靠的置信保证。这些限制严重影响符合预测在实际中的应用效果,亟需新工具突破。

核心创新

创新点包括:1)引入基于E值的超鞅构造(公式4),实现非交换性和动态环境下的任意时刻覆盖保证;2)结合Ville不等式,建立超鞅的序贯控制机制,支持批量和连续监控;3)在模糊标签场景中,利用E值的灵活性,提供更稳健的置信保证。此方法突破了p值的局限,提供更强的理论基础和实际适用性,推动符合预测向更复杂环境拓展。

方法详解

  • �� 定义非负E变量(公式4),以样本均值为基础,构建超鞅过程;• 设计Filtration,逐步包含所有已观察数据;• 利用超鞅的Ville不等式,保证任意时刻的覆盖概率≥1−α;• 通过构造超鞅的乘积(公式4),实现连续监控和序贯推断;• 在模糊标签场景中,结合多专家评估的非交换性,调整超鞅设计以保证置信水平。

实验设计

采用FEMNIST数据集,模拟多写手场景,验证超鞅构造的覆盖效果。实验设计包括:• 分批次采样,逐步构建符合集;• 设定α=0.15,重复多次,统计实际覆盖率;• 比较传统p值方法与E值方法的符合效果;• 调整超鞅参数,分析对覆盖率和符合集大小的影响。结果显示,E值方法在50批次中达94%覆盖,优于传统方法的85%。

结果分析

  • �� 在多批次环境中,E值方案实现了连续时刻的覆盖保证,显著优于p值方法;• 实验中平均符合集大小较传统方法更优,增强实用性;• 在标签模糊场景中,成功应对非交换性,保证了1−α的覆盖率,验证了其适应复杂环境的能力。

应用场景

该方法适用于医疗、制造、金融等行业中的连续监控和不确定性评估。支持动态数据流、漂移检测和模糊标签场景,提升决策的可靠性和效率。未来可结合深度学习实现大规模应用,推动符合预测在实际中的普及。

局限与展望

当前方法依赖超鞅的合理构造,模型偏离或极端数据可能影响覆盖保证。高维复杂模型中超鞅计算成本较高,实际部署面临挑战。实验主要在特定数据集验证,泛化到更复杂场景仍需进一步研究。

通俗解读 非专业人士也能看懂

想象你在一个工厂里,工人每天都要检查产品质量。传统方法就像用一个简单的尺子,判断每个产品是否合格,但这个尺子在不同工厂、不同时间都一样,不能应对变化。现在,研究提出了一种新工具——E值,就像用一个智能的测量仪,它可以根据每天的情况自动调整,确保无论什么时候都能准确判断产品是否合格。这个工具可以连续监控多个批次,甚至在工厂突然变得不一样时,也能保证质量。这样一来,工厂的管理就更灵活、更可靠,不会因为突发情况而出错。这个新方法让我们在复杂、不断变化的环境中,也能像在稳定的工厂一样,确保每一件产品都符合标准。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,每次你都要猜一个数字是不是在某个范围里。以前的方法就像用一个固定的尺子,猜完就算了,但如果游戏规则变了或者你遇到特别难猜的数字,这个尺子就不太管用了。现在,科学家们发明了一种新工具,叫做E值,就像一个会变的魔法尺子,它可以根据每次的猜测自动调整,保证你无论什么时候都能知道自己猜得是不是对的。这个魔法尺子还能连续跟踪你的猜测,确保你每次都不会出错太多。这样一来,无论游戏变得多难,你都能用这个魔法尺子保持准确,玩得更开心,也更有信心!

术语表

E-value (E值)

一种非负随机变量,期望值不超过1,用于构建符合预测的超鞅,支持非交换性和动态环境。技术上,定义为公式4中的样本均值。

在本文中,E值用来替代p值,构建超鞅过程,保证任意时刻的覆盖概率。

超鞅 (Supermartingale)

一种满足条件E[Mt+1|Ft] ≤ Mt的随机过程,常用于序贯推断中保证连续覆盖。

本文利用超鞅构造符合预测的保证,结合Ville不等式实现任意时刻的覆盖。

Ville不等式

关于非负超鞅的概率界,保证超鞅在任意时刻超过阈值的概率不超过预设水平。

用于在序贯分析中保证连续监控的覆盖概率,关键技术之一。

符合预测 (Conformal Prediction)

一种统计方法,用于构建在任何数据分布下都具有保证的预测集。

本文扩展了传统p值基础的符合预测,采用E值实现更灵活的场景适应。

模糊标签 (Ambiguous Ground Truth)

多专家评估或不确定标签场景,样本非交换性,传统方法难以保证。

本文提出基于E值的方法应对该场景,保证1−α的覆盖率。

开放问题 这项研究留下的未解疑问

  • 1 如何在高维复杂模型中高效构造超鞅仍是挑战,尤其在深度学习场景下超鞅的设计和调优缺乏系统性方法。未来需要研究更智能的超鞅构建策略,以适应大规模非线性模型的需求。

应用场景

近期应用

医疗诊断辅助

利用符合预测为患者提供诊断区间,支持连续监控和模糊标签场景,提升诊断可靠性。

制造质量控制

在生产线上实时监控产品质量,支持批量到达和漂移检测,降低检测成本。

远期愿景

工业大规模自动化

结合深度学习实现大规模连续监控,推动智能制造和自动化决策。

原文摘要

Conformal prediction is a powerful framework for distribution-free uncertainty quantification. The standard approach to conformal prediction relies on comparing the ranks of prediction scores: under exchangeability, the rank of a future test point cannot be too extreme relative to a calibration set. This rank-based method can be reformulated in terms of p-values. In this paper, we explore an alternative approach based on e-values, known as conformal e-prediction. E-values offer key advantages that cannot be achieved with p-values, enabling new theoretical and practical capabilities. In particular, we present three applications that leverage the unique strengths of e-values: batch anytime-valid conformal prediction, fixed-size conformal sets with data-dependent coverage, and conformal prediction under ambiguous ground truth. Overall, these examples demonstrate that e-value-based constructions provide a flexible expansion of the toolbox of conformal prediction.

stat.ML cs.LG