Localized Conformal Prediction for Image Classification with Vision-Language Models

TL;DR

提出局部一致性预测(LCP)结合视觉-语言模型,利用非线性变换提升图像分类中的预测集效率。

cs.CV 🔴 高级 2026-06-30 39 次浏览
Clément Fuchs Tim Bary Benoît Macq
不确定性量化 一致性预测 视觉-语言模型 局部方法 图像分类

核心发现

方法论

本文基于最近提出的局部一致性预测算法,结合CLIP等视觉-语言模型的特征表示,采用余弦相似度作为局部权重指标。通过引入非线性sigmoid变换,调节相似度的影响力,确保边际覆盖保证的同时显著缩小预测集。具体流程包括:• 计算校准集的预测分数和特征相似度;• 设计非线性变换函数,调优超参数;• 利用加权的经验分布构建预测集。实验中,采用九个公开图像分类数据集,评估不同的conformal scores(如LAC、APS、RAPS)以及不同视觉编码器(ViT、ResNet)。

关键结果

  • 引入非线性变换后,平均预测集大小在所有数据集上均优于非局部基线,最大缩减达15%。在UCF101数据集,使用ViT-B/16模型,平均集大小从4.80缩小到3.44,统计显著(p<0.01)。在EuroSAT上,RAPS的集大小由1.65降至1.29,提升显著。多项指标显示,改进主要体现在集大小的减少,而覆盖率保持在目标水平(≥90%),验证了方法的有效性。
  • 结果表明,简单的余弦相似度不足以提升局部预测性能,非线性变换显著改善了预测集效率。不同模型和数据集的实验一致性验证了该策略的普适性。虽然CovGap指标变化不大,但MCCC指标在某些场景下得到改善,表明局部化方法在控制类条件覆盖方面具有潜力。
  • 整体来看,本文提出的非线性变换策略有效平衡了预测集大小和覆盖保证,为视觉-语言模型在不确定性估计中的应用提供了新的技术路径。

研究意义

该研究突破了视觉-语言模型在图像分类中的不确定性量化瓶颈,通过局部一致性预测显著缩小预测集,提升了模型的实用性和可靠性。其方法兼容多种模型架构和数据集,具有广泛的推广潜力。推动了基于深度特征的局部不确定性估计技术的发展,为自动驾驶、医疗影像等安全关键领域提供了理论基础和技术支持。未来,结合多模态信息和自监督学习,有望进一步提升预测的准确性和鲁棒性,满足复杂场景下的高可靠性需求。

技术贡献

本文首次将局部一致性预测算法应用于图像分类任务,结合CLIP等视觉-语言模型的特征空间,提出了非线性余弦相似度变换策略,有效改善预测集效率。通过理论分析保证边际覆盖,实证验证其在九个公开数据集上的优越表现。该方法拓展了CP框架的适用范围,为多模态深度学习中的不确定性估计提供了新工具。创新点在于:• 引入sigmoid变换调节局部权重;• 结合多种conformal scores实现多角度评估;• 系统性比较不同模型和数据集,验证策略的普适性。

新颖性

本研究首次将非线性变换引入局部一致性预测,解决了余弦相似度在分类任务中的局限性。相较于传统的线性相似度加权,提出的sigmoid变换在保持边际覆盖的同时,有效缩小预测集,提升效率。这在视觉-语言模型结合不确定性估计中尚属首次,填补了该领域的研究空白。创新之处在于:• 提出非线性相似度调节机制;• 在多数据集上系统验证;• 兼容多种conformal scores和模型架构。

局限性

  • 该方法依赖于特征空间的良好表示,若模型特征提取效果差,性能会受到影响,且调参过程较复杂,需交叉验证超参数m和τ。
  • 在极端类别不平衡或特征噪声较大的场景中,局部加权可能失效,导致预测集大小未能显著缩小。
  • 算法计算复杂度较高,尤其是在大规模数据集上,特征相似度计算和超参数调优耗时较长,限制了实时应用潜力。

未来方向

未来将探索多模态特征融合,提升特征空间的表达能力;同时,结合自监督学习策略,增强模型的鲁棒性。还计划优化算法效率,降低计算成本,适应大规模工业场景。此外,研究如何结合主动学习和动态调节机制,实现更智能的预测集调整,将是下一步的重要方向。

AI 总览摘要

在深度学习快速发展的背景下,图像分类模型虽取得卓越性能,但在不确定性估计方面仍面临挑战。传统的conformal prediction(CP)方法提供边际覆盖保证,但难以满足不同子群的条件覆盖需求,导致实际应用中存在偏差。为解决这一问题,本文引入局部一致性预测(LCP)策略,结合视觉-语言模型(如CLIP)特征,通过加权局部样本实现更精细的预测集调节。

具体而言,作者发现单纯使用余弦相似度作为局部权重不足以提升效率,提出了非线性sigmoid变换,有效调节相似度的影响力,确保边际覆盖的同时显著缩小预测集。通过在九个公开图像分类数据集上的系统实验,结果显示该方法在多种conformal scores(如LAC、APS、RAPS)和不同模型(ViT、ResNet)中均实现了集大小的显著降低,最大缩减达15%,且覆盖率保持在目标水平。

这些发现表明,结合非线性变换的局部加权策略,能有效平衡预测效率与不确定性保证,为视觉-语言模型在实际场景中的应用提供了新思路。未来,结合多模态信息和自监督学习,有望进一步提升模型的鲁棒性和适应性,推动自动驾驶、医疗影像等关键领域的发展。尽管算法在大规模场景下仍面临计算成本挑战,但其理论基础和实证效果已为行业应用奠定了坚实基础。

深度分析

研究背景

随着深度学习在视觉任务中的突破,模型性能不断提升,但在安全关键应用中,单纯的点预测不足以保障系统可靠性。传统的置信区间和预测集方法,如蒙特卡洛采样和贝叶斯方法,存在计算复杂、泛化能力有限的问题。近年来,Conformal Prediction(CP)作为一种提供严格边际覆盖保证的统计工具,逐渐受到关注。代表性工作包括Vovk等人的基础理论、Lei等人的自适应预测集,以及Angelopoulos等人提出的多样化不确定性集。尽管如此,CP在实际应用中仍面临条件覆盖不足、局部偏差等挑战。特别是在高维图像特征空间中,如何实现更细粒度的局部不确定性估计,成为研究热点。

核心问题

现有CP方法多关注全局边际覆盖,难以满足不同类别或子群的条件覆盖需求,导致在实际场景中出现偏差。尤其是在图像分类任务中,特征空间的复杂性和多样性使得全局方法难以捕捉局部分布差异。传统的基于余弦相似度的局部加权策略,虽然直观,但在实际应用中未能显著提升预测效率,反而可能引入噪声,增加预测集大小。如何设计一种既能保证边际覆盖,又能有效利用深度特征的局部信息,成为亟待解决的问题。

核心创新

本文的核心创新在于:• 引入非线性sigmoid变换调节余弦相似度,增强局部样本的区分能力,改善预测集效率;• 将该变换应用于多种conformal scores(LAC、APS、RAPS),验证其普适性;• 利用交叉验证调优超参数m和τ,确保变换效果最优。此策略突破了传统线性加权的局限,为深度特征空间中的局部不确定性估计提供了新思路。创新点还在于:• 系统性在九个公开数据集上验证方法的有效性;• 提出理论保证,确保边际覆盖不受影响。

方法详解

  • �� 计算校准集的预测分数和深度特征;• 设计sigmoid变换函数,将余弦相似度映射到[0,1]区间,调节其影响力;• 通过交叉验证优化超参数m(控制变换陡峭度)和τ(设定中点);• 利用变换后的相似度作为局部权重,构建加权的经验分布;• 计算预测集边界,确保覆盖保证。整个流程确保在保持边际覆盖的同时,利用局部信息优化预测集大小。

实验设计

采用九个公开图像分类数据集(如UCF101、EuroSAT、Pets),校准集均为随机采样1000张图像。对比多种conformal scores(LAC、APS、RAPS)和不同模型(ViT、ResNet)。超参数通过五折交叉验证调优,指标包括平均预测集大小和条件覆盖率。实验还包括不同变换参数的敏感性分析和与非局部基线的对比,验证方法的普适性和有效性。

结果分析

引入非线性变换后,所有数据集上的平均预测集大小均优于非局部基线,最大缩减达15%。在UCF101数据集,ViT-B/16模型的集大小由4.80降至3.44,差异具有统计显著性(p<0.01)。EuroSAT中,RAPS的集大小由1.65降至1.29,提升明显。不同模型和数据集的结果显示,该策略能在保证覆盖率的前提下,有效缩小预测集,验证了其实用性和普适性。

应用场景

该方法适用于需要高可靠性和不确定性估计的场景,如自动驾驶中的目标检测、医疗影像中的诊断辅助,以及工业检测中的异常识别。利用深度特征和局部加权,可以实现更精细的风险控制和决策支持。未来,结合多模态信息和自监督技术,有望在复杂环境下实现更鲁棒的预测,推动行业智能化升级。

局限与展望

该策略依赖于深度特征的质量,若模型特征提取效果差,性能会受影响。此外,超参数调优过程复杂,计算成本较高,限制了实时应用。极端类别不平衡或噪声较大时,局部加权可能失效,导致预测集未能有效缩小。未来需优化算法效率,提升鲁棒性,适应大规模工业场景。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,每次做菜都需要用到不同的调料。传统的方法就像把所有调料都平均放在锅里,结果有时候味道太重,有时候太淡。现在,你用一种聪明的办法,根据每次的菜肴特点,调整调料的用量。比如,辣味重的菜就多放辣椒,清淡的菜就少放。这样做出来的菜,不仅味道更合适,还能节省调料。类似的,机器学习中的预测也是一样,传统方法用一种固定的方式衡量所有样本,效果不佳。本文提出用一种非线性变换,像调料的调整一样,让模型根据不同样本的特征,动态调整预测的“范围”。这样,预测结果既可靠,又不冗长,能更好地满足实际需求。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,每次遇到不同的关卡,你都想知道自己能不能顺利通过。以前的游戏规则就像是:只要你有一定的能力,就能过关,但没有考虑不同关卡的难度差异。有时候你遇到特别难的关卡,还是能过,但有时候简单关卡你却过不了。现在,新的规则会根据每个关卡的特点,给你一个更准确的判断:如果这个关卡很难,它会给你一个更大的安全区,让你知道自己有把握;如果很简单,它会缩小安全区,让你更有挑战性。这就像论文里的方法,用一种聪明的数学方式,动态调整预测的范围,让模型既可靠又高效。这样,你在游戏中就能更有信心,也能节省时间,玩得更开心!

原文摘要

Conformal predictions have attracted significant attention in the field of uncertainty quantification, mainly because of their strong marginal coverage guarantees. Full conditional guarantee is not an attainable goal, a well known fact in conformal predictions literature. As a result, several approaches have tried to approximate this behavior by adapting the conformal sets of test-time samples according to their similarity to calibration examples. Although the latter has gained traction and shown impressive performances for regression problems, its application to image classification remains under-explored. We conduct an extensive benchmarking on natural image classification tasks with vision-language models (VLMs), using our open source implementation of a recent localized conformal prediction algorithm. We show that straightforward usage of the cosine similarity between test-time and calibration visual features, an intuitive choice for VLMs, is not sufficient to improve over the non-local baselines. In response, we propose a simple non-linear transformation of the cosine similarities, which conserves marginal coverage guarantees and achieves statistically significant mean set sizes reduction. Code is available at https://github.com/cfuchs2023/lcp-vlm/.

cs.CV cs.LG