Cross-Model Agreement as a Deployment-Time Reliability Signal for Automatic Polyp Segmentation

TL;DR

提出RBQE框架,通过主模型与独立训练的裁判模型的分割一致性评估息肉分割可靠性,ROC-AUC高达0.960。

cs.CV 🔴 高级 2026-09-10 91 次浏览
Siddharth Gupta Jitin Singla
分割质量评估 深度学习 息肉分割 模型一致性 无参考评估

核心发现

方法论

RBQE框架通过主分割模型与独立训练的裁判模型在相同图像上的一致性来评估分割可靠性。裁判模型独立于主模型训练,测试了四种配置:相同架构独立训练、跨架构独立训练(SegFormer-B0和UNet++)、以及基于提示的MedSAM模型。

关键结果

  • 结果1:SegFormer-B0裁判模型的ROC-AUC达到0.960,显著优于相同架构裁判模型(0.923)和基于测试时增强的基线(提升0.055)。
  • 结果2:在排除空掩码的情况下,SegFormer-B0的ROC-AUC为0.876,仍优于其他基线,并进一步扩大了性能差距。
  • 结果3:RBQE逐步拒绝低一致性预测时,提高了保留预测的平均Dice分数,表明其支持选择性预测。

研究意义

RBQE为自动化息肉分割提供了一种实用且可解释的可靠性评估方法,解决了推理时缺乏标注的痛点。其方法无需重新训练,适用于各种分割模型,具有广泛的临床应用潜力。

技术贡献

RBQE首次系统性验证了跨架构、独立训练的模型一致性作为分割可靠性信号的有效性,并提出了五种一致性描述符(如Agreement Dice、Boundary Agreement),显著提升了无参考质量估计的性能。

新颖性

RBQE创新性地将跨架构模型一致性引入分割质量评估,区别于传统的单模型不确定性或同架构集成方法,提供了更强的泛化能力和解释性。

局限性

  • 局限1:对空掩码的处理可能导致部分情况下的过度简化,影响实际应用中的表现。
  • 局限2:裁判模型的选择对结果影响较大,可能需要针对不同任务调整。
  • 局限3:未在更大规模或多样化的真实世界数据集上验证。

未来方向

未来研究可探索更复杂的裁判模型配置、在更广泛的医学影像任务中验证RBQE的适用性,以及结合其他无参考评估技术以进一步提升性能。

AI 总览摘要

结直肠癌是全球第二大癌症相关死亡原因,早期检测和切除息肉对提高患者生存率至关重要。然而,现有的自动化息肉分割模型在推理过程中可能出现无声失败,缺乏可靠的质量评估机制。

为解决这一问题,作者提出了基于裁判的一致性质量评估(RBQE)框架。该方法通过比较主分割模型与独立训练的裁判模型在同一图像上的分割一致性,来估计分割的可靠性。研究中测试了四种裁判模型配置,结果表明,跨架构、独立训练的裁判模型(如SegFormer-B0)提供了最强的可靠性信号,ROC-AUC达到0.960,显著优于测试时增强等基线方法。

RBQE框架无需额外的标注数据或模型修改,仅需一个裁判模型的推理过程即可实现部署。其方法简单、实用且具有解释性,为自动化息肉分割提供了新的可靠性评估工具。未来研究可进一步优化裁判模型设计,并扩展至其他医学影像分割任务。

深度分析

研究背景

结直肠癌是全球范围内发病率第三高的癌症,早期检测和治疗息肉是降低死亡率的关键。尽管深度学习显著提高了息肉分割的精度,但在实际应用中,分割模型在光照不足、运动模糊等复杂条件下容易失败,且推理时无法获得标注,缺乏可靠的质量评估机制。

核心问题

自动化息肉分割模型在推理时可能出现无声失败,现有的无参考分割质量评估方法依赖单一模型的内部信号或同架构模型的集成,容易受到校准误差和架构偏差的影响,难以在真实场景中提供可靠的质量信号。

核心创新

RBQE框架通过主模型与独立训练的裁判模型的分割一致性来评估分割可靠性。其创新点包括:1)首次系统性验证跨架构模型一致性作为可靠性信号的有效性;2)提出五种一致性描述符,全面量化分割一致性;3)无需额外标注或模型修改,部署简单。

方法详解

  • �� 主模型和裁判模型分别对同一图像进行分割,生成二值掩码。
  • �� 通过五种一致性描述符(如Agreement Dice、Boundary Agreement)量化掩码间的一致性。
  • �� 根据一致性得分估计分割的可靠性。
  • �� 测试了四种裁判配置:相同架构独立训练、跨架构独立训练(SegFormer-B0和UNet++)、以及基于提示的MedSAM模型。

实验设计

实验使用四个公开息肉分割数据集(CVC-ClinicDB、CVC-ColonDB、ETIS-Larib PolypDB、CVC-300)进行外部验证,总计1,223张图像。采用ROC-AUC作为主要评估指标,并与测试时增强等基线方法进行对比,分析裁判模型配置对RBQE性能的影响。

结果分析

实验表明,SegFormer-B0裁判模型的ROC-AUC达到0.960,显著优于相同架构裁判(0.923)和测试时增强基线(提升0.055)。在排除空掩码的情况下,SegFormer-B0的ROC-AUC为0.876,仍优于其他基线,且性能差距进一步扩大。

应用场景

RBQE可用于实时结肠镜检查中自动化息肉分割的质量评估,为医生提供可靠的诊断支持。此外,其无参考的特性使其适用于其他医学影像分割任务。

局限与展望

RBQE对裁判模型的选择较为敏感,可能需要针对不同任务进行优化。此外,框架尚未在更大规模或多样化的真实世界数据集上验证,未来研究可进一步扩展其适用性。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。主分割模型就像一个厨师,他根据食材(图像)做出一道菜(分割结果)。但有时厨师可能会出错,比如忘记加盐。这时,我们请来另一位独立的厨师(裁判模型),让他也做一道同样的菜。然后,我们比较两道菜是否相似。如果两位厨师做出的菜很相似,我们就认为这道菜是可靠的;如果差别很大,说明可能有问题。RBQE就是通过这种方式评估分割结果的可靠性。

简单解释 像给14岁少年讲一样

想象你和朋友玩游戏,画地图。你画完后,让朋友也画一张。如果两张地图很像,说明你们都画对了;如果差别很大,可能你们都画错了。RBQE就是用类似的方法来检查电脑画的医学图像对不对!它会让医生更放心地用电脑帮忙看病。是不是很酷?

术语表

RBQE (基于裁判的质量评估)

一种通过模型间分割一致性评估分割可靠性的方法。

用于无参考的息肉分割质量评估。

Agreement Dice (一致性Dice系数)

衡量两个分割掩码区域重叠程度的指标,值越高表示一致性越强。

用于量化主模型与裁判模型的分割一致性。

SegFormer-B0

一种基于Transformer的轻量级语义分割模型,具有较强的分割能力。

作为跨架构裁判模型评估RBQE性能。

MedSAM

一种基于提示的医学分割模型,源自Segment Anything框架。

用于评估提示耦合对RBQE性能的影响。

Test-Time Augmentation (测试时增强)

通过对输入图像进行多种变换生成多个预测结果的方法。

作为RBQE的对比基线方法。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模的多样化数据集上验证RBQE的性能?
  • 2 是否可以通过改进裁判模型设计进一步提升RBQE的可靠性?

应用场景

近期应用

实时结肠镜检查

为医生提供自动化息肉分割的可靠性评估,支持临床诊断。

其他医学图像分割

适用于无标注的分割任务,如肿瘤检测或器官分割。

远期愿景

通用医学影像质量评估

开发适用于多种医学影像任务的通用无参考质量评估框架。

原文摘要

In real-time colonoscopy, ground-truth annotations are unavailable at inference, so polyp segmentation models can fail silently. We propose Referee-Based Quality Estimation (RBQE), a reference-free framework measuring agreement between a primary segmentation model and an independently trained referee on the same image. RBQE is evaluated on a standardized 1,223-image external benchmark drawn from four public datasets, using four referee configurations chosen to separate two design axes: referee independence and architectural diversity. Using a common Agreement Dice descriptor, a same-architecture referee differing from the primary model only in random initialization already yields a useful reliability signal (ROC-AUC = 0.923), showing that independent training alone is sufficient. Cross-architecture referees improve further: SegFormer-B0 achieves the strongest performance (ROC-AUC = 0.960), significantly outperforming the same-architecture control and UNet++, and exceeding a representative Test-Time Augmentation baseline by 0.055 ROC-AUC under an identical protocol, whereas a prompt-coupled MedSAM referee underperforms despite maximal architectural diversity. Because empty-mask agreement is trivially separable, we also report a restricted evaluation excluding such cases: ROC-AUC falls to 0.876 (SegFormer-B0, 1,046 images) and 0.783 (same-architecture control, 975 images), yet RBQE's margin over both baselines widens on this identical subset. RBQE additionally increases the mean Dice of retained predictions as low-agreement cases are progressively rejected, supporting selective prediction, and requires only one additional deterministic referee forward pass at inference. Our study therefore supports cross-model agreement as a practical, interpretable reliability framework for automated polyp segmentation.

cs.CV cs.LG