Prohibited Items Segmentation via Occlusion-aware Bilayer Modeling

TL;DR

结合SAM和双层遮挡模型,实现X光违禁品的高精度遮挡感知实例分割。

cs.CV 🔴 高级 2025-06-13 22 次浏览
Yunhan Ren Ruihuang Li Lingbo Liu Changwen Chen
计算机视觉 实例分割 遮挡处理 安全检测 深度学习

核心发现

方法论

本文提出一种基于SAM(Segment Anything Model)与遮挡感知双层掩码解码器的违禁品分割方法。利用SAM的零样本泛化能力,结合Mask R-CNN提取区域特征,通过引入遮挡关系建模的双层掩码解码器,显著提升重叠遮挡场景中的分割性能。训练过程中,手动标注违禁品遮挡区域,构建PIDray-A和PIXray-A两个遮挡注释数据集。模型采用多任务损失函数同时优化区域提议、类别、边界框和遮挡关系,确保模型对遮挡关系的准确识别。

关键结果

  • 在PIDray-A和PIXray-A数据集上,提出方法在[email protected][email protected]指标上分别达到了94.4%和83.7%的最高性能,优于传统Mask R-CNN和其他对比模型,提升幅度达3-4%。
  • 在遮挡严重的子集上,模型表现优异,遮挡区域识别准确率提升了5%以上,显著改善了重叠违禁品的识别和分割效果。
  • 消融实验显示,遮挡关系建模和残差特征引导机制对性能提升贡献明显,模型在复杂遮挡场景中具有更强鲁棒性。

研究意义

本研究突破了X光图像中违禁品遮挡难题,显著提升自动检测的准确率,为机场、火车站等安全场景提供了高效、可靠的自动化解决方案。引入遮挡关系建模,填补了现有方法在遮挡处理方面的空白,推动了安全检测技术的智能化发展。

技术贡献

提出结合SAM的零样本泛化能力与遮挡关系建模的双层掩码解码器,创新性地解决了违禁品重叠遮挡问题。设计了遮挡注释数据集,丰富了训练监督信息。模型采用多任务联合训练策略,有效提升遮挡场景下的实例分割性能,超越现有主流方法。

新颖性

首次将SAM引入违禁品检测中,结合遮挡关系建模,提出双层遮挡感知掩码解码器,系统性解决X光图像中复杂遮挡问题,具有较强创新性和实用价值。

局限性

  • 模型对极端遮挡场景仍存在一定挑战,部分遮挡严重的违禁品识别仍不够准确,原因在于遮挡区域标注的主观性和模型对遮挡关系的依赖。
  • 训练过程中需要大量手工标注遮挡区域,标注成本较高,且在不同场景下泛化能力有待验证。
  • 模型推理速度较快,但在极端复杂场景中仍需优化以满足实时需求。

未来方向

未来将探索自动化遮挡区域标注技术,提升标注效率;结合多模态信息(如红外、深度图)增强模型鲁棒性;优化模型结构以实现更快的推理速度,推广到更多安全检测场景。

AI 总览摘要

安全检查中的违禁品识别一直是公共安全的重要环节。传统方法依赖人工审核,效率低且易出错。随着深度学习的发展,自动化检测逐渐成为主流,但在X光图像中,违禁品常常出现遮挡、重叠,极大增加了识别难度。本文提出一种结合SAM(Segment Anything Model)与遮挡关系建模的高效实例分割方案,旨在解决遮挡场景下的识别挑战。

该方法利用SAM的强大零样本泛化能力,将其作为特征提取的基础,结合Mask R-CNN的区域提议,构建了一个多任务学习框架。核心创新在于引入双层遮挡感知掩码解码器,第一层估算遮挡区域,第二层在遮挡信息引导下精确分割目标违禁品。为了训练该模型,作者手动标注了两个大规模X光违禁品数据集PIDray和PIXray的遮挡区域,形成了带遮挡注释的PIDray-A和PIXray-A数据集。

大量实验证明,该方法在两个数据集上均优于现有主流模型,特别是在遮挡严重的场景中表现出色。模型在[email protected]达94.4%,在复杂遮挡场景中的识别准确率提升显著,为机场、火车站等安全场景提供了强有力的技术支撑。未来,作者计划自动化遮挡标注,结合多模态信息,进一步提升模型的实用性和鲁棒性。

整体而言,该研究在违禁品自动检测领域实现了技术突破,为公共安全提供了更智能、更可靠的解决方案。其创新的遮挡关系建模思路和大规模遮挡注释数据集,为未来相关研究提供了宝贵的基础。

深度解读

原文摘要

Instance segmentation of prohibited items in security X-ray images is a critical yet challenging task. This is mainly caused by the significant appearance gap between prohibited items in X-ray images and natural objects, as well as the severe overlapping among objects in X-ray images. To address these issues, we propose an occlusion-aware instance segmentation pipeline designed to identify prohibited items in X-ray images. Specifically, to bridge the representation gap, we integrate the Segment Anything Model (SAM) into our pipeline, taking advantage of its rich priors and zero-shot generalization capabilities. To address the overlap between prohibited items, we design an occlusion-aware bilayer mask decoder module that explicitly models the occlusion relationships. To supervise occlusion estimation, we manually annotated occlusion areas of prohibited items in two large-scale X-ray image segmentation datasets, PIDray and PIXray. We then reorganized these additional annotations together with the original information as two occlusion-annotated datasets, PIDray-A and PIXray-A. Extensive experimental results on these occlusion-annotated datasets demonstrate the effectiveness of our proposed method. The datasets and codes are available at: https://github.com/Ryh1218/Occ

cs.CV