Detecting Backdoors in Object Detection via Pre-NMS Prediction Distribution Shift

TL;DR

提出DistScan,通过预NMS预测分布偏移检测目标检测模型中的后门,准确率达97.22%。

cs.CV 🔴 高级 2026-08-20 99 次浏览
Longtian Wang Zhengyu Zhao Chenhao Lin Le Yang Shiwei Wang Yuhan Zhi Xiaofei Xie Chao Shen
目标检测 后门攻击 分布偏移 安全检测 深度学习

核心发现

方法论

本研究提出一种基于预NMS预测类别分布偏移的后门检测方法DistScan。该方法利用模型在干净样本上的中间预测结果,统计其类别分布,并与训练数据的类别频率进行比较,采用Jensen-Shannon散度作为偏移度量。具体流程包括:首先根据模型架构(单阶段或两阶段)构建验证集,确保输入分布一致;其次提取模型预NMS阶段的类别预测,过滤低置信度预测,统计类别频次;最后与训练类别分布进行归一化对比,计算偏移值,若超出阈值则判定模型为后门模型。该方法无需访问模型权重、无需触发器知识,也不依赖模型架构特定假设,具有良好的泛化能力。

关键结果

  • 在MS-COCO和PASCAL VOC数据集上,使用YOLOv5和Faster R-CNN两种架构,检测三种场景级攻击(对象误分类、对象消失、对象插入),平均检测准确率达96.99%,比最优基线提升27.32个百分点。特别是在场景级攻击中,DistScan表现出极强的鲁棒性和泛化能力,显著优于现有方法如ODSCAN和MIA。
  • 在多场景、多模型、多数据集的实验中,DistScan在检测准确率和AUROC指标上均优于对比方法,尤其在复杂场景和大类别数(COCO)中,保持高检测性能,验证了其广泛适用性。
  • 通过消融实验验证了验证集构建策略和偏移阈值对检测效果的影响,确保方法在不同模型和数据分布下的稳定性。

研究意义

本研究突破了目标检测后门检测的瓶颈,提出无需触发器知识、模型权重访问和架构假设的检测新思路,极大增强了实际应用中的安全性。该方法不仅适用于场景级攻击,也为未来目标检测模型的安全防护提供了理论基础和技术方案,有望推动自动驾驶、安防监控等安全关键领域的模型审查技术发展。

技术贡献

本研究的核心技术创新在于发现预NMS预测类别分布偏移作为后门信号,提出基于分布偏移的检测框架DistScan。区别于传统触发器逆向或架构依赖的方法,DistScan利用模型在干净样本上的中间预测分布,结合统计距离(JS散度)实现无模型权重访问的后门识别。该方法适用于单、双阶段检测器,兼容多场景、多类别,具有理论上的偏移稳定性保证,为目标检测安全提供了新工具。

新颖性

本研究首次提出利用预NMS预测类别分布偏移作为后门检测信号,突破了以往仅依赖触发器逆向或架构特定假设的限制。该方法的创新在于:1)发现模型中间预测分布的偏移是后门存在的普遍标志;2)设计了无需触发器信息、模型权重的检测流程;3)验证其在多模型、多场景、多类别中的有效性,显著优于现有方法。

局限性

  • 在类别数较多(如COCO)或类别相似度高的场景中,检测准确率略有下降,可能受到类别混淆影响。
  • 方法依赖于训练类别频率的准确统计,若训练数据存在严重偏差或不完整,可能影响检测效果。
  • 对极端复杂场景或极少样本的检测效果尚未充分验证,未来需结合多模态信息提升鲁棒性。

未来方向

未来研究将探索多模态信息融合以增强检测鲁棒性,结合模型内部特征进行多层次分析,提升对复杂场景和少样本环境的适应能力。同时,计划开发实时检测工具,推动其在实际安全系统中的部署应用,增强目标检测模型的安全防护能力。

AI 总览摘要

目标检测技术在自动驾驶、安防监控等安全关键领域扮演着核心角色。然而,随着模型在实际应用中的广泛部署,后门攻击的威胁也日益凸显。攻击者通过在训练数据中植入后门触发器,使模型在特定条件下表现异常,严重威胁系统安全。传统检测方法多依赖触发器逆向或架构特定假设,难以应对场景级攻击和未知触发器,存在泛化不足的问题。

本文提出一种新颖的检测框架DistScan,基于模型预NMS预测类别分布偏移的观察,利用统计距离(Jensen-Shannon散度)识别后门模型。该方法的核心思想是:正常模型的预NMS类别分布应与训练数据的类别频率一致,而后门模型在干净样本上也表现出偏移。这一偏移在没有触发器的情况下依然存在,成为检测的可靠信号。

具体实现中,DistScan首先根据模型架构(单阶段或两阶段)构建验证集,确保输入分布一致。然后,从模型中提取预NMS阶段的类别预测,过滤低置信度预测,统计类别频次,归一化后与训练类别频率进行偏移度量。若偏移超过预设阈值,即判定模型为后门模型。该方法无需访问模型权重、无需触发器知识,具有良好的泛化能力。

在MS-COCO和PASCAL VOC数据集上,使用YOLOv5和Faster R-CNN两种架构,检测三种场景级攻击(对象误分类、对象消失、对象插入),平均检测准确率达96.99%,比最优基线提升27.32个百分点。实验结果显示,DistScan在复杂场景和多类别环境中表现出优越的鲁棒性和广泛适用性,为目标检测模型的安全审查提供了强有力的技术支持。这一创新方法不仅提升了检测效率,也为未来目标检测安全研究开辟了新方向。

深度分析

研究背景

目标检测技术经过多年的发展,已成为自动驾驶、安防监控、医疗影像等领域的基础工具。早期方法如R-CNN系列(R-CNN、Fast R-CNN、Faster R-CNN)通过区域建议和分类实现目标检测,取得了显著性能提升。近年来,一阶段检测器如YOLO系列(YOLOv3、YOLOv4、YOLOv5)通过端到端训练实现实时检测,极大推动了工业应用的普及。与此同时,目标检测模型面临的安全威胁也逐渐显现,后门攻击成为研究热点。攻击者通过数据污染植入隐藏触发器,使模型在特定条件下表现异常,严重威胁系统安全。现有防御方法包括触发器逆向、行为分析等,但多依赖触发器信息或模型内部访问,难以应对场景级攻击和未知触发器。随着攻击手段的不断演进,研究者亟需一种无需触发器知识、具有良好泛化能力的检测方法。

核心问题

目标检测模型在实际部署中面临后门攻击的威胁,攻击者通过在训练数据中植入触发器,使模型在特定场景下表现异常,如误判、消失或插入目标。这些攻击具有隐蔽性强、泛化能力高、难以检测的特点。传统检测方法多依赖触发器逆向或模型内部信息,存在泛化差、易被规避的问题。如何在不依赖触发器信息和模型内部结构的情况下,有效识别后门模型,成为当前的核心难题。特别是在场景级攻击中,攻击影响范围广、表现多样,进一步增加了检测难度。解决这一问题,不仅关系到模型安全,也关系到自动驾驶、安防等行业的应用安全性。

核心创新

本研究的核心创新在于:1)发现预NMS预测类别分布偏移是后门模型的普遍标志,突破了传统依赖触发器的限制;2)提出基于统计距离(JS散度)的检测框架DistScan,简洁高效,适用多模型、多场景;3)设计了针对不同架构的验证集构建策略,确保偏移检测的鲁棒性。该方法无需模型内部信息,直接利用中间预测结果,具有良好的泛化能力和实用性。相比现有方法如ODSCAN和MIA,DistScan在场景级攻击中表现出更强的鲁棒性和准确性,为目标检测安全提供了新思路。

方法详解

  • �� 构建验证集:根据模型架构(单阶段或两阶段)选择完整图像或裁剪单目标图像,确保输入分布一致。
  • �� 提取预NMS预测:对验证集中的每张图片,获取模型在预NMS阶段的类别预测,过滤置信度低的预测(阈值δ=0.0005)。
  • �� 统计类别频次:将剩余预测按类别统计频次,形成类别分布向量bi(fθ),并对所有图像的向量求和归一化,得到模型的预NMS类别分布。
  • �� 计算偏移:将模型的类别分布与训练类别频率(R)归一化后比较,使用JS散度衡量偏移程度。
  • �� 判定阈值:若偏移值超过预设阈值τ,则判定模型为后门模型,否则为正常模型。
  • �� 关键参数:训练类别频率R由训练数据统计得出,偏移阈值τ通过验证集调优,确保检测的准确性和鲁棒性。

实验设计

实验在MS-COCO和PASCAL VOC两个数据集上进行,涵盖YOLOv5和Faster R-CNN两种架构。构建了多场景攻击模型(误分类、消失、插入),每类攻击训练18个后门模型和18个正常模型,总计288个模型。评估指标包括检测准确率、TPR、FPR和AUROC。通过调优偏移阈值,确保在不同模型和攻击场景下的检测效果。还进行了消融实验验证验证集构建策略和阈值对性能的影响,确保方法的稳定性和泛化能力。

结果分析

在所有场景和模型中,DistScan平均检测准确率达96.99%,在多类别复杂环境(COCO)中表现尤为优越,远超对比方法如ODSCAN和MIA。特别是在场景级攻击中,DistScan几乎实现100%的检测率,FPR保持在0.00%至5.56%之间。AUROC指标也显示出极强的区分能力,平均值超过0.97。消融实验验证了验证集构建策略和偏移阈值的合理性,确保在不同模型和数据分布下的稳定性。整体结果证明,该方法具有极强的实用性和泛化能力,为目标检测安全提供了新工具。

应用场景

该检测方法适用于自动驾驶、安防监控、医疗影像等需要高安全性目标检测的行业。只需少量干净样本和训练类别频率信息,即可在模型部署前快速识别潜在后门模型,有助于提升系统整体安全性。未来,可结合实时检测和多模态信息,开发自动化安全审查工具,推动行业标准制定,保障关键基础设施的安全。

局限与展望

尽管方法表现优异,但在类别数极多(如COCO)或类别相似度高的场景中,检测效果略有下降,可能受类别混淆影响。此外,方法依赖于训练类别频率的准确统计,若训练数据偏差严重,可能影响检测准确性。对极端复杂环境或极少样本的检测效果尚未充分验证,未来需结合多模态信息和深度特征进行优化。

通俗解读 非专业人士也能看懂

想象你在一家工厂里工作,工厂每天生产各种不同的商品,比如玩具、衣服、电子产品等。工厂的生产线非常有序,每个环节都按照一定的流程进行,生产出的商品也符合预先设定的比例和规格。现在,有个坏人偷偷在某些商品上放了特殊的标签(就像触发器),当这些标签出现时,工厂的机器就会出错,生产出错误的商品或者不生产某些商品。这些标签很隐秘,普通人很难发现。为了检测这些隐藏的标签,工厂的管理者开始观察每个环节的商品比例,看看是否有异常。正常情况下,商品的比例应该和平时一样,但如果发现某个类别的商品比例突然偏离,就说明可能有问题。这个检测方法就像是用统计学的方法,观察每个类别的商品数量,找出偏差,判断工厂是否被“植入”了隐藏的标签。这样,即使没有直接看到标签,也能发现工厂是否被操控了。这就是本文提出的DistScan方法的核心思想:通过观察模型在预测中的类别分布偏移,检测目标检测模型是否被植入了后门。

简单解释 像给14岁少年讲一样

想象你在学校的食堂里吃饭,平时每次吃饭,大家都点不同的菜,比如面条、米饭、炒菜、汤等。每个人点的菜的比例大致是一样的,大家都按照平时的习惯点菜。但是,有个坏人偷偷在菜单上放了特殊的标记(就像触发器),当有人点了这个标记的菜时,食堂的厨师就会突然做出奇怪的菜,或者不做某些菜。这些奇怪的变化很难被普通人发现,因为标记很隐秘。为了检测这些坏人,食堂管理者开始统计每天每种菜的点餐比例,看看是否有异常。正常情况下,比例应该和以前一样,但如果发现某个菜的点餐比例突然变了,就说明可能有问题。这个检测方法就像用数学的方法,观察每个菜的点餐比例,找出偏差,判断食堂是否被操控了。这和我们用统计学检测模型是否被植入后门的原理一样。通过观察模型预测的类别分布偏移,我们可以判断模型是否被攻击了,而不用知道触发器的具体样子。

术语表

Backdoor Attack (后门攻击)

一种在模型训练中植入隐藏行为的攻击方式,使模型在特定触发条件下表现异常。

论文中描述攻击者在训练数据中植入触发器以操控模型行为。

Pre-NMS Predictions (预NMS预测)

模型在非最大抑制前的中间类别预测结果,反映模型在推理过程中的类别分布。

本文利用预NMS预测的类别分布偏移作为检测信号。

Jensen-Shannon Divergence (JS散度)

一种衡量两个概率分布相似度的对称距离,确保在类别概率接近零时仍有定义。

用于比较模型预测类别分布与训练类别分布的偏移程度。

Object Detection (目标检测)

识别图像中所有目标的位置和类别的任务,输出边界框和类别标签。

研究的核心任务,模型输出在预NMS阶段进行分析。

Two-stage Detector (两阶段检测器)

先生成候选区域(RPN),再分类和回归的检测模型,如Faster R-CNN。

本文考虑两阶段检测器的预NMS预测分布。

Single-stage Detector (单阶段检测器)

直接从特征图回归边界框和类别的检测模型,如YOLO。

本文也适用于单阶段检测器的预NMS预测分析。

Trigger (触发器)

在后门攻击中植入的特殊信号,用于激活模型的恶意行为。

检测方法无需触发器知识,依赖模型中间预测偏移。

Distribution Shift (分布偏移)

模型在不同输入或状态下输出概率分布的变化,反映模型行为的异常。

核心检测信号,模型后门导致预NMS类别分布偏离训练分布。

Model Architecture (模型架构)

模型的结构设计,包括单阶段和两阶段两类。

影响验证集构建和预测提取方式。

Validation Set (验证集)

用于估计模型预测行为的样本集,确保检测的代表性和鲁棒性。

根据模型架构构建,确保偏移检测的有效性。

Threshold (阈值)

用以判断偏移是否显著的界限值。

偏移超过阈值则判定模型为后门模型。

Detection Accuracy (检测准确率)

正确识别后门模型的比例。

评估方法在不同场景中的效果。

AUROC (曲线下面积)

衡量模型区分正负样本能力的指标,值越接近1越好。

用于评估检测方法的鲁棒性。

Object Misclassification (目标误分类)

触发器导致目标被错误分类为攻击者指定类别。

一种攻击场景。

Object Disappearance (目标消失)

触发器使模型完全不检测目标。

另一种攻击场景。

Object Insertion (目标插入)

触发器诱导模型生成不存在的目标。

第三种攻击场景。

开放问题 这项研究留下的未解疑问

  • 1 尽管DistScan在多模型、多场景中表现优异,但在极端类别数(如COCO的80类)或类别相似度极高的情况下,检测性能略有下降。未来需要研究如何结合深度特征或多模态信息,进一步提升在复杂环境中的鲁棒性。
  • 2 当前方法依赖于训练类别频率的准确统计,但在训练数据偏差严重或不完整的情况下,偏移检测的稳定性和准确性可能受影响。如何在数据偏差存在时保持检测效果,是未来的研究方向。
  • 3 方法主要关注类别分布偏移,未考虑空间信息和目标位置的变化。结合空间特征或目标关系信息,可能进一步增强检测能力。
  • 4 在极少样本或动态场景中,模型的中间预测分布可能不稳定,如何设计更鲁棒的检测机制仍需探索。
  • 5 实时检测的实现尚未深入,未来需优化算法效率,适应实际应用中的时间限制。

应用场景

近期应用

模型安全审查工具

在自动驾驶或安防系统中,部署前快速检测潜在后门模型,确保系统安全,减少安全风险。

模型验证平台

为模型开发者提供一种无需访问模型内部参数的检测手段,提升模型发布的可信度。

行业安全标准制定

推动目标检测模型的安全检测标准化,建立行业通用的模型安全评估体系。

远期愿景

自动化安全防护系统

结合多模态信息和深度特征,开发全自动化的模型安全检测与修复工具,保障关键基础设施安全。

普适化模型安全检测框架

实现跨任务、跨模型的通用检测平台,适应未来多样化的AI模型安全需求,推动行业标准化和普及。

原文摘要

Object detection models deployed in safety-critical applications remain vulnerable to backdoor attacks that cause targeted misbehaviors when a hidden trigger is present. Existing detection methods either rely on trigger inversion or exploit architecture-specific assumptions, and critically, representative existing methods fail to generalize reliably to scene-level attacks, where a single trigger induces anomalous behavior across all objects in the scene simultaneously. We present DistScan, a backdoor detection framework based on a simple but previously unexploited observation: backdoor injection systematically shifts a model's pre-NMS prediction class distribution away from its training class frequencies, even on clean inputs without any trigger present. DistScan aggregates intermediate class predictions over a clean validation set and flags a model as backdoored if the resulting distribution deviates significantly from the training class frequencies, requiring no model weight access, no trigger knowledge, and no additional training. Extensive experiments on MS-COCO and PASCAL VOC across two architectures and three scene-level attack scenarios demonstrate that DistScan substantially outperforms existing methods, improving average detection accuracy over the best-performing applicable baseline by 27.32 percentage points.

cs.CV cs.AI

参考文献 (20)

BadDet: Backdoor Attacks on Object Detection

Shih-Han Chan, Yinpeng Dong, Junyi Zhu 等

2022 92 引用 ⭐ 高影响力 查看解读 →

Detector Collapse: Backdooring Object Detection to Catastrophic Overload or Blindness

Hangtao Zhang, Shengshan Hu, Yichen Wang 等

2024 31 引用 ⭐ 高影响力

Towards Robust Object Detection: Identifying and Removing Backdoors via Module Inconsistency Analysis

Xianda Zhang, Siyuan Liang

2024 7 引用 ⭐ 高影响力 查看解读 →

OdScan: Backdoor Scanning for Object Detection Models

Siyuan Cheng, Guangyu Shen, Guanhong Tao 等

2024 20 引用 ⭐ 高影响力

Invisible Backdoor Attack with Sample-Specific Triggers

Yuezun Li, Yiming Li, Baoyuan Wu 等

2020 699 引用 查看解读 →

Comprehensive study on object detection for security and surveillance: A concise review

Faisal Alamri

2025 17 引用

Evaluating Object (Mis)Detection From a Safety and Reliability Perspective: Discussion and Measures

A. Ceccarelli, Leonardo Montecchi

2022 20 引用 查看解读 →

Detecting AI Trojans Using Meta Neural Analysis

Xiaojun Xu, Qi Wang, Huichen Li 等

2019 401 引用 查看解读 →

BadNets: Evaluating Backdooring Attacks on Deep Neural Networks

Tianyu Gu, Kang Liu, Brendan Dolan-Gavitt 等

2019 1407 引用

Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection

Shilong Liu, Zhaoyang Zeng, Tianhe Ren 等

2023 4770 引用 查看解读 →

Deep Learning-Based Medical Object Detection: A Survey

M. Saraei, Mehrshad Lalinia, Eung-Joo Lee

2025 16 引用

Rethinking the Backdoor Attacks’ Triggers: A Frequency Perspective

Yi Zeng, Won Park, Z. Mao 等

2021 293 引用 查看解读 →

Targeted Backdoor Attacks on Deep Learning Systems Using Data Poisoning

Xinyun Chen, Chang Liu, Bo Li 等

2017 2325 引用 查看解读 →

Prevalence of neural collapse during the terminal phase of deep learning training

Vardan Papyan, Xuemei Han, D. Donoho

2020 996 引用 查看解读 →

ABS: Scanning Neural Networks for Back-doors by Artificial Brain Stimulation

Yingqi Liu, Wen-Chuan Lee, Guanhong Tao 等

2019 565 引用

Real-time object detection, tracking, and monitoring framework for security surveillance systems

S. Abba, Ali Mohammed Bizi, Jeong-A Lee 等

2024 79 引用

Review of Object Detection Challenges in Autonomous Driving

Shen Cao

2023 4 引用

You Only Look Once: Unified, Real-Time Object Detection

J. Redmon, S. Divvala, Ross B. Girshick 等

2015 47650 引用 查看解读 →

Unbiased look at dataset bias

A. Torralba, Alexei A. Efros

2011 2832 引用

Test-Time Backdoor Detection for Object Detection Models

Hangtao Zhang, Yichen Wang, Shihui Yan 等

2025 22 引用 查看解读 →