Test-Time Backdoor Detection for Object Detection Models

TL;DR

提出TRACE方法,通过语义感知变换检测目标检测模型中的后门样本,提升30% AUROC。

cs.CV 🔴 高级 2025-03-19 62 次浏览
Hangtao Zhang Yichen Wang Shihui Yan Chenyu Zhu Ziqi Zhou Linshan Hou Shengshan Hu Minghui Li Yanjun Zhang Leo Yu Zhang
目标检测 后门攻击 测试时检测 语义变换 黑盒防御

核心发现

方法论

本文提出TRAnsformation Consistency Evaluation (TRACE),利用前景和背景变换,评估样本在不同变换下检测结果的一致性。通过分析被污染样本在背景扰动和焦点变化中的置信度方差,识别潜在后门样本。研究发现,后门样本在多背景和焦点变换中表现出异常的检测结果稳定性,提出结合背景和焦点变换的指标进行检测。实验证明TRACE在多个数据集和攻击方式下,优于现有方法30%的AUROC,且对自适应攻击具有鲁棒性。

关键结果

  • 在MS-COCO、PASCAL VOC和合成交通标志数据集上,TRACE在七种后门攻击下实现平均30%的AUROC提升,显著优于Detector Cleanse等现有方法。
  • 通过背景扰动和焦点变换,检测准确率提升,尤其在复杂攻击场景中表现优异,验证了语义感知变换的有效性。
  • 实验还显示TRACE具有良好的黑盒适用性,无需模型内部信息,适应多样攻击策略和模型架构,展现出强泛化能力。

研究意义

该研究突破了目标检测后门检测的难题,提供了无需模型内部信息的普适性检测方案。通过语义感知的变换策略,有效应对复杂攻击效果如“幽灵”目标和“消失”目标,极大增强了模型安全性。此方法不仅适用于工业界的模型部署,也为未来研究提供了新的思路,即利用模型对不同语义变换的响应差异进行安全检测,推动目标检测安全防护技术的进步。

技术贡献

本文提出基于语义感知的变换一致性指标,结合背景扰动和焦点变化,设计出黑盒、通用的后门检测框架TRACE。该方法突破了现有检测只能针对特定攻击或模型白盒信息的限制,提供了理论上的变换一致性分析基础。通过引入背景和焦点变换,显著提升检测鲁棒性和泛化能力,为目标检测模型的安全防护开辟了新路径。

新颖性

首次提出利用语义感知变换(背景扰动和焦点变化)检测目标检测模型中的后门,区别于传统像素级变换或白盒检测。该方法充分利用后门样本在多变环境中的异常稳定性,提出全新的变换一致性指标,实现黑盒、普适、实时检测,填补该领域的空白。

局限性

  • 当前方法在极端背景变化或复杂场景下可能出现误判,尤其是背景与目标高度相关时。
  • 对某些自然“背门”样本(如标准化的交通标志)可能产生误警,需结合额外语义过滤策略。
  • 计算成本较高,尤其在大规模检测时需优化采样和变换策略。

未来方向

未来将结合深度学习的语义理解能力,优化变换策略,提升检测效率与准确性。同时,探索多模态信息融合,增强对复杂、多目标场景的检测能力,推动目标检测安全技术的实用化和智能化发展。

AI 总览摘要

目标检测模型在实际应用中面临严重的安全威胁,尤其是后门攻击。攻击者通过在训练样本中植入触发器,使模型在正常情况下表现良好,但一旦触发器出现,就会执行预设的恶意行为。现有检测方法多依赖白盒信息或特定攻击特征,难以应对复杂多变的攻击场景。本文提出了TRAnsformation Consistency Evaluation (TRACE),一种基于语义感知变换的测试时后门检测方法。

TRACE利用背景扰动和焦点变化两种变换,评估样本在不同变换下检测结果的置信度方差。研究发现,后门样本在多背景和焦点变换中表现出异常的检测结果稳定性,而正常样本则表现出较高的变化性。通过结合这两个指标,TRACE可以有效识别潜在的被污染样本。

大量实验证明,TRACE在MS-COCO、PASCAL VOC和合成交通标志数据集上,优于现有方法30%的AUROC,且对多种攻击策略和自适应攻击具有鲁棒性。这一方法的提出,为目标检测模型的安全防护提供了全新的思路,即利用模型对语义变换的响应差异进行检测,极大增强了检测的普适性和实用性。未来,结合深度语义理解和多模态信息,有望进一步提升检测效果,推动目标检测安全技术的应用落地。

深度分析

研究背景

目标检测作为计算机视觉的核心任务,广泛应用于自动驾驶、安防监控等场景。近年来,深度学习模型在检测精度上取得巨大突破,但安全风险也日益凸显。后门攻击通过在训练样本中植入触发器,使模型在触发条件下执行攻击者预设的目标行为。现有防御多依赖白盒信息或特定特征检测,存在泛化能力不足和场景适应性差的问题。黑盒检测技术逐渐成为研究热点,但仍面临多样化攻击和复杂场景的挑战。

核心问题

目标检测模型的后门攻击具有多样化表现形式,如“幽灵”目标、目标消失或误分类,严重威胁模型安全。现有检测方法多依赖模型内部信息或特定触发器特征,难以应对复杂攻击和未知触发器。测试时检测的难点在于目标检测输出的多样性和复杂性,尤其是在没有模型白盒信息的情况下,如何准确识别被污染样本成为核心难题。

核心创新

本文提出基于语义感知的变换一致性检测框架TRACE,创新点在于:

  • �� 利用背景扰动和焦点变化两种变换,评估样本在不同语义环境中的检测结果稳定性。
  • �� 发现后门样本在多背景和焦点变换中表现出异常稳定性,作为检测依据。
  • �� 提出黑盒、通用、实时的检测指标,无需模型内部信息,适应多样攻击场景。
  • �� 结合理论分析和实证验证,显著提升检测性能和鲁棒性。

方法详解

  • �� 设计背景扰动变换:将背景图像与原始样本融合,模拟不同场景,计算检测置信度的方差。
  • �� 设计焦点变换:在样本中滑动插入小目标,观察检测置信度的变化,评估“岛屿效应”。
  • �� 结合两个指标,定义变换一致性得分,用于区分正常与被污染样本。
  • �� 采用蒙特卡洛采样,减少检测计算量,提高效率。
  • �� 构建整体检测流程:对输入样本进行背景扰动和焦点变换,计算指标,结合sigmoid归一化,判定是否为后门样本。

实验设计

在MS-COCO、PASCAL VOC和合成交通标志数据集上,采用七种主流后门攻击(如OGA、RMA、GMA等)进行评估。对比Detector Cleanse等方法,指标包括AUROC和F1-score。设置不同攻击强度和变换参数,进行消融分析。实验还验证了方法在不同模型(YOLOv5、Faster R-CNN、DETR)上的适应性和鲁棒性。

结果分析

TRACE在七种攻击下平均AUROC提升30%,显著优于对比方法。背景扰动和焦点变换指标结合后,检测准确率提升,尤其在复杂攻击场景中表现优异。实验证明,方法对自适应攻击具有较强鲁棒性,且无需模型内部信息,适应多模型、多场景。

应用场景

该方法适用于工业界模型部署中的安全检测,尤其在云端MLaaS场景中,无需访问模型内部参数即可实现实时监控。可结合自动化检测系统,增强模型在自动驾驶、安防监控等关键应用中的安全性。未来还可扩展到多模态检测和多任务场景,提升整体安全防护能力。

局限与展望

当前方法在极端背景变化或高度相关背景下可能误判,且计算成本较高,需优化采样策略。对自然“背门”样本(如标准化交通标志)可能误报,需结合语义过滤。未来需结合多模态信息和深度语义理解,提升检测效率和准确性。

通俗解读 非专业人士也能看懂

想象你在一个工厂里,工人们每天都在生产不同的商品。有些工人可能偷偷在产品中加入特殊的标记(类似触发器),这样只要有人看到,就会触发他们预设的动作。检测这些偷偷加入标记的商品就像是在工厂里找出带有特殊标签的产品。传统方法可能只看商品的外表,但如果有人用特殊的背景或隐藏的标签来迷惑检测,就会很难发现。本文提出的方法像是用不同的灯光和角度观察商品,看看它们在不同光线下是否表现一致。带有隐藏标签的商品在不同光线下表现得异常稳定,而正常商品会有变化。通过这种方式,可以更准确地找到那些隐藏的“标签”,确保工厂的安全。这就像用不同的照明和角度检查商品,找到那些不正常的隐藏标记,防止工厂被欺骗。

简单解释 像给14岁少年讲一样

想象你在学校里玩找不同的游戏。有些学生偷偷在他们的书里贴了特殊的贴纸(就像后门触发器),只要老师看到,就会让他们做特别的事情。老师平时用普通的方法看书,但如果用不同的灯光或者角度看,就能发现那些贴纸。这个研究就像是用不同的“灯光”和“角度”观察图片,看看哪些图片在不同条件下都表现得很“稳定”。那些带有隐藏“贴纸”的图片,无论怎么变换背景或焦点,都表现得很一致,而正常图片会有变化。通过这种方法,老师可以更容易找到那些偷偷藏在图片里的“贴纸”,保证大家的安全。这个方法不用知道图片的内部信息,只用观察它们在不同变换下的表现,就能识别出潜在的危险图片。

原文摘要

Object detection models are vulnerable to backdoor attacks, where attackers poison a small subset of training samples by embedding a predefined trigger to manipulate prediction. Detecting poisoned samples (i.e., those containing triggers) at test time can prevent backdoor activation. However, unlike image classification tasks, the unique characteristics of object detection -- particularly its output of numerous objects -- pose fresh challenges for backdoor detection. The complex attack effects (e.g., "ghost" object emergence or "vanishing" object) further render current defenses fundamentally inadequate. To this end, we design TRAnsformation Consistency Evaluation (TRACE), a brand-new method for detecting poisoned samples at test time in object detection. Our journey begins with two intriguing observations: (1) poisoned samples exhibit significantly more consistent detection results than clean ones across varied backgrounds. (2) clean samples show higher detection consistency when introduced to different focal information. Based on these phenomena, TRACE applies foreground and background transformations to each test sample, then assesses transformation consistency by calculating the variance in objects confidences. TRACE achieves black-box, universal backdoor detection, with extensive experiments showing a 30% improvement in AUROC over state-of-the-art defenses and resistance to adaptive attacks.

cs.CV