Backbone is All You Need: Assessing Vulnerabilities of Frozen Foundation Models in Synthetic Image Forensics

TL;DR

提出SIAA灰盒攻击,利用预训练ViT特征空间成功误导深度伪造检测器,成功率接近白盒。

cs.CV 🔴 高级 2026-05-13 49 次浏览
Chiara Musso Joy Battocchio Andrea Montibeller Giulia Boato
对抗攻击 深度伪造检测 Vision Transformer 灰盒攻击 模型脆弱性

核心发现

方法论

本文提出的Surrogate Iterative Adversarial Attack (SIAA)通过训练一个特征对齐的FP-Head,将预训练ViT特征与CLIP文本嵌入映射到共享空间。在攻击阶段,利用PGD在特征空间优化扰动,绕过检测器的分类头。该方法只需已知ViT骨架,避免访问分类层,显著提升攻击成功率。实验中,SIAA在多种ViT检测器(如CLIP、Swin、DINOv2)上表现优异,成功率常接近白盒攻击,验证其在不同灰盒场景下的鲁棒性。

关键结果

  • 在相同训练数据和数据增强条件下,SIAA对CLIP、Swin、DINOv2检测器的攻击成功率(ASR)均超过0.98,远超PGD-ViT和PGD-L,接近白盒攻击水平。
  • 在少样本和训练偏差场景中,ASR仍保持在0.96以上,显示出极强的泛化能力。
  • 跨模型转移实验中,SIAA在Swin和CLIP间转移成功率达56%,而对DINOv2的转移成功率较低(10-15%),反映不同模型特征空间的差异。

研究意义

该研究揭示了基于预训练ViT骨架的深度伪造检测器在仅知骨架信息时的极端脆弱性。攻击无需访问分类头,利用特征空间的共性即可高效误导检测,突显模型在实际应用中的潜在风险。此发现促使行业关注模型鲁棒性,推动开发更安全的检测机制,具有重要理论和实践意义。

技术贡献

提出基于特征对齐的灰盒攻击框架,结合CLIP文本编码和ViT特征映射,创新性地在特征空间进行扰动优化。区别于传统基于分类输出的攻击,SIAA利用特征分布差异实现高效攻击,突破了模型黑箱限制。该方法兼容多模型、多场景,提供了新型对抗策略的理论基础。

新颖性

首次提出只需已知预训练ViT骨架的灰盒攻击框架,利用特征空间对齐实现高成功率。不同于以往依赖分类输出的白盒或迁移攻击,SIAA在无需访问分类头的情况下,利用特征分布差异进行攻击,展现出极强的实用性和泛化能力。

局限性

  • 对某些自监督模型(如DINOv2)表现出较低的转移成功率,说明不同预训练目标影响特征空间一致性。
  • 攻击依赖于训练好的特征对齐模型,若检测器架构发生大幅变化,效果可能下降。
  • 在极端偏离训练数据的场景中,攻击成功率有所下降,仍需优化泛化能力。

未来方向

未来将探索多模态特征融合、对抗训练增强鲁棒性,以及针对不同预训练目标的模型适应策略。同时,研究更高效的攻击优化算法,提升在大规模实际场景中的实用性。

AI 总览摘要

随着AI生成技术的不断进步,深度伪造图像的真实性辨识成为关键难题。近年来,基于Vision Transformer(ViT)的检测器凭借其优异的特征表达能力,成为主流方案。然而,本文提出的Surrogate Iterative Adversarial Attack(SIAA)揭示了这些检测器在只知骨架信息时的巨大脆弱性。通过训练一个特征对齐的FP-Head,将CLIP文本编码与ViT特征映射到共享空间,攻击者可以在不访问分类头的情况下,利用PGD在特征空间中优化扰动,成功误导检测器。实验结果显示,SIAA在多种ViT检测模型(如CLIP、Swin、DINOv2)上实现了超过98%的攻击成功率,远超传统方法,甚至接近白盒攻击水平。更令人震惊的是,即使在少样本、偏差训练或模型架构变化的条件下,攻击效果依然强劲,成功率保持在96%以上。此外,跨模型转移实验表明,SIAA在某些模型间具有较好的迁移能力,特别是在Swin与CLIP之间。该研究强调了预训练骨架的潜在风险,提醒行业在模型设计中加强鲁棒性,推动安全检测技术的发展。未来,结合多模态特征和对抗训练,将进一步提升模型的抗攻击能力,确保深度伪造检测的可靠性。整体而言,本文为理解和应对深度学习模型的安全威胁提供了新的思路和工具,具有重要的理论价值和实际意义。

深度分析

研究背景

近年来,深度学习模型在图像识别和生成领域取得突破,特别是Vision Transformer(ViT)在特征表达方面展现出优越性能。早期研究多依赖卷积神经网络(CNN)进行伪造检测,但在泛化能力方面存在局限。随着预训练模型的兴起,采用大规模预训练骨架(如CLIP、Swin、DINOv2)成为趋势,提升检测效果。然而,这些模型的安全性尚未充分评估,尤其是在灰盒环境下的脆弱性逐渐显现。此前研究多关注白盒攻击和迁移攻击,但对只知骨架的灰盒攻击研究较少,存在巨大空白。本文基于特征空间的对齐思想,结合CLIP文本编码和ViT特征映射,提出新型攻击框架,填补了这一空白。

核心问题

深度伪造检测器普遍依赖预训练骨架,虽具高准确率,但在只知骨架参数的情况下,模型潜在的脆弱性未被充分挖掘。攻击者若能利用骨架特征空间,便可在不访问分类层的前提下,设计出高效的对抗扰动,严重威胁检测系统的安全性。现有方法多依赖模型输出或梯度信息,难以应对实际中信息有限的场景。如何在只知骨架的条件下,构建鲁棒的攻击策略,成为亟待解决的核心问题。

核心创新

本文提出的SIAA创新点在于:1)利用CLIP文本编码与ViT特征的对齐,构建共享特征空间;2)在此空间中通过PGD优化扰动,避免访问分类头;3)实现只需骨架参数的灰盒攻击,成功率接近白盒。不同于传统攻击依赖模型输出,SIAA在特征层面操作,突破了黑箱限制。该方法兼容多模型、多场景,显著提升攻击效率,为深度伪造检测的安全性提供新思路。

方法详解

  • �� 训练阶段:利用真实和伪造图像,训练FP-Head,将CLIP文本编码和ViT特征映射到共享空间,优化目标为使特征聚类符合标签。
  • �� 攻击阶段:对输入图像加入随机扰动,利用CLIP文本编码生成目标文本特征,提取ViT特征,通过FP-Head映射到共享空间。
  • �� 计算距离:定义距离函数,最大化视觉特征与目标文本的距离差,推动扰动使特征偏离真实类别。
  • �� 扰动优化:利用PGD在特征空间中迭代更新扰动,确保扰动在像素空间内不可见(ℓ∞约束)。
  • �� 评估:在多模型、多场景下测试攻击成功率,验证鲁棒性和泛化能力。

实验设计

采用Synthbuster数据集,包含9,000个由不同生成模型(如DALL-E 2、Stable Diffusion)生成的伪造图像,以及1,000个真实图像。训练FP-Head使用10k真实和伪造样本,数据增强包括旋转、翻转、颜色抖动等。对CLIP、Swin、DINOv2等模型进行攻击,比较白盒、灰盒(PGD-ViT、SIAA)性能。评估指标包括攻击成功率(ASR)和AUC,验证在不同训练偏差和模型架构下的效果。

结果分析

SIAA在所有检测器上实现了超过98%的ASR,远超PGD-ViT和PGD-L,接近白盒攻击的成功率。在少样本和偏差训练条件下,ASR仍保持在96%以上。跨模型转移实验中,SIAA在Swin与CLIP间成功率达56%,对DINOv2转移较低(10-15%),显示不同模型特征空间差异。攻击在不同训练偏差和数据增强条件下表现稳健,验证了其广泛适用性。

应用场景

该攻击方法揭示了预训练ViT骨架在实际检测中的潜在风险,提醒安全行业在模型设计中加入鲁棒性机制。未来可结合多模态特征和对抗训练,提升检测器抗攻击能力,确保深度伪造内容的安全识别。其应用场景包括数字媒体验证、内容审核和反假新闻等,具有广泛的行业影响。

局限与展望

当前方法对DINOv2模型表现出较低的转移成功率,说明不同预训练目标影响特征空间一致性。攻击依赖于训练好的特征对齐模型,若检测器架构发生大幅变化,效果可能减弱。极端偏离训练数据的场景下,成功率有所下降,未来需优化泛化能力和适应性。

通俗解读 非专业人士也能看懂

想象你在一家工厂里,工厂每天生产各种商品。工厂的“核心机器”就像深度学习模型的骨架——它决定了商品的大致样子。工厂里有一台特别的检测仪,能判断商品是真是假,但它只看核心机器的“指纹”。攻击者只需要知道这个“指纹”,不用知道检测仪的全部细节,就能用一种特殊的“调料”在商品上做手脚,让检测仪误判。这个“调料”就像论文中的“扰动”,它在商品的“特征空间”里偷偷作怪。通过巧妙设计的“调料”,攻击者可以让检测仪相信假货是真的。这就像用一种神奇的调料,让假货变得“看不出来”。这项研究告诉我们,只要知道核心机器的“指纹”,就能轻松骗过检测仪,提醒我们要加强工厂的安全措施,不能只依赖核心指纹。

简单解释 像给14岁少年讲一样

想象你在学校,有一个超级厉害的老师,他能通过学生的习惯和表现判断谁在作弊。现在,有个学生想偷偷作弊,他只知道老师平时喜欢看什么东西,比如喜欢看书、喜欢画画,但不知道老师具体的评分标准。这个学生用一种特别的“伪装”,在作业里偷偷加点东西,让老师误以为他表现很好,实际上是在作弊。这个“伪装”就像论文里的“扰动”,它在作业的特征里偷偷作怪,让老师误判。学生只用知道老师平时的习惯(模型的骨架),不用知道具体的评分细节,就能骗过老师。这就像论文中的攻击,只要知道模型的“指纹”,就能制造出让模型误判的“伪装”。这告诉我们,要让老师更聪明,不能只看表面,还要考虑到这些“伪装”,才能更好地识别真伪。

原文摘要

As AI-generated synthetic images become increasingly realistic, Vision Transformers (ViTs) have emerged as a cornerstone of modern deepfake detection. However, the prevailing reliance on frozen, pre-trained backbones introduces a subtle yet critical vulnerability. In this work, we present the Surrogate Iterative Adversarial Attack (SIAA), a gray-box attack that exploits knowledge of the detector's ViT backbone alone and operates entirely within the target detector's feature space to craft highly effective adversarial examples. Through our experiments, involving multiple ViT-based detectors and diverse gray-box scenarios, including few-shot learning, complete training misalignment and attack transferability tests, we demonstrate that this vulnerability consistently yields high attack success rates, often approaching white-box performance. By doing so, we reveal that backbone knowledge alone is sufficient to undermine detector reliability, highlighting the urgent need for more resilient defenses in adversarial multimedia forensics.

cs.CV cs.MM