Forbid Your Attention: Fooling Multimodal Large Language Models by Selectively Removing Intrinsic Focus in Spectral Domain

TL;DR

提出一种基于相位频谱的攻击框架,在多模态大语言模型上实现了90%以上的攻击成功率。

cs.CV 🔴 高级 2026-09-01 34 次浏览
Daizong Liu Junhao Dong Zhiyuan Ma Xiaoye Qu Xiang Fang Runwei Guan Keke Tang Jianfeng Dong Yew-Soon Ong
多模态模型 频谱分析 对抗攻击 相位敏感性 模型鲁棒性

核心发现

方法论

本文提出了一种基于相位频谱的对抗攻击框架,通过限制扰动在结构相关的相位区域,并引入辅助对抗提示模块,增强模型的多模态错位能力。

关键结果

  • 在ImageNet数据集上,攻击成功率达到90.9%,显著优于现有方法(最高提升15%)。
  • 实验表明,相位扰动比幅度扰动更有效,模型对相位信息的敏感性高达89%。
  • 通过消除模型对相位区域的关注,能够显著误导其推理结果。

研究意义

研究揭示了多模态模型对相位频谱的依赖,为设计更有效的对抗攻击提供了新方向,同时对模型鲁棒性研究具有重要意义。

技术贡献

提出了基于相位频谱的结构扰动方法,并结合辅助提示优化,首次系统性地利用模型的相位敏感性进行攻击。

新颖性

首次从频谱角度分析多模态模型的内在关注机制,提出了针对相位信息的结构化攻击策略,显著提升了攻击效果。

局限性

  • 方法依赖于频谱分解,计算成本较高。
  • 对抗提示模块需要额外训练时间。
  • 在某些低分辨率图像上效果可能受限。

未来方向

未来可探索如何优化频谱分解的效率,并研究针对幅度信息的补充攻击策略。

AI 总览摘要

多模态大语言模型(MLLMs)在视觉问答、图像描述等任务中表现出色,但其对抗鲁棒性仍是一个重要挑战。现有攻击方法多集中于全局像素扰动,忽略了模型对视觉结构的内在关注。本研究发现,MLLMs对相位频谱中的结构信息尤为敏感,并提出了一种基于相位频谱的对抗攻击框架,通过限制扰动在结构相关的相位区域,同时引入辅助对抗提示模块,显著增强攻击效果。

实验表明,该方法在多个数据集和模型上均表现出色,攻击成功率最高达到90.9%,显著优于现有方法。此外,研究揭示了模型对相位信息的依赖机制,为设计更具针对性的攻击策略提供了新思路。

尽管方法在计算成本和低分辨率图像上的表现存在一定局限,但其创新性和有效性为多模态模型的鲁棒性研究开辟了新的方向。未来工作将集中于优化计算效率和扩展攻击范围。

深度分析

研究背景

多模态大语言模型近年来取得了显著进展,能够处理视觉和文本信息的复杂交互。然而,研究表明这些模型在面对对抗性输入时易受攻击,尤其是针对视觉组件的攻击。现有方法多采用全局像素扰动,但缺乏对模型内部视觉结构解读的深入研究。

核心问题

多模态模型对视觉信息的解读机制尚不明确,现有攻击方法未充分利用模型对视觉结构的内在关注,导致攻击效果有限。如何设计针对模型内在关注机制的攻击策略是一个亟待解决的问题。

核心创新

本文创新性地从频谱角度分析多模态模型的视觉解读机制,发现其对相位信息的高度敏感性。基于此,提出了相位频谱攻击框架,结合辅助对抗提示模块,显著增强了攻击的针对性和有效性。

方法详解

  • �� 利用离散傅里叶变换分解图像的相位和幅度频谱。
  • �� 提取相位敏感区域,生成结构化掩码。
  • �� 在相位区域内优化对抗扰动,结合任务损失、频谱正则化和空间模式约束。
  • �� 引入辅助对抗提示模块,优化模型对相位区域的关注程度。

实验设计

实验使用ImageNet和SVIT等数据集,比较了多种基线方法(如APGD、CroPA)。评估指标包括攻击成功率(ASR)和语义错位率(E-ASR)。同时进行了消融实验,验证相位扰动的有效性。

结果分析

实验表明,相位扰动的攻击成功率显著高于幅度扰动,最高提升15%。辅助提示模块进一步增强了攻击效果,模型对相位信息的敏感性达到89%。

应用场景

该方法可用于测试多模态模型的鲁棒性,帮助开发更安全的模型架构。同时可用于生成对抗性样本,提升模型的抗攻击能力。

局限与展望

方法计算成本较高,尤其是频谱分解过程。此外,低分辨率图像的攻击效果可能受限。未来可探索更高效的分解算法。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,食材是图像,菜谱是文本。多模态模型就像一个厨师,它需要根据菜谱理解食材的结构,比如切菜时关注边缘。本文发现,这个厨师对食材的“边缘信息”(相位频谱)特别敏感。如果我们在边缘上做些隐秘的改动,厨师可能会做出错误的菜品。这就是本文提出的攻击方法:通过改变图像的“边缘”,误导模型的理解。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,游戏角色需要根据地图找到宝藏。地图上的线条(相位信息)是角色的重点关注对象。如果我们偷偷改动这些线条,角色可能会走错路。本文的研究就是这样,通过修改地图的线条,误导游戏角色(模型)的判断!是不是很酷?

术语表

相位频谱 (Phase Spectrum)

图像的频率信息,包含结构和语义线索。

用于提取模型关注的结构区域。

离散傅里叶变换 (DFT)

将图像分解为频率域的数学工具。

用于获取图像的相位和幅度频谱。

对抗扰动 (Adversarial Perturbation)

故意设计的输入噪声,用于误导模型。

用于生成攻击样本。

辅助对抗提示 (Adversarial Prompt)

优化的文本提示,增强对抗扰动的效果。

引导模型关注错误区域。

攻击成功率 (ASR)

衡量对抗攻击效果的指标。

用于比较不同攻击方法的性能。

开放问题 这项研究留下的未解疑问

  • 1 如何降低频谱分解的计算成本?
  • 2 是否存在针对幅度信息的补充攻击策略?
  • 3 如何在低分辨率图像上优化攻击效果?

应用场景

近期应用

模型鲁棒性测试

用于评估多模态模型在对抗性输入下的表现。

对抗样本生成

帮助开发更安全的模型架构。

远期愿景

频谱敏感性研究

探索多模态模型对频谱信息的依赖机制,提升模型设计。

原文摘要

Multimodal large language models (MLLMs) have extended the capability of large language models (LLMs) to process more contextual multimodal information, showing remarkable progress in diverse realistic multimodal applications. Despite their strong perception and reasoning abilities, recent studies reveal that MLLMs remain highly vulnerable to adversarial inputs, especially those targeting visual components. However, existing attacks mainly focus on global perturbations, lacking an understanding of how MLLMs internally interpret visual structures. In this paper, we make the attempt to investigate the intrinsic focus of MLLMs in the frequency domain and discover that their predictions are particularly sensitive to phase information, which encodes essential structural and semantic cues. Based on this observation, we propose a novel phase-aware adversarial attack framework that explicitly restricts adversarial perturbations to structure-relevant phase regions to suppress the MLLMs' focus for effective and imperceptible attacks. To further amplify the structural influence, we also introduce an auxiliary adversarial prompt learning module to guide multimodal misalignment around phase-sensitive regions, misleading the MLLM's attention toward targeted structural patterns. Extensive experiments on multiple representative MLLM models and datasets demonstrate the superior effectiveness of our method compared to existing attacks.

cs.CV