VPA-Guard: Defending and Benchmarking Image-to-Video Generation Against Visual Prompt Attacks

TL;DR

提出VPA-Guard,结合检索增强与自我演化,有效防御视觉提示攻击,降低攻击成功率44.2%。

cs.CV 🔴 高级 2026-06-24 38 次浏览
Yining Sun Haoyu Kang Jiajun Wu Heng Zhang Danyang Zhang Zhenjun Zhao Haochen Han Fangming Liu Wai Kin Victor Chan Alex Jinpeng Wang
多模态安全 视觉提示攻击 视频生成 对抗防御 基准评估

核心发现

方法论

本研究构建VVA-Bench,系统分类视觉提示攻击类型,包括单图像提示和两帧结构攻击,涵盖运动、表情、姿势等五大机制。采用DINOv2视觉编码器与Sentence-BERT文本编码器融合特征,利用向量数据库检索相似攻击样本,结合少样本推理生成安全提示。提出VPA-Guard,通过检索匹配与自我演化机制,有效识别潜在恶意意图,显著降低攻击成功率。模型在Wan 2.7和Veo 3.1上,攻击成功率分别达100%和74.8%,防御后下降44.2%,安全性提升明显。

关键结果

  • 在无防御情况下,Wan 2.7模型的攻击成功率达100%,生成的有害内容严重违反安全政策,HS评分高达7.30。引入VPA-Guard后,ASR降低44.2%,HS降低73.4%,模型对多种攻击机制表现出强鲁棒性。
  • 不同攻击类型中,运动引导和表情指令最具威胁性,防御机制对其效果最佳。安全过滤误伤率低至12.8%,确保合法用户编辑体验基本不受影响。
  • 通过MLLM评判机制验证,自动评分与专家一致性高,Temporal Harmfulness评估仍具挑战,未来需优化时序内容判定。

研究意义

本研究填补了视觉提示攻击在视频生成安全领域的空白,建立了系统化评估基准,推动多模态生成模型的安全发展。提出的VPA-Guard框架,为工业应用提供了可扩展的防御方案,有助于规避潜在的社会风险,促进AI在内容创作中的责任部署。

技术贡献

创新点在于结合检索增强的少样本推理机制,建立动态知识库,支持模型自我演化。提出多模态特征融合与机制匹配策略,有效识别隐性恶意意图。引入多层次安全评估指标,提升自动化判定的准确性。与现有方法相比,显著提升了对隐性视觉提示攻击的检测与防御能力。

新颖性

首次系统定义视觉提示攻击类别,建立VVA-Bench基准,结合检索与自我演化机制,提出VPA-Guard,有效应对隐性攻击,突破传统过滤局限,兼顾安全性与可控性平衡。

局限性

  • 模型在极端复杂或新颖攻击模式下仍存在识别盲区,需持续扩充攻击样本库。
  • 自我演化机制依赖后续反思,可能引入误判,需优化反思策略。
  • 高效性与鲁棒性之间存在权衡,未来需提升实时响应能力。

未来方向

未来将结合强化学习优化自我演化策略,扩展多模态安全评估指标,探索更广泛的攻击场景。推动多任务、多模态模型的安全机制研究,提升系统整体鲁棒性,促使安全防护机制在实际应用中更具普适性。

AI 总览摘要

近年来,图像到视频(I2V)生成技术取得了突破性进展,使得静态图像不仅成为内容展示,更成为操控视频动态的交互界面。用户可以通过箭头、表情符号等视觉提示,精细控制视频内容,极大提升了交互体验。然而,这一控制能力也带来了安全隐患——静态视觉提示可能被模型误解为执行性指令,导致生成具有潜在危害的视频内容。现有安全评估多集中于文本或内容过滤,缺乏对视觉提示隐性攻击的系统检测。为此,本文提出VVA-Bench,构建了首个针对视觉提示攻击的安全评估基准,涵盖多种攻击机制和安全类别。实验显示,主流模型在未防御情况下,攻击成功率高达100%,生成内容严重违反安全政策。为应对这一挑战,研究团队设计了VPA-Guard,结合检索增强的少样本推理和模型自我演化机制,有效识别潜在恶意意图,显著降低攻击成功率。实验证明,该方法在Wan 2.7和Veo 3.1模型上,攻击成功率从100%降至55.8%,安全性提升明显。该框架不仅提升了视频生成的安全性,也为未来多模态内容安全提供了可扩展的解决方案。总体而言,本文在安全评估和防御策略方面实现了突破,为推动多模态生成技术的责任应用奠定基础。未来工作将聚焦于模型自适应能力的增强和更复杂场景的安全保障,推动行业健康发展。

深度分析

研究背景

图像到视频(I2V)技术经过深度学习的发展,已实现高质量视频生成,代表性工作如Google DeepMind的Veo、Kling AI的Kling2.6等,极大推动了虚拟内容创作、娱乐、教育等行业。然而,随着多模态交互的普及,视觉提示作为操控工具逐渐兴起,带来更细粒度的控制能力,也引发安全隐患。早期研究主要关注文本诱导的内容偏差(如T2V安全基准),但对视觉提示的隐性攻击缺乏系统评估。近年来,攻击者利用箭头、表情符号等静态视觉元素,诱导模型生成危险内容,威胁公共安全与行业规范。现有安全机制多依赖过滤规则或模型微调,难以应对隐性、复杂的攻击策略,亟需建立系统化的检测与防御体系。

核心问题

核心问题在于视觉提示的隐性特性,使得攻击样本难以被传统过滤机制识别。攻击者通过在输入图像中嵌入箭头、表情符号等符号,配合模糊文本提示,诱导模型生成不安全内容。这类攻击具有隐蔽性、多样性和跨模态特征,突破了现有安全检测的局限。如何有效识别这些潜在恶意意图,保障生成内容的安全性,成为亟待解决的难题。另一方面,模型在面对新颖攻击时缺乏自适应能力,难以持续防御不断演化的威胁。

核心创新

本研究的创新点在于提出VVA-Bench,系统分类视觉提示攻击机制,建立多维度安全评估体系。引入检索增强的少样本推理机制,结合多模态特征融合,提升模型识别潜在恶意意图的能力。提出VPA-Guard,采用动态知识库与自我演化策略,持续更新攻击样本库,增强模型对新型攻击的适应性。该方法突破了传统过滤和微调的局限,实现对隐性攻击的高效检测与防御,兼顾模型可控性与安全性平衡。

方法详解

  • �� 构建VVA-Bench,收集多样化的攻击样本,涵盖五大机制(运动、表情、姿势、草图、摄像机控制)和两种攻击形式(单图像和两帧结构)。
  • �� 利用DINOv2视觉编码器提取局部特征,Sentence-BERT提取语义文本特征,将两者融合形成联合表示。
  • �� 通过向量数据库检索相似攻击样本,结合显式推理,识别潜在恶意意图。
  • �� 设计少样本推理提示,将检索到的攻击样本与合理推理结合,指导模型生成安全内容。
  • �� 引入自我反思机制,分析失败样本,动态扩充攻击样本库,支持模型持续学习与适应。
  • �� 评估指标包括攻击成功率(ASR)和有害评分(HS),利用多模态大语言模型(Qwen 3.5-VL-35B-A3B)自动评分,确保评估的规模化与客观性。

实验设计

采用Wan 2.7、Kling 2.6、Hailuo和Veo 3.1四个主流I2V模型,测试在无防御和防御条件下的性能。输入包括视觉提示图像或图像对,配合弱文本提示。指标涵盖攻击成功率、危害评分和误伤率。通过对不同攻击机制和子类型的详细分析,验证VPA-Guard在多场景下的鲁棒性。对比实验显示,未防御模型ASR高达100%,HS评分超过7,防御后ASR平均降低44.2%,HS降低73.4%,验证方法有效性。

结果分析

在未防御情况下,Wan 2.7模型的攻击成功率达100%,生成内容严重违反安全政策。引入VPA-Guard后,ASR平均降低44.2%,HS降低73.4%,显著提升模型安全性。不同攻击机制中,运动引导和表情符号最具威胁性,防御机制对其效果最佳。误伤率控制在12.8%,确保正常用户编辑体验。MLLM评判机制验证显示,自动评分与专家高度一致,Temporal Harmfulness评估仍具挑战,但整体表现令人满意。

应用场景

该框架适用于内容创作平台、虚拟主播、游戏动画等行业,能有效识别和阻断隐性视觉攻击,保障内容安全。未来可结合行业特定需求,扩展多模态安全策略,推动安全内容生成的标准化与自动化,提升行业整体责任水平。

局限与展望

模型在极端复杂或新颖攻击场景下仍存在识别盲区,依赖大量标注样本。自我演化机制可能引入误判,需进一步优化反思策略。高效性与鲁棒性之间存在权衡,实时响应能力仍需提升。未来需结合强化学习和多模态安全策略,增强系统适应性。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,平时你会用各种调料和工具来做出美味佳肴,但如果有人偷偷在调料里放了不好的东西,可能会让菜变得有害。现在,厨师们需要一种方法,能快速识别这些不良调料,确保菜肴安全。类似的,AI生成视频时,也可能被隐藏的“坏意”指令误导,导致生成不安全内容。研究团队就像是厨房的安全员,设计了一个聪明的“检测系统”,通过比对已知的“坏调料”样本,及时发现潜在危险,确保每一道菜都安全可食。这个系统还能不断学习新“坏调料”,变得越来越聪明,确保厨房的安全。这样一来,无论有人怎么偷偷放料,厨房都能保持安全,菜肴也会一直美味健康。

简单解释 像给14岁少年讲一样

想象你在玩一个超级酷的游戏,你可以用箭头、表情符号等东西告诉游戏角色怎么行动,但有时候有人偷偷在这些指令里藏了坏东西,想让游戏变得危险。科学家们发现,这些隐藏的坏指令很难被普通的检测方法发现,就像有人在暗中偷偷做坏事。于是,他们设计了一个聪明的“侦探系统”,它像是游戏里的超级助手,能通过比对很多已知的坏指令样本,快速找到潜在的危险。这个助手还能不断学习新的坏指令,让自己变得更聪明。实验显示,这个系统可以把坏指令的成功率从100%降到55%,让游戏变得更安全。未来,这个方法还能用在很多地方,比如让视频内容更安全,防止有人偷偷制造危险内容。这样,大家就可以放心玩游戏、看视频了!

原文摘要

Recent advancements in Image-to-Video (I2V) generation have transformed input images from simple appearance references into interactive control interfaces where visual cues such as arrows, sketches, and emojis orchestrate complex video dynamics with unprecedented controllability. However, these seemingly innocuous static cues can be interpreted by models as executable temporal instructions, unfolding into harmful actions in the generated videos. Despite the severity of this threat, existing safety benchmarks remain predominantly focused on text-based and content-only image-based jailbreaks, leaving implicit visual prompt attacks insufficiently explored. To bridge this gap, we present VVA-Bench, the first systematic benchmark for evaluating video generation safety under categorized vision-centric prompt attacks. Extensive experiments on VVA-Bench demonstrate that state-of-the-art models are highly susceptible to such attacks, with Attack Success Rates (ASR) reaching 100.0\% on Wan 2.7 and 74.8\% on Veo 3.1. To mitigate these risks, we propose VPA-Guard, a retrieval-augmented and self-evolving defense framework. By leveraging few-shot reasoning to identify latent malicious intents, our method reduces the attack ASR by 44.2\% and the harmfulness score by 73.4\% on average, while maintaining the model's utility for legitimate user edits. Our work provides both a rigorous benchmark and an effective defense strategy to advance safe and socially responsible multimodal generation.

cs.CV