GuardPaint:SpeculativeSafetyDecodingforText-to-ImageGeneration

TL;DR

GuardPaint通过推测解码框架在扩散过程中修复不安全内容,显著降低攻击成功率并保持图像质量。

cs.CV 🔴 高级 2026-08-22 28 次浏览
Shreyash Dhoot Paras Dhiman Arsh Abbas Naqvi Aranbi Dutta Aman Chadha Vinija Jain Amitava Das
扩散模型 安全生成 文本到图像 推测解码 图像修复

核心发现

方法论

GuardPaint是一种推测解码框架,通过轻量级审计器监控扩散过程中的中间图像,定位不安全区域,并使用政策对齐的修复器进行局部修复。修复候选通过“守护式竞赛”筛选,仅接受符合安全政策且保留提示忠实度和感知质量的编辑。

关键结果

  • 在SD 1.5模型上,DACA攻击成功率从8.25%降至1.94%,SneakPrompt从7.00%降至1.79%。
  • 在FLUX.1-dev模型上,MMA攻击成功率从4.25%降至2.44%。
  • 实验表明,修复后的图像忠实度和质量保持在±0.05范围内,无显著退化。

研究意义

该研究解决了扩散模型生成过程中的安全问题,提供了一种无需修改基础模型的模块化解决方案。它不仅能阻止不安全内容生成,还能提供语义一致的替代图像,适用于多个生成架构。

技术贡献

提出了一种解码时安全对齐层,结合审计、局部修复和竞赛筛选机制,首次实现扩散轨迹内的安全干预,避免了模型重训练或全局分布修改。

新颖性

GuardPaint是首个在扩散轨迹中进行局部修复的框架,区别于传统的提示过滤和后处理分类器,提供了政策对齐的视觉替代方案。

局限性

  • 修复器仅基于SD 1.5模型,可能无法完全保留高容量生成器的风格特性。
  • 审计器仅针对三类标签(安全、裸露、暴力),无法检测更复杂的政策违规。

未来方向

未来可扩展审计器的标签体系以涵盖更多政策违规类型,并开发针对不同生成架构的原生修复器。

AI 总览摘要

文本到图像扩散模型在生成高质量视觉内容方面表现出色,但其可控性带来了安全挑战:对抗性提示可能导致生成裸露或暴力内容。现有的安全机制多集中于生成前的提示过滤或生成后的图像分类,无法干预扩散过程。

GuardPaint提出了一种推测解码框架,通过轻量级审计器监控扩散轨迹,定位不安全区域,并触发局部修复。修复候选由政策对齐的修复器生成,并通过守护式竞赛筛选,仅接受符合安全政策且保留提示忠实度的编辑。实验表明,该方法显著降低了攻击成功率,同时保持图像质量和提示忠实度。

该框架无需修改基础模型,适用于多种扩散架构,包括SD 1.5、SDXL和FLUX.1-dev。未来工作将扩展审计器的标签体系,并开发更适配的修复器以提升跨架构性能。

深度分析

研究背景

扩散模型近年来在生成高质量图像方面取得了巨大进展,代表性工作包括Stable Diffusion和DALL-E。然而,这些模型的开放性和可控性使其容易受到对抗性提示的攻击,生成违反政策的内容,如裸露或暴力图像。

核心问题

现有的安全机制主要集中在提示过滤或生成后分类,无法干预扩散过程中的不安全轨迹。这导致模型要么拒绝生成,要么无法提供安全的替代图像。

核心创新

GuardPaint通过推测解码框架实现扩散轨迹内的安全干预。其创新包括轻量级审计器、政策对齐修复器和守护式竞赛筛选机制,避免了模型重训练或全局分布修改。

方法详解

  • �� 审计器监控中间图像,定位不安全区域。
  • �� 修复器生成政策对齐的修复候选。
  • �� 守护式竞赛筛选修复候选,仅接受符合安全政策的编辑。
  • �� 修复结果通过扩散模型的特定方程重新插入轨迹。

实验设计

实验使用JailBreakDiffBench协议,评估五种攻击类型(SneakPrompt、MMA等)在四种扩散架构上的表现。指标包括攻击成功率(ASR)、图像忠实度和质量。

结果分析

GuardPaint显著降低了攻击成功率,例如在SD 1.5模型上,DACA攻击成功率从8.25%降至1.94%。修复后的图像忠实度和质量保持在±0.05范围内,无显著退化。

应用场景

该框架适用于公共生成系统和创意工具,能够在不安全内容生成时提供语义一致的替代图像。

局限与展望

修复器仅基于SD 1.5模型,可能无法完全保留高容量生成器的风格特性。审计器的标签体系较为粗糙,无法检测更复杂的政策违规。

通俗解读 非专业人士也能看懂

可以将GuardPaint比作厨房里的智能助手。在烹饪过程中,它会实时检查每道菜的状态。如果发现某道菜有问题,比如味道太重或不符合健康标准,它会局部调整这道菜,而不是重新做整顿饭。这种方法既节省时间,又能确保最终的菜肴符合健康和美味的要求。

简单解释 像给14岁少年讲一样

想象你在玩游戏时,系统会实时检查你的操作。如果发现你快要触发一个危险的陷阱,它会悄悄帮你修复这个问题,而不会让你整个游戏失败。这就是GuardPaint在扩散模型中的作用,它会在生成图像的过程中修复不安全的部分,同时保留其他正常的内容。

术语表

扩散模型 (Diffusion Model)

一种生成模型,通过逐步去噪生成高质量图像。

用于文本到图像生成任务。

推测解码 (Speculative Decoding)

一种解码技术,通过实时审计和修复提高生成内容的安全性。

GuardPaint的核心机制。

审计器 (Auditor)

用于检测扩散过程中的不安全区域的模块。

监控中间图像并定位问题区域。

修复器 (Inpainter)

用于修复不安全区域并生成安全替代图像的模块。

生成符合政策的修复候选。

守护式竞赛 (Guarded Tournament)

一种筛选机制,仅接受符合安全政策的修复候选。

确保修复质量和提示忠实度。

开放问题 这项研究留下的未解疑问

  • 1 如何扩展审计器以检测更复杂的政策违规?
  • 2 如何开发适配不同扩散架构的原生修复器?

应用场景

近期应用

内容审核

应用于生成平台,实时检测并修复不安全内容。

创意工具

帮助艺术家生成符合政策的高质量图像。

远期愿景

多模态生成安全

扩展至视频、音频等生成任务,确保多模态内容的安全性。

原文摘要

Text-to-image (T2I) diffusion models offer powerful visual generation, but their controllability creates a critical safety challenge: adversarial prompts can steer the denoising trajectory toward policy-violating content such as explicit nudity or graphic violence. Existing safeguards mostly act before generation through prompt filtering or after generation through image classification, leaving the diffusion process itself unguarded and often yielding only refusal rather than safe visual repair. We introduce GuardPaint, a speculative decoding framework for safe T2I generation that intervenes inside the diffusion trajectory without modifying the base model. A lightweight auditor monitors intermediate images, localizes unsafe regions, and triggers surgical inpainting repair only where needed. Candidate repairs are generated by a policy-aligned inpainter and selected through a guarded tournament that accepts edits only when they improve policy compliance while preserving prompt fidelity and perceptual quality. Across five jailbreak families SneakPrompt, MMA, PGJ, DACA, and RABell and UNet/flow-matching models including SD~1.5, SDXL, SD~3.5, and FLUX.1-dev. GuardPaint reduces attack success and harmful generations with minimal degradation to image quality, prompt fidelity, and benign behavior. Content warning: This paper contains examples involving nudity and violence that some readers may find disturbing, distressing, or offensive.

cs.CV cs.AI