DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization

TL;DR

DiSCO通过对抗性提示优化减少图像生成中的不安全内容,ASR降低37.7%。

cs.AI 🔴 高级 2026-08-18 42 次浏览
Tong Zhang Motasem Alfarra Carlos Hinojosa Christos Louizos Bernard Ghanem
生成模型 安全性 对抗性攻击 黑箱防御 提示优化

核心发现

方法论

DiSCO是一种零样本、严格黑箱的防御方法,完全在提示层面操作。通过分布引导的后缀扩展和对比评分,优化生成的安全性。该方法不需要模型重训练或微调,适用于任何文本到图像系统。

关键结果

  • 在I2P基准测试中,DiSCO在多种攻击下将未防御模型的ASR从23.6%降至2.4%,在NudeNet下从84.2%降至7.8%。
  • 在防御模型中,ASR从8.3%降至1.7%,同时保持语义一致性和图像连贯性。
  • 实验表明,DiSCO在32个系统-攻击设置下均提高了安全性。

研究意义

DiSCO解决了文本到图像生成中的安全问题,尤其是语言上安全但生成有害内容的提示。通过黑箱防御,DiSCO可广泛应用于不同架构的生成模型,提升了模型的安全性和适用性。

技术贡献

DiSCO在不改变模型的情况下,通过提示优化实现了对抗性防御。它利用目标模型自身生成的安全与不安全图像池进行对比评分,提供了一种新的分布对齐方法。

新颖性

DiSCO首次提出了在黑箱环境下,通过提示优化来解决文本到图像生成中的安全问题。与现有方法不同,它不依赖于模型内部信息。

局限性

  • DiSCO在处理极端复杂的对抗性提示时可能效果有限,因为这些提示可能需要更深入的模型理解。
  • 该方法在计算上较为复杂,尤其是在大规模生成任务中。

未来方向

未来的研究可以探索DiSCO在其他生成任务中的应用,如文本生成和音频生成。此外,研究如何降低计算复杂度也是一个重要方向。

AI 总览摘要

随着文本到图像生成模型的发展,生成不安全内容的问题日益严重。现有的白箱防御方法难以扩展到专有模型,而黑箱方法在处理语言上安全但生成有害内容的提示时效果不佳。DiSCO通过分布引导的对比提示优化,提供了一种无需模型重训练的黑箱防御方法。

DiSCO通过后缀扩展和对比评分优化生成内容的安全性。实验表明,DiSCO在I2P基准测试中显著降低了攻击成功率,同时保持了生成质量。作为一种模块化的黑箱方法,DiSCO可以应用于任何文本到图像系统。

DiSCO的创新在于其无需访问模型内部信息,通过提示优化实现了对抗性防御。这为生成模型的安全性提供了新的思路,同时也为未来的研究提供了方向,如在其他生成任务中的应用和降低计算复杂度。

深度分析

研究背景

文本到图像生成模型如Stable Diffusion和Flux在生成能力上取得了显著进展,但也带来了安全性问题,尤其是在生成不安全内容方面。现有的白箱防御方法依赖于模型内部信息,难以适用于专有模型,而黑箱方法在处理语言上安全但生成有害内容的提示时效果不佳。

核心问题

文本到图像生成中的安全问题主要在于语言上安全的提示仍可能生成有害内容。这一问题被称为良性对抗性问题,现有方法难以有效解决,因为它们通常依赖于语言层面的安全检查。

核心创新

DiSCO通过分布引导的对比提示优化,解决了文本到图像生成中的安全问题。它不需要访问模型内部信息,完全在提示层面操作,通过后缀扩展和对比评分优化生成内容的安全性。

方法详解

  • �� DiSCO在提示层面操作,通过后缀扩展优化提示。
  • �� 使用目标模型生成的安全和不安全图像池进行对比评分。
  • �� 通过迭代反馈调整优化目标,直到生成安全内容。

实验设计

实验在I2P基准测试上进行,评估了DiSCO在多种攻击下的性能。使用NudeNet和Q16作为安全性评估指标,比较了未防御和防御模型的攻击成功率。

结果分析

DiSCO在未防御模型中将ASR从23.6%降至2.4%,在防御模型中从8.3%降至1.7%。同时,实验表明DiSCO在32个系统-攻击设置下均提高了安全性。

应用场景

DiSCO可以应用于任何文本到图像系统,作为一种模块化的黑箱安全增强工具。它不需要改变模型结构,适用于不同架构的生成模型。

局限与展望

DiSCO在处理极端复杂的对抗性提示时可能效果有限。此外,该方法在计算上较为复杂,尤其是在大规模生成任务中。未来可以探索降低计算复杂度的方法。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你有一个食谱,但有时即使按照食谱来,做出来的菜也可能不合口味。DiSCO就像一个聪明的助手,它会根据你做菜的过程给出建议,帮你调整食材和步骤,确保最后的菜既美味又健康。它不需要知道你的厨房设备内部是如何运作的,只需要观察你做菜的结果,并给出优化建议。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,目标是建造一个安全的城市。你有很多建筑材料,但有些材料可能不安全。DiSCO就像一个聪明的助手,它会帮你选择安全的材料,并在建造过程中给出建议,确保你的城市既安全又美观。它不需要知道游戏的内部规则,只需要观察你的建造过程,并给出优化建议。

术语表

DiSCO (分布引导对比提示优化)

一种黑箱防御方法,通过提示优化减少不安全内容生成。

用于优化文本到图像生成的安全性。

ASR (攻击成功率)

衡量生成模型在对抗性攻击下生成不安全内容的比例。

用于评估DiSCO的防御效果。

I2P基准测试

用于评估文本到图像生成模型安全性的标准测试集。

DiSCO在该基准测试上进行性能评估。

NudeNet

一种用于检测不安全内容的图像分类器。

用于评估生成内容的安全性。

良性对抗性问题

语言上安全但生成有害内容的提示问题。

DiSCO旨在解决这一问题。

开放问题 这项研究留下的未解疑问

  • 1 如何在不增加计算复杂度的情况下提高DiSCO的防御效果?
  • 2 DiSCO在其他生成任务中的适用性如何?
  • 3 如何处理极端复杂的对抗性提示?

应用场景

近期应用

文本到图像生成安全增强

DiSCO可立即应用于现有的文本到图像生成系统,提升其安全性,减少不安全内容生成。

远期愿景

跨领域生成任务的安全防御

DiSCO的原理可扩展到其他生成任务,如文本生成和音频生成,提供跨领域的安全防御。

原文摘要

As text-to-image generative models advance, they raise critical safety concerns, particularly the generation of Not-Safe-For-Work (NSFW) content such as violence and nudity, further exacerbated by red-teaming adversarial attacks. Existing defenses predominantly operate under white-box assumptions, relying on text encoder optimization, weight editing, or inference-time intervention, and fundamentally cannot scale to proprietary models. Black-box alternatives based on LLM prompt rewriting offer broader applicability, yet fail in a critical regime we identify as the \textit{benign adversarial} problem: prompts that are linguistically safe but still trigger harmful generation due to the model's learned data distribution. We propose DiSCO, a zero-shot, strictly black-box defense that operates entirely at the prompt level as a plug-and-play module, requiring no model retraining, fine-tuning, or access to model internals. DiSCO performs distribution-guided suffix expansion via beam search, optimized through contrastive scoring over safe and unsafe image pools generated by the target model itself, with iterative adaptive feedback until safe content is produced. We demonstrate that DiSCO consistently enhances the safety of both undefended and defended models on the I2P benchmark under multiple red-teaming attacks, achieving 37.7% and 25.13% ASR reduction, respectively, while maintaining semantic fidelity and improving image coherence. As a black-box, architecture-agnostic module, DiSCO can be readily applied to any text-to-image system without necessitating any changes to the model itself.

cs.AI