Obliviate: Erasing Concepts from Autoregressive Image Generation Models

TL;DR

Obliviate方法在自回归图像生成中有效删除概念,RAB基准上裸露率从91.58%降至3.15%。

cs.CV 🔴 高级 2026-06-27 37 次浏览
Hossein Shakibania Jonas Henry Grebe Tobias Braun Ege Aktemur Saleh Aslani Mehmet Görkem Yiğit Marcus Rohrbach
概念删除 自回归 图像生成 安全性 多模态

核心发现

方法论

Obliviate方法通过KL监督视觉标记分布、全自回归轨迹更新和对齐视觉前缀实现概念删除。该方法在自回归图像生成中引入伪无条件分支,使用平滑的KL目标函数来稳定目标构建。

关键结果

  • 在RAB基准上,Obliviate将裸露检测率从91.58%降低到3.15%,同时保持模型的整体效用。
  • 在Liquid、Emu3-Gen和Janus-Pro模型上,Obliviate在去除显性内容、暴力内容和品牌图像方面表现优于现有方法。
  • 通过全轨迹更新,Obliviate在20步内实现了快速有效的概念删除。

研究意义

该研究填补了自回归图像生成中概念删除的空白,提供了一种有效的方法来删除不安全或法律敏感的概念。Obliviate方法在保持生成质量的同时,提供了灵活且持久的模型行为编辑方式。

技术贡献

Obliviate通过对齐视觉前缀和全轨迹KL监督,解决了自回归序列建模与视觉生成之间的动态平衡问题。该方法在自回归图像生成中实现了概念删除的技术突破。

新颖性

Obliviate是首个在自回归图像生成中成功实现概念删除的方法,其创新在于引入伪无条件分支和全轨迹更新,解决了以往方法在自回归环境中的不稳定性。

局限性

  • Obliviate在处理非常复杂的视觉概念时可能会出现性能下降,因为这些概念可能需要更复杂的模型调整。
  • 该方法在不同模型之间的参数调优可能需要额外的努力。

未来方向

未来的研究可以探索Obliviate在更大规模的多模态模型中的应用,并研究其在实时生成系统中的有效性。

AI 总览摘要

生成式AI模型的广泛应用引发了对不当使用的担忧,特别是生成不安全或令人不安的图像。现有的概念删除方法主要集中在扩散模型上,而自回归图像生成中的概念删除仍未得到充分探索。Obliviate方法通过KL监督视觉标记分布、全自回归轨迹更新和对齐视觉前缀,实现了自回归图像生成中的概念删除。实验结果表明,Obliviate在去除显性内容、暴力内容和品牌图像方面表现优于现有方法,同时保持了模型的整体效用。该研究填补了自回归图像生成中概念删除的空白,为生成模型的安全性提供了新的解决方案。

深度分析

研究背景

近年来,图像生成技术迅速发展,现代模型在逼真度和可控性方面取得了显著进步。然而,随着图像生成能力的增强,生成不安全或法律敏感概念的风险也随之增加。概念删除旨在从预训练的生成模型中移除特定的不安全能力,同时保持其生成质量。

核心问题

尽管扩散模型中的概念删除研究已经成熟,但自回归图像生成中的相应方法仍未得到充分探索。自回归模型在视觉-语言统一架构中的重要性日益增加,因此亟需一种有效的方法来解决这一安全性问题。

核心创新

Obliviate方法通过引入伪无条件分支和全轨迹KL监督,解决了自回归序列建模与视觉生成之间的动态平衡问题。该方法在自回归图像生成中实现了概念删除的技术突破。

方法详解

  • �� 使用KL监督视觉标记分布,确保生成的图像标记远离不安全概念。
  • �� 通过全自回归轨迹更新,利用完整生成路径上的监督信号。
  • �� 对齐视觉前缀,稳定目标构建,识别和更新维持不良概念的标记。

实验设计

在Liquid、Emu3-Gen和Janus-Pro三种自回归文本到图像模型上进行评估,涵盖显性内容、暴力内容和品牌图像的删除。使用RAB和Unbranding等基准进行测试,确保方法的有效性和鲁棒性。

结果分析

在RAB基准上,Obliviate将裸露检测率从91.58%降低到3.15%。在去除显性内容、暴力内容和品牌图像方面,Obliviate在所有测试模型上均优于现有方法。

应用场景

Obliviate可以用于任何需要生成安全图像的场景,包括社交媒体内容审核、广告生成和自动化设计等领域。

局限与展望

尽管Obliviate在概念删除方面表现出色,但在处理非常复杂的视觉概念时可能会出现性能下降。此外,不同模型之间的参数调优可能需要额外的努力。

通俗解读 非专业人士也能看懂

想象一个工厂,它生产各种各样的产品。有时,这些产品中会有一些不合适的,比如带有不当内容的图像。Obliviate就像一个智能的质量检查员,它能识别并移除这些不合适的产品,而不影响其他正常产品的生产。通过对产品进行全面检查,Obliviate确保每个产品都符合安全标准。

简单解释 像给14岁少年讲一样

嘿,小伙伴!想象一下你在玩一个游戏,游戏里有个角色生成器,可以创建各种角色。有时候,你可能不想要某些角色出现,比如那些不太合适的角色。Obliviate就像一个超级智能的助手,它能帮你去掉这些不想要的角色,同时保留其他有趣的角色。是不是很酷?

术语表

自回归模型

一种通过预测下一个标记来生成序列的模型。

用于生成图像时,预测下一个视觉标记。

KL散度

衡量两个概率分布之间差异的指标。

用于监督视觉标记分布。

概念删除

从生成模型中移除特定不安全概念的过程。

用于确保生成图像的安全性。

视觉前缀

生成图像时使用的初始视觉标记序列。

用于对齐条件和无条件分支。

全轨迹更新

在整个生成路径上进行监督信号更新的方法。

用于提高概念删除的效率和效果。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模的多模态模型中应用Obliviate?
  • 2 实时生成系统中Obliviate的有效性如何?

应用场景

近期应用

社交媒体内容审核

使用Obliviate来确保生成的图像不含不当内容,提高平台的安全性。

远期愿景

自动化设计

在广告生成和设计中应用Obliviate,确保生成内容符合品牌和法律标准。

原文摘要

The widespread adoption of generative AI models has intensified concerns about misuse, including the creation of unsafe or disturbing imagery. To mitigate such issues, several concept erasure approaches have been proposed to remove harmful content from multimodal generative models. Yet concept erasure for autoregressive image generation remains largely unexplored, despite the growing relevance of these models in recent trends toward unified multimodal architectures. In this work, we fill this gap by introducing Obliviate, a guidance-based concept erasure method for autoregressive image generation. Our method builds on three key design choices: KL-based supervision over visual token distributions, trajectory-level updates over full autoregressive rollouts, and aligned visual prefixes for stable target construction. We evaluate Obliviate on three state-of-the-art autoregressive text-to-image models, Liquid, Emu3-Gen, and Janus-Pro, covering the erasure of explicit content, graphic violence, and branded imagery. Obliviate consistently outperforms current alternatives, reducing nudity on the defensive RAB benchmark from 91.58 to 3.15 while preserving overall model utility.

cs.CV