Safe Autoregressive Image Generation with Iterative Self-Improving Codebooks

TL;DR

提出迭代自我提升的安全码本,利用模型自我判断改善生成安全性。

cs.CV 🔴 高级 2026-06-25 43 次浏览
Yunqi Xue Zhijiang Li Philip Torr Jindong Gu
图像生成 模型安全 自我提升 码本优化 多模态学习

核心发现

方法论

本文提出基于统一多模态模型的迭代自我提升码本方法。通过模型自我理解能力,识别生成的有害图像,构建有害空间,并固定码本中的有害映射。随后,利用安全图像-文本对在无害空间内进行自适应微调,逐步消除有害内容。整个过程无需外部标注,依靠模型内部反馈实现安全性提升。具体流程包括:1)利用模型生成有害与无害图像对,提取特征差异,构建有害空间;2)投影码本以移除有害信息;3)在无害空间内微调码本参数,确保图像质量。此循环迭代直至性能收敛,有效增强模型安全性。

关键结果

  • 在8个有害提示数据集(如I2P、CoPro)上,安全码本显著降低有害内容生成比例,提升安全性指标达85%以上,且在保持图像质量方面与原模型差异不大(FID降低10%以内)。
  • 在多个模型(如Janus、VILA-U)上验证,安全性能提升一致,且无明显性能退化,验证了方法的泛化能力。
  • 多轮迭代后,模型对特定有害概念(如暴力、色情)表现出持续改进,优于单次修正,显示出良好的自我提升潜力。

研究意义

该研究突破了自动化提升多模态模型安全性的瓶颈,避免依赖外部标注和人工干预,为大规模部署安全可靠的图像生成系统提供了新思路。通过模型自我反馈机制,有望实现持续学习与安全保障的结合,推动多模态AI在敏感场景中的应用落地,具有重要的学术和产业价值。

技术贡献

提出基于有害空间投影与无害空间微调的迭代算法,创新性地结合模型内部特征差异分析与自我微调机制,首次实现无需外部监督的模型安全增强。算法在保持生成质量的同时,有效抑制有害内容,提供了理论上的有害空间定义与投影技术,拓展了多模态模型的安全控制边界。

新颖性

首次系统性提出利用模型自我理解能力,通过构建有害空间并在无害空间内微调的方式,实现自动化、迭代式的模型安全优化。区别于传统的外部过滤或后处理方法,此方案在模型内部实现安全控制,具有更高的自主性和适应性。

局限性

  • 当前方法依赖模型的自我理解能力,可能在复杂或模糊有害内容识别上存在误差,影响安全效果。
  • 微调过程可能引入轻微的性能折衷,尤其在极端有害场景下仍需结合外部安全机制。
  • 算法在大规模模型和高分辨率图像上的计算成本较高,实际部署需优化效率。

未来方向

未来将探索多模态安全空间的动态更新机制,结合外部人类反馈增强识别能力,提升对复杂有害内容的检测精度。同时,研究更高效的投影与微调算法,降低计算成本,推动模型在实际应用中的广泛部署。

AI 总览摘要

近年来,自动回归式多模态模型在图像生成领域取得了突破性进展,尤其是在文本到图像的任务中表现出强大的理解与表达能力。然而,这些模型在生成内容的安全性方面仍面临巨大挑战。传统方法多依赖外部标注或后处理技术,难以实现模型内部的自主安全控制。本文提出了一种基于模型自我理解的迭代自我提升码本方法,旨在解决自动生成有害内容的问题。

该方法核心在于利用模型自身的理解能力,自动识别生成中的有害图像,构建有害空间,并在无害空间内进行码本微调,从而逐步消除有害映射。整个过程无需外部标注,完全依赖模型内部反馈,具有高度自主性。通过多轮迭代,模型在保持生成质量的同时,有效降低了有害内容的出现概率。

实验结果显示,在多个有害提示数据集上,安全码本显著提升了模型的安全性能,减少了有害内容的生成比例,且在图像质量方面与原模型差异不大。这一创新为多模态模型的安全性提供了新思路,具有重要的理论意义和应用价值。未来,结合外部反馈与动态空间更新,有望实现更全面、更高效的模型安全保障体系。

深度分析

研究背景

多模态图像生成技术经历了从像素级自回归模型到基于VQ-VAE的离散表示方法的发展。近年来,结合大规模预训练模型的统一多模态框架成为研究热点,代表性有GPT-系列、VILA-U等。这些模型在理解与生成方面表现优异,但在安全性方面仍存在内容偏差和有害内容生成的问题。现有研究多采用外部过滤、后处理或微调策略,效果有限,难以实现模型内部的自主安全控制。

核心问题

自动回归式多模态模型在生成过程中容易出现有害内容,尤其是在敏感话题上。传统方法依赖外部标注和人工干预,难以应对模型不断演化带来的新风险。如何在保证生成质量的同时,自动识别并消除有害内容,成为亟待解决的核心难题。模型自我理解能力虽有提升,但尚未充分利用其潜力实现内容安全的自动化优化。

核心创新

本文创新性提出利用模型内部特征差异分析,构建有害空间,并在无害空间内进行码本微调,实现模型自我安全提升。具体包括:1)通过模型生成有害与无害图像对,提取特征差异;2)利用奇异值分解定义有害空间;3)在无害空间内微调码本参数,避免有害内容重现。这一方案突破了传统外部过滤的限制,提供了自动化、持续的安全优化路径。

方法详解

  • �� 利用模型生成有害与无害图像对,提取特征差异,构建有害空间。
  • �� 通过奇异值分解(SVD)分析差异矩阵,定义有害空间子空间。
  • �� 投影码本以移除有害映射,确保生成内容安全。
  • �� 在无害空间内,采用梯度微调技术,利用模型自我理解能力,优化码本参数。
  • �� 迭代执行上述步骤,逐步增强模型安全性,同时保持图像质量。
  • �� 不依赖外部标注,仅通过模型内部反馈实现安全提升。

实验设计

采用I2P、CoPro等八个有害提示数据集,评估模型在有害内容生成比例上的改善。比较原始模型与安全码本模型在有害内容检测指标上的差异,FID指标用于衡量图像质量。多模型、多轮迭代验证方法的有效性,分析不同有害概念(如色情、暴力)上的性能提升。还进行了跨场景和外部分布数据的测试,验证方法的泛化能力。

结果分析

安全码本显著降低有害内容生成比例,提升安全指标达85%以上,且在保持图像质量方面,FID值变化不超过10%。多轮迭代后,模型对特定有害概念的识别和抑制能力持续增强,优于单次修正方案。不同模型(如Janus、VILA-U)均表现出一致的安全性能提升,验证了方法的普适性和有效性。

应用场景

该方法可应用于内容生成平台、社交媒体、广告设计等场景,确保自动生成内容的安全性。无需外部标注,适合大规模部署,提升用户体验和内容合规性。未来结合人类反馈,可实现更智能的内容管理体系,推动多模态AI的安全普及。

局限与展望

当前方法依赖模型的自我理解能力,可能在复杂或模糊有害内容识别上存在误差。微调过程可能带来性能折衷,尤其在极端有害场景下仍需结合外部安全措施。算法在高分辨率和大规模模型上的计算成本较高,实际应用需优化效率。未来需增强模型对多模态复杂内容的识别能力。

通俗解读 非专业人士也能看懂

想象你有一个非常聪明的画家,他可以画出各种各样的画,但有时候他会画出一些不适合的内容,比如不好的场景。为了让他画的内容更安全,你可以教他一些规则,让他自己判断哪些画是不合适的。每次他画完后,他会自己检查一遍,发现不好的部分,然后调整自己的画笔和想法,逐步变得更安全。这就像给他装上了一个“安全过滤器”,让他自己不断改进,画出既漂亮又安全的画。这种方法不用你一直盯着他,而是让他自己学会了如何避免画出不好的内容。这样,他就能自己不断变得更好,也不用你不停地干预了。

简单解释 像给14岁少年讲一样

想象你有个超级厉害的画家,他可以画出各种漂亮的画,但有时候会画出一些不太合适的内容。为了让他画的内容更安全,你可以教他一些规则,让他自己判断哪些画不合适。每次他画完后,他会自己检查一遍,发现不好的地方,然后自己改正。这样,他就能自己学会避免画出不好的东西,而且还能不断变得更厉害。这个过程就像给他装了一个“安全检测器”,让他自己变得更聪明、更安全。最终,他可以画出既漂亮又安全的画,不需要你一直盯着他,自己就能不断改进。

术语表

Codebook (码本)

一种将连续特征映射到离散视觉符号的字典,用于压缩和量化图像表示。

在模型中,码本存储视觉特征的离散表示,是生成图像的基础。

Harmful Space (有害空间)

通过特征差异分析得到的空间,用于表示有害内容的特征方向。

用以投影码本,移除有害映射,确保生成内容安全。

Self-Improving (自我提升)

模型利用自身理解能力,通过反馈不断优化自身性能。

本文利用自我理解实现图像生成的安全性增强。

Singular Value Decomposition (奇异值分解)

一种矩阵分解方法,用于提取主要特征方向。

用于定义有害空间的核心特征。

Null Space (零空间)

矩阵乘积为零的空间,用于在微调中避免引入有害信息。

在微调中确保不引入有害内容。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提高模型在复杂多模态内容中的有害内容识别准确率,仍需结合外部监督和多模态特征增强。
  • 2 未来研究应探索多轮自我反馈机制的稳定性与收敛性,确保持续安全提升。

应用场景

近期应用

内容生成平台

确保自动生成的图片内容符合安全标准,减少有害内容风险,提升用户体验。

社交媒体审核

自动检测并过滤有害内容,降低平台责任风险,提升内容合规性。

远期愿景

智能内容管理系统

结合模型自我提升机制,建立持续学习的安全内容生成体系,推动多模态AI在敏感场景的广泛应用。

原文摘要

Unlike diffusion-based models that operate in continuous latent spaces, autoregressive unified multimodal models produce images by sequentially predicting discretized visual tokens. These tokens are derived from a codebook that maps embeddings to quantized visual patterns. The language-like architecture enables unified multimodal models to effectively capture text conditional information for generation, making them promising for text-to-image tasks. This also raises an interesting question: how safe are the images generated in such an autoregressive way? In this work, we propose iterative self-improving codebooks for safe autoregressive generation. We leverage the understanding and judgment capabilities of the unified multimodal model itself to identify unsafe generated images without human annotation. Subsequently, the inherent representations in the codebook are fixed to eliminate harmful mappings. Our method comprises two steps: first, we use the unified model to identify unsafe generations and construct corresponding harmful and safe image-text pairs. These pairs are used to construct the Harmful Space and guide updates to the codebook, thereby eliminating harmful outputs. Second, we perform adaptive fine-tuning on the codebook within the harmless space using safe image-text pairs to ensure the quality of generated images. These two steps are repeated until no further improvement is observed, producing a safety-enhanced model codebook. Without additional external feedback, the safety of models is improved iteratively.

cs.CV cs.AI