核心发现
方法论
本文提出的BLOCK方法通过用训练的转码器替换模型中的瓶颈层,实现对现代扩散和自回归模型(如SD3.5、Flux、Infinity)的概念去除。该转码器在保持模型整体性能的同时,将激活特征结构化,形成内嵌过滤器,能选择性禁用特定概念信号。该方法在白盒访问下具有持久性,避免外部模块带来的不稳定。训练过程采用稀疏正则化和TopK激活机制,确保特征的单义性和可控性。实验中在UnlearnCanvas基准上,BLOCK在风格和对象去除任务中超越现有方法,且支持多概念连续去除,抗对抗性强。
关键结果
- 在Flux(12B参数)模型上,概念去除准确率提升21个百分点,保持生成质量,FID指标与原模型差异极小。
- 在Infinity-8B模型中,去除多样概念后,图像视觉质量无明显下降,CLIPScore保持高水平。
- 支持连续多次去除不同概念,性能稳定,抗对抗提示干扰,优于Weight编辑和外部模块方案。
研究意义
该方法突破了模型内部概念去除的瓶颈,提供一种高效、持久且可扩展的解决方案。其无需重训练整个模型,极大降低成本,适应大规模前沿模型的需求。对AI内容过滤、偏见控制、模型安全等领域具有重要推动作用,有望成为行业标准工具。
技术贡献
核心创新在于用训练的转码器替换模型瓶颈层,形成内嵌过滤机制,避免外部模块易被绕过的问题。训练过程中引入稀疏激活和TopK机制,确保特征的单义性和可控性。该方案兼容多架构、多规模模型,支持多概念连续去除,显著优于Weight编辑和SAE类外部模块,提供理论上的持久性保证。
新颖性
首次将转码器应用于前沿扩散和自回归模型的概念去除,突破了传统Weight编辑的局限,实现模型内部持久、可控的概念屏蔽。该方法在保持生成质量的同时,支持多次连续操作,具有较强的实用性和扩展性。
局限性
- 当前方法依赖白盒访问,模型结构固定,难以应用于黑盒或部分开源模型。
- 转码器训练仍需一定样本和调参,可能在极端概念或复杂场景下表现有限。
- 对极端多概念同时去除的效果仍有待验证,未来需优化多目标优化策略。
未来方向
未来将探索无监督或少样本训练方案,提升泛化能力;结合多模态信息增强概念识别;扩展到视频、3D模型等多媒体内容的概念去除,推动模型安全与内容过滤技术的发展。
AI 总览摘要
随着深度学习模型在图像生成领域的快速发展,前沿的扩散模型(如SD3.5)和自回归模型(如Infinity)已能生成高质量、丰富多样的视觉内容。然而,这些模型在训练时依赖海量互联网数据,难免包含一些不良或敏感的概念。传统的概念去除方法多依赖外部模块或重训练,存在效率低、效果不持久的问题。本文提出的BLOCK方法,通过在模型瓶颈层引入训练的转码器,实现对特定概念的高效、持久屏蔽。该方案在保持图像质量的同时,显著提升了概念去除的准确性和连续性,支持多次多概念操作,抗对抗干扰能力强。实验证明,在多个主流模型上,BLOCK超越现有技术,成为一种实用的行业解决方案。其核心创新在于内部替换架构设计,避免外部模块易被绕过的问题,为模型安全和内容控制提供了新的技术路径。未来,该方法有望推广至多模态、多媒体内容的概念管理,推动AI内容过滤的智能化和标准化发展。
深度分析
研究背景
近年来,深度生成模型如扩散模型(Rombach et al., 2022)和自回归模型(Han et al., 2025)在图像合成中取得突破,推动了视觉内容的丰富与多样。然而,模型在训练数据中不可避免地包含一些不良概念,如不适当对象或版权风格,导致生成内容存在偏差和安全隐患。现有的概念去除技术主要分为外部模块(如SAE)和模型微调(如Weight编辑),但都存在效率低、效果不持久的问题。尤其是在大规模、复杂模型中,如何在保证生成质量的同时实现高效、持久的概念屏蔽,成为行业难题。
核心问题
传统概念去除方法多依赖外部模块或重训练,难以满足大规模模型的效率和持久性需求。Weight编辑在连续多次操作中容易失效,外部模块易被绕过,且难以保证模型内部特征的精确控制。如何在不影响模型整体性能的前提下,实现对特定概念的高效、持久屏蔽,成为当前研究的核心难题。特别是在白盒环境中,模型内部结构的可控性和可解释性尤为重要,现有方案缺乏有效的内部机制支持。
核心创新
本研究提出的BLOCK方法,创新点在于用训练的转码器替换模型中的瓶颈层,形成内嵌过滤器。具体包括:• 设计专门的稀疏激活机制(TopK)确保特征的单义性;• 训练转码器以复制原始层的行为,同时结构化激活特征;• 在模型内部实现概念屏蔽,避免外部模块的可绕过性。这一设计突破了Weight编辑和SAE方案的局限,实现了模型内部持久、可控的概念去除,兼容多架构、多规模模型。
方法详解
- �� 选择模型中的瓶颈层(如SD3.5的条件转换层)作为干预点;• 采集训练数据:用提示通过原模型获得输入输出对;• 训练转码器:引入稀疏正则和TopK激活,优化其复制原层行为;• 识别目标概念的激活特征:通过分析转码器的激活向量;• 实现概念屏蔽:修改decoder的对应列,将目标特征重定向到空白状态,达到去除效果;• 训练完成后,将转码器嵌入模型,形成永久性内部过滤机制。
实验设计
在SD3.5、Flux、Infinity-2B和Infinity-8B模型上,采用UnlearnCanvas基准测试风格和对象去除任务。指标包括去除准确率、保持内容的IRA和CRA、FID、CLIPScore等。训练转码器用80个对象提示,进行100轮训练,调节正则参数以确保特征稀疏。对比UCE、LOCOEDIT等方法,验证BLOCK在连续多次、多概念去除中的稳定性和效果。实验还包括抗对抗提示和多样化场景,确保方案的鲁棒性。
结果分析
在Flux模型中,概念去除准确率提升21个百分点,风格保持一致性,FID与原模型差异极小。Infinity-8B模型多次连续去除不同概念后,生成质量无明显下降,CLIPScore保持在高水平。多模型、多任务验证显示,BLOCK在保持生成质量的同时,显著优于Weight编辑和SAE方案,支持多次连续操作,抗干扰能力强。
应用场景
该技术适用于内容过滤、偏见控制、模型安全等场景,特别是在开源模型和大规模生产环境中。可帮助开发者快速屏蔽不良内容,提升模型的安全性和可信度。未来还可结合多模态信息,实现跨模态的概念管理,推动AI内容审核自动化。
局限与展望
目前方法依赖白盒环境,模型架构固定,难以应用于黑盒或部分开源模型。转码器训练仍需样本和调参,复杂场景下效果有限。多概念同时去除的效果尚需验证,未来需优化多目标训练策略。
通俗解读 非专业人士也能看懂
想象你在厨房里做饭,里面有各种调料和食材。有时候你想去掉某种调料,比如辣椒,但又不想影响整体味道。传统方法就像用外部工具,比如筛子,把辣椒筛掉,但筛子容易漏掉一些,或者筛得太多影响味道。我们的方法像是在厨房里安装了一个智能过滤器,能识别出辣椒所在的部分,然后直接在内部屏蔽它。这样,不管你做多少菜,这个过滤器都能持续工作,确保辣椒不会出现在菜里,而且不会影响其他味道。这个过滤器是专门训练出来的,能精准识别辣椒的特征,既高效又持久。未来,这个过滤器还能帮你屏蔽其他不想要的调料,让厨房变得更干净、更智能。
简单解释 像给14岁少年讲一样
你知道我们用相机拍照后,有时候会出现一些不想要的东西,比如照片里的路人或者广告牌?有时候我们想把这些东西去掉,但用普通的方法就像用橡皮擦,擦不干净还可能把背景也弄乱。这个研究就像发明了一种特别的“滤镜”,可以在照片里找到那些不想要的东西,然后直接把它们屏蔽掉,不会影响其他部分。这个滤镜不是随便贴在照片外面,而是直接装在相机里,成为照片的一部分。这样,无论拍多少照片,它都能持续工作,把不想要的内容屏蔽掉,而且还能连续多次去除不同的内容。它还特别聪明,能抗干扰,不会被一些特殊的“骗术”迷惑。未来,这个技术可以帮我们更好地控制照片内容,让网络上的图片更安全、更干净。
原文摘要
Image generative models are trained on massive, largely uncurated internet-scale datasets that contain undesirable visual concepts. Efficiently removing such concepts from the model generations without degrading the quality of output images remains challenging. We introduce a novel concept removal method for frontier diffusion and image autoregressive models, such as SD3.5, Flux, and Infinity. Our intervention replaces the internal bottleneck layer present in all these modern models with a transcoder that is trained to replicate the original layer while structuring it into distinct activation features. This in-place substitution creates an integrated filter through which concept-specific signals can be selectively disabled while preserving the rest of the model's behavior. Since the intervention modifies the model backbone rather than attaching an external component, it remains persistent under white-box access. Empirically, the approach achieves state-of-the-art concept removal performance across modern diffusion and autoregressive models, maintains visual generation quality, provides robustness against adversarial prompts, and supports sequential removal of diverse concepts. This positions our method as a practical approach for concept removal in frontier image generative models.