Awakening Diffusion Transformers: Eliciting Stronger Generation and Understanding via Massive Activation Modulation

TL;DR

EMA利用DiT的Massive Activations,DG提升细节,MREP改善密集表征;MA干预后BLIP/CLIP胜率仍为0.462/0.512。

cs.CV 🔴 高级 2026-07-03 21 次浏览
Chaofan Gan Zicheng Zhao Yuanpeng Tu Xi Chen Ziran Qin Tieyuan Chen Supavadee Aramvith Mehrtash Harandi Weiyao Lin
扩散Transformer Massive Activations 细节引导 视觉表征 免训练调制

核心发现

方法论

论文分析DiT、SD3、SD3.5、Flux及DiT-XL的隐藏状态,发现MA分布于全部图像token,却集中在固定通道,并与AdaLN残差缩放因子α对齐。提出免训练EMA:生成端以MA驱动Detail Guidance(DG)抑制MA,构造细节缺失的反事实分支;理解端以MREP利用AdaLN通道调制削弱共同方向,并拼接空间归一化MA图。

关键结果

  • MA干预显著削弱纹理、眼睛、头发等局部细节,却基本保持物体身份、颜色和布局。SD3上的BLIPScore与CLIPScore胜率分别为0.462和0.512,说明语义影响有限而细节影响突出。
  • MA存在于各层、训练早期即出现,并跨模型规模保持;其幅度随去噪由高噪声走向低噪声而增加。改变1000个文本提示几乎不改变MA,表明时间步比文本条件更关键。
  • DG可与Classifier-Free Guidance结合,并支持共享前半段计算的partial-forward和token级Local DG;MREP则避免简单删除MA,在压制共同高幅方向的同时保留空间响应。

研究意义

该研究把DiT内部通常被视为异常值的高幅激活,重新解释为具有阶段性和任务依赖性的计算资源。它说明同一组通道在生成时承载精细纹理,在表征提取时却造成token方向塌缩。由此,生成质量与视觉理解不必依赖重新训练或更大模型,而可通过内部激活的定向调制同时改善。其价值在于连接扩散采样、模型可解释性和密集视觉任务,为复用生成模型提供低成本路径。

技术贡献

EMA包含两个互补机制。DG在中间DiT块抑制MA,使用原预测与MA破坏预测之差形成细节方向,其形式对应于CFG的反事实引导:Dθ(zt,c)+w[Dθ(zt,c)-Dθ(ẑt,c)]。MREP不直接丢弃MA,而使用预训练AdaLN的逐通道调制削弱方向支配,再拼接空间归一化MA图。该设计兼顾数值贡献与空间结构,并天然支持CFG、局部token控制及部分前向加速。

新颖性

相较LLM中的token级异常激活、ViT中的register-like token以及传统CFG,本文首次系统地将DiT中的空间分布、通道集中MA统一用于生成和理解。核心新意不是发现大激活本身,而是证明其双重作用,并将“抑制MA生成细节引导”和“调制MA提取表征”置于同一免训练框架中。

局限性

  • 论文展示的定量结果主要包括BLIPScore、CLIPScore胜率0.462/0.512及定性比较;所给文本未列出完整数据集、FID、mAP或具体提升幅度,因此跨基准可重复性信息有限。
  • DG依赖固定MA通道和中间层选择,不同DiT架构、时间步、采样器或通道排列可能需要重新定位;过强抑制也可能损害纹理真实性或引入伪影。

未来方向

未来可在统一公开基准上报告FID、CLIP、VBench、密集匹配和分割指标,系统搜索层、时间步与引导权重。还应研究MA与注意力头、频率信息及量化误差的关系,并发展自适应、模型无关的通道检测和时空Local DG。

AI 总览摘要

扩散Transformer(DiT)已经成为SD3、Flux及视频扩散系统的核心,但研究者仍不清楚哪些内部信号真正决定生成细节,也不清楚为何强大的生成特征在密集匹配和分割中常显得不够区分。本文聚焦Massive Activations(MA):少数通道上的异常大幅值激活。对DiT、SD3、SD3.5、Flux和DiT-XL的分析显示,MA遍布空间token,却集中在固定维度,并与AdaLN残差缩放因子密切对应。

作者发现,MA主要受去噪时间步而非文本提示控制:从高噪声到低噪声阶段,其幅值逐步增强。生成实验表明,破坏MA会明显损伤纹理、眼睛和头发等细节,却保留身份、布局和颜色;在SD3上,受破坏结果的BLIPScore和CLIPScore胜率仍为0.462和0.512。基于此,EMA提出Detail Guidance(DG),通过抑制MA构造“细节不足”的反事实预测,再将原预测推离该分支;它可与CFG结合,并支持Local DG和partial-forward。

在理解任务中,同一高幅方向使不同空间token过度相似。MREP利用AdaLN通道调制削弱方向支配,同时拼接空间归一化MA图,保留有用位置线索。EMA因此把MA从“异常值”转化为可控制的共享信号。论文的意义在于:无需训练即可同时改善DiT的精细生成和密集表征;但完整基准、FID及跨模型定量结果仍需进一步公开验证。

深度分析

研究背景

扩散模型从Latent Diffusion发展到DiT、PixArt-α、SD3和Flux,Transformer也扩展到CogVideoX与Wan等视频系统。与此同时,Stable Diffusion和DiT中间层被用于对应、分割与深度估计。既有工作重视架构和规模,却较少解释隐藏激活如何同时支持生成与理解。

核心问题

MA在LLM或ViT中常被视为token异常或全局语义信号,但DiT对空间网格逐步去噪,每个token都参与局部重建。问题是:MA究竟位于何处、由什么调制、是否承载语义或细节,以及为何它们既可能帮助生成又损害密集特征判别。

核心创新

  • ��发现MA空间分布、通道集中、与AdaLN对齐且主要受时间步控制。
  • ��提出DG,将MA抑制分支作为细节缺失反事实,区别于主要增强文本对齐的CFG。
  • ��提出MREP,以通道调制降低共同方向,并保留归一化MA空间图;同一MA信号因任务不同而分别被抑制或重编码。

方法详解

  • ��输入:噪声潜变量zt、时间步t和条件c,经DiT块得到zk。
  • ��分析:依据zk+1=zk+αkDk(zk,t,c),比较隐藏激活与AdaLN残差缩放αk,检验层、通道、时间步和文本影响。
  • ��DG:在中间块将MA维度置零或扰动,获得ẑt;用Dθ(zt,c)-Dθ(ẑt,c)构造细节方向,并与CFG线性组合。
  • ��Local DG:仅调制指定空间token;partial-forward共享干预前计算。
  • ��MREP:使用AdaLN通道调制抑制MA方向,拼接空间归一化MA图形成密集表征。

实验设计

实验覆盖图像生成、视频生成、局部细节修复及密集视觉理解。分析对象包括DiT-XL/2、SD3、SD3.5和Flux;图2使用1000个文本提示统计激活。生成比较MA破坏与同数量非MA维度扰动,并采用BLIPScore、CLIPScore衡量提示对齐,HPSv2.1和LAION-Aesthetics衡量局部质量。理解部分考察对应、语义分割和深度估计;同时比较有无MREP及不同引导组合。

结果分析

MA破坏会降低纹理和微小部件质量,而非MA随机扰动影响很弱。SD3受破坏输出的BLIPScore、CLIPScore胜率为0.462、0.512,支持“MA偏细节而非全局语义”的结论。MA跨层、跨规模且训练早期出现;其幅度主要随时间步变化。MREP在视觉比较中改善语义一致性和空间区分度,DG则提供全局和局部细节控制。

应用场景

图像与视频生成系统可直接加入DG,无需重新训练;CFG负责语义对齐,DG负责纹理和小物体部件。交互式编辑可用Local DG只增强面部、文字或指定区域。将MREP接入预训练DiT特征提取器,可服务密集对应、语义分割、深度估计和感知匹配。

局限与展望

论文给出的材料未包含完整数据集清单、FID/VBench或下游数值表,因而无法判断所有场景的增益规模。MA通道和干预层可能依赖具体checkpoint;不同模型需要重新分析。DG增加部分后向路径计算,Local DG也需可靠token定位。未来应建立标准化评测,研究自适应MA检测、视频时空调制及与量化和采样器的协同。

通俗解读 非专业人士也能看懂

把DiT想成一座制作图片的工厂。每个小图块是一名工人,工厂会在很多轮检查中把一张模糊草图变清楚。工人手里有许多工具,但其中少数工具特别强,能把头发、眼睛、布料纹理等小地方做得很精细;这些工具就是MA。它们并不主要决定“这是猫还是狗”或物体放在哪里,而更像最后的精修工具。

EMA有两种用法。第一种是暂时拿走这些强工具,得到一张细节不足的图片,再把原图和这张图比较,找出缺少的精细部分,沿着这个方向加强。这样既能和普通的文字引导一起工作,也能只修脸部或某个区域。第二种用于识别图片:如果每个工人都使用同一组强工具,大家的工作记录会太相似,机器就难以分辨不同位置。MREP会降低这些共同工具的声音,同时保留它们在不同位置留下的图案,因此既不浪费信息,也让各区域更容易区分。

简单解释 像给14岁少年讲一样

想象你在玩一个把像素画变成高清图的游戏。游戏会一关一关地修图:先决定大概是什么东西,再慢慢补上头发丝、衣服纹理和小零件。研究者发现,游戏里有几根“超级画笔”,它们在所有小方格上都能用,但特别擅长补细节。这些画笔就是MA。

如果直接把超级画笔关掉,图片还是一只猫、一个人或一辆车,位置和颜色也大致没变,可是眼睛、毛发和纹理会变糊。于是EMA先做一张“没有超级画笔”的版本,再比较两张图哪里少了东西,然后专门把这些细节补回来。这叫DG,还能只修你选中的脸、文字或物体区域;普通CFG则更像检查图片有没有符合文字要求。

但在做图片识别时,超级画笔又会带来麻烦:所有小方格都留下很像的痕迹,电脑会觉得它们差不多。MREP不会把这些痕迹全删掉,而是把声音调小,再保留它们在不同位置形成的地图。这样电脑更容易判断哪里是眼睛、哪里是背景。最酷的是,EMA不用重新训练模型,就能同时让图片更精细、特征更好用!

术语表

Massive Activations(大幅激活)

隐藏状态中幅值远高于其他维度的激活。它们在DiT中跨空间token出现,却集中于少数固定通道。

论文分析其空间、通道和时间步属性,并将其作为EMA的调制信号。

Diffusion Transformer(扩散Transformer,DiT)

用Transformer作为扩散模型去噪器的架构。它在潜空间中逐步预测并移除噪声。

SD3、Flux和视频模型均被作为代表性DiT分析。

AdaLN

根据时间步和条件生成通道级缩放与平移的自适应层归一化。其残差缩放α决定不同通道的更新强度。

MA峰值与α对齐,论文据此解释MA来源。

Detail Guidance(DG,细节引导)

通过抑制MA构造细节不足的反事实预测,再用两种预测的差异增强采样。它类似CFG,但目标是局部视觉细节。

DG支持CFG组合、partial-forward和Local DG。

MREP

MA-modulated REPresentation extraction的缩写。它削弱MA共同方向,并拼接空间归一化MA图。

用于从预训练DiT提取更具空间区分性的密集特征。

Classifier-Free Guidance(CFG)

通过条件预测与无条件预测之差增强提示或类别对齐的采样方法。其目标主要是语义一致性,而非专门补细节。

EMA将DG作为CFG的互补引导。

开放问题 这项研究留下的未解疑问

  • 1 不同DiT、采样器和时间步是否存在可迁移的MA通道规律仍不清楚;需要公开统一评测及自动通道定位方法。
  • 2 MA与注意力头、频率成分和量化误差的因果关系尚未确定,现有分析主要是干预实验而非完整机制证明。
  • 3 MREP在具体分割、对应和深度数据集上的提升幅度未在所给文本中列出,需补充标准下游指标。

应用场景

近期应用

高细节图像与视频生成

模型提供方可在现有SD3、Flux或视频DiT采样器中加入DG,不改变训练权重。CFG继续负责文字对齐,DG增强纹理;Local DG适合脸部、文字和产品局部修复。

预训练扩散特征提取

视觉算法团队可用MREP替代原始DiT隐藏状态,提取更适合密集对应、语义分割和深度估计的特征。前提是能访问中间层并确定时间步和AdaLN调制。

远期愿景

统一的生成—理解基础模型

未来模型可把MA视为可编程接口:生成时控制细节,理解时控制特征方向,从而减少为生成与识别分别训练大型模型的需求。

原文摘要

Massive Activations (MAs) have been widely observed in Transformer-based models, yet their structure and functional roles in Diffusion Transformers (DiTs) remain insufficiently understood. In this work, we systematically analyze MAs in representative DiTs and find that they are spatially distributed across image tokens while concentrated in a small set of fixed feature dimensions. We further show that these dimensions are closely aligned with AdaLN residual scaling factors and are primarily modulated by the denoising timestep rather than text conditions. This structure leads to two task-dependent effects: for generation, MAs are critical for fine-grained detail synthesis while having limited influence on global semantics; for understanding, their shared high-magnitude directions make raw DiT features overly similar across spatial tokens and weaken dense feature discrimination. Based on these findings, we introduce Eliciting Massive Activation (EMA), a training-free framework that leverages Massive Activations (MAs) as a unified modulation signal to improve both generative and representational capabilities of DiTs. For generation, EMA proposes MA-driven Detail G}uidance (DG), which suppresses MA dimensions to construct a detail-deficient counterfactual prediction and guides sampling toward finer visual details. DG further supports efficient partial-forward inference, integration with classifier-free guidance, and token-level Local DG for refining selected image regions. For understanding, EMA introduces MA-modulated REPresentation extraction (MREP), which uses pretrained AdaLN channel-wise modulation to reduce MA directional dominance and concatenates spatially normalized MA maps to preserve useful spatial structure. Extensive experiments demonstrate that EMA consistently improves both the generation quality and representation capability of DiTs.

cs.CV