A Decomposable Probe for Few-Step Diffusion Models: Prompt, Latent, and Score Selectivity across Backbone Families and Distillation Paradigms

TL;DR

Decomposable Probe以三层扰动揭示:潜变量层识别整流流,分数层反映蒸馏目标。

cs.CV 🔴 高级 2026-07-03 18 次浏览
Patrick Mu Haojie
扩散模型 少步蒸馏 整流流 可分解探针 生成模型诊断

核心发现

方法论

论文提出训练无关的Decomposable Probe,通过forward hook在提示编码器、去噪器输入latent和去噪器输出score三层注入mean、variance、scale三类扰动,强度为0.05、0.1、0.2、0.3、0.5、1.0。输出经Inception-v3 pool3特征表示,以bootstrap-median Bures W2^2选择性比值衡量均值扰动相对高阶扰动的优势。

关键结果

  • 在23个模型、5类骨干和3类架构上,prompt层所有模型均对均值扰动敏感,峰值约2.7–26,但无法区分预测类型或蒸馏范式。
  • latent层仅在SD3.5与FLUX整流流模型上形成持续低至中强度带,R>1;PixArt-α最高仅1.13(s=0.1),未满足持续带标准,说明宽T5条件并非原因。
  • score层在UNet的规范4步比较中区分ADD与非ADD;此外,LCM和Flash出现s≤0.1的轨迹滚动早期峰值,而SD3.5-Turbo与FLUX-schnell控制组没有该峰值。

研究意义

传统FID或CLIP只给出端到端标量,无法说明少步学生究竟改变了提示响应、潜变量处理还是分数函数。该探针把质量差异转化为可定位的行为读数,并在跨骨干、架构、步数和蒸馏目标的统一估计器下比较。结果表明,蒸馏并非单一退化过程:预测类型主要体现在latent层,训练目标主要体现在score层,为模型审计、方法比较和蒸馏机制研究提供更细粒度工具。

技术贡献

核心技术是对每个单元使用完整Bures W2^2高斯距离,并在200次GPU float64 bootstrap中直接计算比值,以bootstrap中位数及5/95百分位区间作为统一统计对象。选择性比值R=amp_mean/max(amp_var,amp_scale),避免不同模型间原始距离尺度不可比。持续带判据要求低中强度四点中至少三点Rlo>1且至少一点s≥0.2,从而抑制孤立异常值。

新颖性

新颖性不在提出新的生成器,而在建立可分解、跨骨干且可复核的行为诊断仪器。相较只报告FID、CLIP或单一归因指标,论文首次在该规模的少步扩散扫描中系统分离prompt、prediction type与distillation objective,并用 matched estimator和置信区间支持结构化比较。

局限性

  • 实验仅覆盖23个checkpoint和MS-COCO字幕;区间主要反映固定种子、采样器与checkpoint下的提示重采样不确定性,不包含训练或跨种子变异。
  • 结论是该扫描范围内的经验规律,不等于因果证明;score层ADD结果是4步二元对比,不能推广为五种范式排名或直接外推到1步。
  • Inception特征采用高斯假设,且未使用多重比较校正;探针尚未验证其能改善训练或下游任务。

未来方向

未来可扩展到更多预测参数化、采样器、文本编码器和随机种子,并引入DINOv2等独立多样性指标。进一步可研究层间扰动的因果关系、训练时纠偏,以及用探针预测人类偏好、提示遵循和蒸馏稳定性。

AI 总览摘要

少步扩散模型把约50次网络评估压缩到1–8次,但FID或CLIP这类单一数字无法解释质量损失来自哪里。Patrick Mu Haojie提出Decomposable Probe,将模型响应拆成提示、潜变量和分数三层,并以统一统计量比较教师与学生。

探针在三层分别注入mean、variance、scale扰动,强度覆盖0.05至1.0;生成图像映射到2048维Inception-v3特征,计算bootstrap-median Bures W2^2比值。23个模型涵盖SDXL、SD1.5、SD3.5、PixArt-α和FLUX,包含UNet、DiT、MMDiT及五种蒸馏范式。

结果显示,prompt层是普遍的“健康检查”而非分类器;latent层在SD3.5和FLUX上形成持续R>1带,识别整流流且能穿过ADD蒸馏保留;PixArt-α控制排除了宽T5解释。score层则捕捉ADD与轨迹滚动目标的差异。该工具因此把黑箱式质量比较推进到机制化模型审计,但仍需更广泛数据和跨种子验证。

深度分析

研究背景

扩散模型通常需要20–50步采样。ADD/Turbo、LCM、DMD2、Hyper-SD和Flash Diffusion将推理压缩至1–8步,却常以FID、CLIP概括代价。相关工作改善了速度与一致性,但没有回答模型究竟改变了哪类条件响应。

核心问题

相同的端到端分数可能来自提示理解下降、latent动力学变化或score估计被蒸馏目标重塑。若不控制骨干、架构、预测类型和步数,跨模型比较还可能把架构差异误认为蒸馏效应。

核心创新

论文提出三层可分解探针,并把响应拆成prompt、latent、score因素。其关键创新是以均值扰动对方差和缩放扰动的相对优势定义R,而非比较不可比的原始距离;同时以统一bootstrap-median Bures估计器保证跨23模型的CI可引用性。

方法详解

  • �� Prompt层:对文本编码器隐藏状态注入一次扰动。
  • �� Latent层:在每个去噪步的输入处注入扰动。
  • �� Score层:在每步预测ε或velocity的输出处注入扰动。
  • �� 模式:x+sμ̂、x+sσ̂ε、(1+s)x。
  • �� 指标:R=amp_mean/max(amp_var,amp_scale),距离为2048维Inception-v3特征上的Bures W2^2。
  • �� 统计:每格进行200次bootstrap,报告中位数及5/95百分位区间。

实验设计

实验使用约2,000条MS-COCO 2014验证集字幕,有效样本约1,500–2,000。SD1.5、SDXL使用512²,其余模型使用1024²。23个checkpoint包括5名教师和18名学生,覆盖UNet、DiT、MMDiT、五类骨干及ADD、trajectory、distribution-match、mixed、backward-sim等范式。

结果分析

所有模型prompt层均有均值选择性,峰值约2.7–26。latent层中,SDXL和SD1.5始终低于1,PixArt-α仅在s=0.1达到1.13;只有SD3.5和FLUX形成持续低中强度带。4步UNet比较中ADD为同族最低;LCM与Flash出现早期score峰值。

应用场景

研究者可用它审计蒸馏学生、定位质量损失、比较新预测参数化,并在发布模型时提供行为指纹。工程团队可将per-cell表格用于回归测试,例如检查新训练版本是否破坏整流流特征、ADD对比或提示均值响应。

局限与展望

探针依赖Inception特征的高斯Bures距离,且只测固定checkpoint下的提示重采样不确定性。样本、骨干和蒸馏方法仍有限,未做家族错误率校正,也没有证明探针读数能直接提升模型训练。未来应扩大模型谱系、加入独立多样性通道,并进行跨种子及因果干预验证。

通俗解读 非专业人士也能看懂

把模型想成一家把文字变成图片的工厂。第一道门负责读订单,第二道门负责搬运半成品,第三道门负责给工人下达每一步加工指令。研究者分别轻轻改变这三道门的输入,再看最后产品离正常产品有多远,并把“整体改动”与“随机抖动或整体放大”比较。

他们检查了23家工厂。读订单的门几乎都能感受到平均变化,所以只能说明机器没有完全失灵。真正有用的是第二道门:SD3.5和FLUX对这种改变的反应呈现连续一段明显模式,而其他机器没有;即使经过ADD快速训练,这个模式仍保留。第三道门则更像工厂的生产管理风格,能显示机器采用了哪种训练流程。

因此,这项工作不是给图片打一个总分,而是像给工厂做分层体检:告诉我们问题发生在读单、搬运,还是执行指令。

简单解释 像给14岁少年讲一样

想象你在玩一个“文字变图片”的游戏。普通模式要游戏机慢慢算大约50轮,快速模式只算1到8轮,当然可能更容易画错。以前大家只看最后得分,却不知道错在读懂文字、处理中间画面,还是最后一步画图。

这篇论文设计了三把“测试尺”。第一把改动游戏机读到的文字,第二把改动它正在处理的半成品,第三把改动它准备执行的画图指令。每把尺子都有轻微、中等和强烈测试,再比较平均改动是否比随机摇晃更有影响。

研究者测试了23个模型。结果很酷:第二把尺子几乎能分出SD3.5和FLUX这类整流流模型;PixArt-α虽然也用很宽的T5文字系统,却没有同样结果,所以关键不是文字系统。第三把尺子能看出ADD这种训练方法,还能发现LCM、Flash在很早的微小测试处特别敏感。

这就像修游戏时不只说“总分下降了”,而是指出是哪一关出了问题。不过测试仍只看了一批模型和图片,未来还要在更多游戏机、更多随机情况上确认。

术语表

Decomposable Probe(可分解探针)

一种不训练模型、只在前向计算中加入受控改动的诊断工具。它把模型行为拆为多个位置和扰动模式。

论文用于分离prompt、latent和score层的响应。

Rectified Flow(整流流)

通过学习从噪声到数据的连续速度场来生成样本的扩散式方法。它不同于传统ε-prediction参数化。

SD3.5和FLUX的latent指纹对应此预测类型。

Bures W2^2

高斯分布之间平方二阶Wasserstein距离的闭式形式,比较均值与协方差。

论文在2048维Inception特征上计算它。

Selectivity Ratio(选择性比值)

R=均值扰动距离除以方差和缩放扰动距离中的较大者。R>1表示均值扰动更主导。

latent持续带判据和score比较均使用R。

ADD

Adversarial Diffusion Distillation,通过对抗判别器及教师相关score损失训练少步学生。

ADD学生在score层呈现低端信号,但保留整流流latent指纹。

Trajectory Rollout(轨迹滚动)

训练时让学生或生成样本沿多步轨迹运行,并回归或保持轨迹片段。

LCM和Flash的score层出现早期强度峰值。

开放问题 这项研究留下的未解疑问

  • 1 latent层为何对整流流形成持续带,仍缺乏严格机制解释;需要结合速度场几何和中间状态分析。
  • 2 score层读数是否能预测人类偏好、提示遵循或训练稳定性,论文尚未进行下游验证。
  • 3 结果是否跨采样器、随机种子、分辨率和更大模型规模保持,需要系统复现实验。

应用场景

近期应用

蒸馏模型回归测试

模型开发者可固定MS-COCO字幕、采样器和种子,比较每层每强度的R及置信区间,定位新版本是否改变提示响应、预测类型表现或score行为。

模型行为审计

研究团队可用统一估计器比较不同骨干与蒸馏方法,避免只凭FID判断优劣,并将per-cell表格作为发布模型的可复核行为报告。

远期愿景

可解释蒸馏优化

未来可把探针读数纳入训练监控,根据latent或score层异常选择蒸馏损失、步数和采样策略,形成面向行为保持的压缩流程。

原文摘要

Few-step distilled diffusion students cut text-to-image inference from ~50 to 1-8 network evaluations, but the quality gap is usually summarised by a single FID/CLIP scalar that cannot say which axis of the conditioning response changed, nor whether a behaviour comes from the architecture, the distillation objective, or simply from being a diffusion model. We replace the scalar with a decomposable probe that injects controlled perturbations along three layers (prompt encoder, denoiser input, denoiser output) under three modes (mean, variance, scale) and six strengths, reporting a bootstrap-median Bures W2^2 selectivity ratio on Inception features. Under a single matched estimator across 23 models -- five teachers and 18 distilled students spanning five backbone families (SDXL, SD1.5, SD3.5, PixArt-alpha, FLUX), three architecture classes (UNet, DiT, MMDiT), and five distillation paradigms -- the three layers read three empirically separable factors: the prompt layer is a universal prompt-mean response (a sanity channel, not a discriminator), the latent layer reads the prediction type, and the score layer reads the distillation objective. Our main result: within this sweep, the latent layer is a near-binary detector of rectified-flow backbones. Its ratio exceeds 1 across a sustained low-to-mid band only for rectified-flow models (SD3.5, FLUX); no epsilon-prediction model qualifies. A matched epsilon-prediction control (PixArt-alpha) rules out wide-T5 conditioning, and the fingerprint survives adversarial (ADD) distillation as both teacher and student. Two secondary score-layer findings hold under narrower scopes: a canonical 4-step ADD-vs-rest contrast on the UNet families with a non-ADD baseline, and a CI-separated trajectory-rollout early-strength score spike on both UNet and DiT. All ratios are CI-citable under one estimator; we release the per-cell tables and the estimator.

cs.CV