APT: Accelerating Diffusion Transformers via Attention Probability-Guided Pruning and Quantization

TL;DR

APT通过注意力概率引导的剪枝和量化大幅加速扩散Transformer,能实现最高8.16倍加速和14.98倍能效提升。

cs.AR 🔴 高级 2026-08-26 56 次浏览
Sungyeob Yoo Seeyeon Kim Joonyong Park Seunghee Han Joo-Young Kim
扩散模型 Transformer 硬件加速 剪枝 量化

核心发现

方法论

APT结合软件和硬件优化,通过注意力概率引导的自适应双阈值剪枝和量化(APDT)以及时间步感知的FlashAttention(TAFA),显著降低计算复杂度。硬件架构支持不规则稀疏性和双精度计算,采用基于tile的数据流设计。

关键结果

  • APT在PixArt-α、Stable Diffusion 3和FLUX模型上实现了最高8.16倍加速和14.98倍能效提升,相比EXION也有3.01倍加速和2.04倍能效提升。
  • APDT通过动态调整剪枝和量化阈值,在减少65%计算量的同时保持28.5 dB的量化信噪比,与12位精度几乎相当。
  • TAFA在不显著增加内存需求的情况下,生成的执行掩码与完整Softmax的相似度超过97%。

研究意义

APT解决了高分辨率扩散Transformer模型中自注意力计算的瓶颈问题,为生成式AI的高效部署提供了新路径。其方法可推广到其他需要稀疏性和精度控制的Transformer模型。

技术贡献

APT提出了注意力概率引导的剪枝和量化方法(APDT),并通过TAFA实现了与FlashAttention的兼容性。硬件架构支持动态稀疏性和双精度计算,显著提升了高分辨率生成任务的效率。

新颖性

APT首次将注意力概率用于联合指导剪枝和量化,并提出了TAFA以解决FlashAttention的内存限制问题。其硬件设计在支持不规则稀疏性和tile级数据流方面也具有创新性。

局限性

  • APT的性能依赖于注意力概率的时间步相似性,对于时间步差异较大的模型可能效果有限。
  • 硬件设计复杂度较高,可能增加开发和部署成本。
  • 目前仅在生成任务中验证,尚未测试其他Transformer应用场景。

未来方向

未来可探索APT在其他Transformer模型中的应用,如自然语言处理任务。此外,可优化硬件设计以支持更高分辨率和更复杂的稀疏模式。

AI 总览摘要

扩散Transformer(DiT)在高分辨率生成任务中表现优异,但其自注意力计算复杂度随分辨率呈四次方增长,成为主要瓶颈。APT通过注意力概率引导的剪枝和量化(APDT)以及时间步感知的FlashAttention(TAFA),显著降低了计算复杂度。硬件架构支持动态稀疏性和双精度计算,采用tile级数据流设计。

实验表明,APT在PixArt-α、Stable Diffusion 3和FLUX模型上实现了最高8.16倍加速和14.98倍能效提升,相比EXION也有3.01倍加速和2.04倍能效提升。同时,APDT在减少65%计算量的情况下保持了与12位精度几乎相当的量化信噪比(28.5 dB)。TAFA生成的掩码与完整Softmax的相似度超过97%,显著降低了内存需求。

APT为高分辨率生成任务提供了高效解决方案,并为稀疏性和精度控制的硬件设计开辟了新方向。然而,其性能依赖于时间步相似性,硬件设计复杂度较高,未来可探索更广泛的应用场景和优化设计。

深度分析

研究背景

扩散模型近年来成为生成式AI的核心技术,通过逐步去噪生成高质量图像和视频。Diffusion Transformer(DiT)因其优异的扩展性和生成质量,已成为高分辨率生成任务的主流。然而,DiT的自注意力计算复杂度随分辨率呈四次方增长,导致计算开销巨大。

核心问题

DiT在高分辨率下的计算瓶颈主要来自自注意力操作。现有的稀疏性和量化方法难以同时兼顾效率和精度,特别是在需要高分辨率生成的场景中。

核心创新

APT的创新包括:1)提出注意力概率引导的自适应双阈值剪枝和量化(APDT),动态调整剪枝和量化策略;2)设计时间步感知的FlashAttention(TAFA),利用时间步相似性预测注意力概率;3)开发支持动态稀疏性和双精度计算的硬件架构。

方法详解

  • �� APDT通过注意力概率的标准差动态调整剪枝和量化阈值,减少不必要的计算。
  • �� TAFA利用前一时间步的归一化统计预测当前时间步的注意力概率,避免完整Softmax计算。
  • �� 硬件架构采用tile级数据流设计,支持动态稀疏性和双精度计算。

实验设计

实验在PixArt-α、Stable Diffusion 3和FLUX模型上进行,比较了APT与NVIDIA A100和EXION的性能。评估指标包括加速比、能效比和量化信噪比,并进行了剪枝和量化的消融实验。

结果分析

APT在高分辨率生成任务中实现了最高8.16倍加速和14.98倍能效提升,量化信噪比达到28.5 dB,与12位精度几乎相当。TAFA生成的掩码与完整Softmax的相似度超过97%。

应用场景

APT适用于高分辨率图像和视频生成任务,特别是在计算资源有限的场景中。其方法也可推广至其他需要稀疏性和精度控制的Transformer模型。

局限与展望

APT的性能依赖于时间步相似性,可能不适用于时间步差异较大的模型。硬件设计复杂度较高,增加了开发成本。

通俗解读 非专业人士也能看懂

可以将APT比作一个智能的物流系统。传统物流需要处理大量包裹(高分辨率生成任务中的计算量),而APT通过分析每个包裹的重要性(注意力概率),决定哪些包裹可以压缩包装(量化),哪些可以暂时不送(剪枝)。同时,它还能利用前一天的物流数据(时间步相似性)优化今天的配送路线(TAFA)。最终,这种智能系统显著提高了效率,减少了资源浪费。

简单解释 像给14岁少年讲一样

想象你在玩一个超大的拼图游戏,每次只能放一块拼图。APT就像一个超级助手,它会告诉你哪些拼图最重要,先放上去,哪些可以用简单的图案代替,甚至哪些可以暂时忽略。更酷的是,它还能记住前几步的拼图情况,帮你更快完成整个拼图!

术语表

Attention Probability (注意力概率)

表示自注意力机制中每个元素的重要性,用于指导剪枝和量化。

用于APT中决定哪些元素需要高精度计算。

Pruning (剪枝)

通过移除不重要的计算元素减少计算量。

APT中通过注意力概率剪枝低重要性元素。

Quantization (量化)

将高精度数据转换为低精度以减少计算开销。

APT中使用6位和12位量化来优化计算效率。

FlashAttention

一种内存高效的自注意力算法,通过tile级计算避免存储完整矩阵。

APT通过TAFA扩展了FlashAttention的功能。

Tile-based Dataflow (基于tile的数据流)

将计算分解为小块(tile)以提高硬件利用率。

APT硬件架构的核心设计。

开放问题 这项研究留下的未解疑问

  • 1 APT在非生成任务中的性能尚未验证,需进一步研究其适用性。
  • 2 如何优化硬件设计以支持更复杂的稀疏模式仍是开放问题。
  • 3 时间步相似性较低的模型中,APT的性能可能受限。

应用场景

近期应用

高分辨率图像生成

在PixArt-α和Stable Diffusion等模型中实现更高效的图像生成,适用于艺术创作和广告设计。

视频生成与编辑

通过APT加速高分辨率视频生成,适用于影视制作和虚拟现实场景。

远期愿景

通用Transformer加速

将APT方法推广至自然语言处理和科学计算等领域,显著提升Transformer模型的效率。

原文摘要

Recent advances in generative AI have significantly increased the demand for high-resolution image and video generation, positioning diffusion models as a core technology. Among them, Diffusion Transformers (DiTs) have emerged as the state-of-the-art (SOTA) models due to their scalability and output quality. However, self-attention in DiTs incurs significant computational overhead, leading to excessively long latency as the complexity grows with the fourth power of the output resolution. While prior works have attempted to mitigate this cost using sparsity and quantization techniques, they fall short of effectively reducing the computational cost in high-resolution DiTs. In this paper, we present APT, a software-hardware co-designed accelerator for high-resolution DiTs. APT leverages attention probabilities as a unified importance metric to jointly optimize computation through fine-grained pruning and adaptive precision scaling. At the algorithm level, we propose Attention Probability-guided Adaptive Dual Thresholding (APDT), which dynamically performs element selection and precision assignment using dual thresholds. To ensure compatibility with memory-efficient FlashAttention, we introduce Timestep-Aware FlashAttention (TAFA), which predicts attention probabilities across timesteps by exploiting temporal similarity. At the architecture level, we co-design a specialized accelerator that efficiently supports irregular sparsity and dual-precision execution, featuring dynamic mask management, address translation, dual-precision compute units, and a tile-based dataflow. Finally, we evaluate APT on SOTA DiT models, including PixArt-$α$, Stable Diffusion 3, and FLUX. APT achieves up to 8.16$\times$ speedup and 14.98$\times$ higher energy efficiency over NVIDIA A100, and up to 3.01$\times$ speedup and 2.04$\times$ higher energy efficiency over EXION, a SOTA diffusion model accelerator.

cs.AR