Post-Training Quantization for Vision Transformer

TL;DR

提出了一种用于视觉Transformer的后训练量化算法,在ImageNet上使用DeiT-B模型实现了81.29%的Top-1准确率。

cs.CV 🔴 高级 2021-06-27 2 次浏览
Zhenhua Liu Yunhe Wang Kai Han Siwei Ma Wen Gao
视觉Transformer 后训练量化 混合精度 注意力机制 模型压缩

核心发现

方法论

本文提出了一种混合精度后训练量化方法,结合了相似性量化和排序损失,以优化视觉Transformer的量化间隔。通过核范数分析层间特征多样性,动态分配比特宽度,保持注意力机制的功能。

关键结果

  • 在ImageNet数据集上,使用DeiT-B模型实现了81.29%的Top-1准确率,优于现有的后训练量化算法。
  • 在CIFAR-10数据集上,ViT-B模型的8位量化模型达到了97.79%的准确率。
  • 在COCO2017数据集上,DETR模型的8位量化实现了41.7的mAP。

研究意义

该研究显著降低了视觉Transformer在内存和计算上的开销,使其更适合在资源受限的设备上部署。这种方法在不需要额外训练的情况下,提供了与全精度模型相当的性能,推动了Transformer在工业环境中的应用。

技术贡献

本文在现有量化方法基础上,提出了结合注意力机制的排序损失和核范数分析的混合精度量化策略,为视觉Transformer的模型压缩提供了新的思路和技术保障。

新颖性

这是首次将排序损失引入视觉Transformer的量化过程,以保持注意力机制的相对顺序,并通过核范数动态调整层的比特宽度。

局限性

  • 在极低比特宽度下,模型性能可能会显著下降,尤其是在复杂任务中。
  • 该方法依赖于核范数的计算,可能增加计算复杂度。

未来方向

未来可以探索在更多视觉任务中的应用,如视频理解和语义分割,并优化核范数计算的效率。

AI 总览摘要

近年来,Transformer在计算机视觉领域取得了显著的成功,但其复杂的架构使得在移动设备上部署变得困难。本文提出了一种有效的后训练量化算法,旨在降低视觉Transformer的内存存储和计算成本。该方法通过引入排序损失保持注意力机制的功能,并通过核范数分析层间特征多样性,探索混合精度量化方案。实验结果表明,该方法在多个基准模型和数据集上优于现有的后训练量化算法。例如,在ImageNet数据集上,使用DeiT-B模型实现了81.29%的Top-1准确率,约8位量化。该研究为视觉Transformer的模型压缩提供了新的思路,推动了其在工业环境中的应用。尽管如此,该方法在极低比特宽度下可能会面临性能下降的问题,未来的研究可以进一步优化核范数计算的效率,并探索在更多视觉任务中的应用。

深度分析

研究背景

Transformer最初在自然语言处理领域取得了成功,近年来被应用于计算机视觉任务,如图像分类、目标检测和图像超分辨率。与传统的卷积神经网络相比,视觉Transformer具有更复杂的架构,通常需要大量的参数和计算资源,这给在资源受限设备上的部署带来了挑战。

核心问题

视觉Transformer的复杂性导致其在移动设备上的部署困难,特别是在内存和计算资源有限的情况下。如何在不显著降低模型性能的情况下,压缩Transformer模型以适应边缘设备的需求,是一个亟待解决的问题。

核心创新

本文的创新在于提出了一种结合排序损失和核范数分析的混合精度后训练量化方法。排序损失用于保持注意力机制的相对顺序,而核范数分析则用于动态调整层的比特宽度,从而在不需要额外训练的情况下,实现高效的模型压缩。

方法详解

  • �� 提出了一种混合精度量化方法,结合相似性量化和排序损失。
  • �� 通过核范数分析层间特征多样性,动态分配比特宽度。
  • �� 在量化过程中引入偏差校正,以减少累积量化误差。
  • �� 采用交替搜索策略优化量化间隔。

实验设计

实验在CIFAR-10、CIFAR-100、ImageNet和COCO2017数据集上进行,采用ViT和DeiT等视觉Transformer模型。随机选择部分训练数据作为校准数据集,设置不同的比特宽度进行量化实验,并与现有量化方法进行对比。

结果分析

在ImageNet数据集上,DeiT-B模型的8位量化实现了81.29%的Top-1准确率,优于现有方法。在CIFAR-10数据集上,ViT-B模型的8位量化模型达到了97.79%的准确率。在COCO2017数据集上,DETR模型的8位量化实现了41.7的mAP。

应用场景

该方法适用于需要在资源受限设备上部署的视觉Transformer模型,如智能手机和物联网设备。通过降低内存和计算需求,该方法可以在不显著降低性能的情况下,实现高效的模型压缩。

局限与展望

在极低比特宽度下,模型性能可能会显著下降,尤其是在复杂任务中。该方法依赖于核范数的计算,可能增加计算复杂度。未来的研究可以进一步优化核范数计算的效率,并探索在更多视觉任务中的应用。

通俗解读 非专业人士也能看懂

想象一个工厂,原本需要大量工人来完成复杂的生产任务。为了节省成本,我们决定让每个工人同时负责多项任务,但又不想降低产品质量。于是,我们引入了一种新的管理方法,通过分析每个工人的工作效率,合理分配任务,让工厂在减少工人数量的同时,保持高效运转。这就像本文提出的量化方法,通过分析每层的特征多样性,动态调整计算精度,减少计算资源的使用,同时保持模型的高性能。

简单解释 像给14岁少年讲一样

想象你在玩一个大型多人在线游戏,游戏里有很多角色,每个角色都有自己的技能和装备。为了让游戏在手机上流畅运行,你需要减少游戏的内存占用。你可以通过分析每个角色的技能重要性,来决定哪些技能可以用更少的资源来实现,而不影响游戏体验。这就像本文的量化方法,通过分析每层的特征多样性,动态调整计算精度,减少计算资源的使用,同时保持模型的高性能。

术语表

Vision Transformer (视觉Transformer)

一种基于Transformer架构的视觉模型,能够处理图像数据。

用于图像分类、目标检测等视觉任务。

Post-Training Quantization (后训练量化)

在不改变模型架构的情况下,通过低比特宽度压缩模型。

用于减少视觉Transformer的内存和计算成本。

Mixed-Precision Quantization (混合精度量化)

根据特征多样性动态分配比特宽度的量化方法。

用于提高量化模型的性能。

Ranking Loss (排序损失)

一种损失函数,用于保持量化后注意力机制的相对顺序。

用于视觉Transformer的量化过程。

Nuclear Norm (核范数)

矩阵奇异值的和,表示数据的相关性。

用于分析层间特征多样性。

开放问题 这项研究留下的未解疑问

  • 1 如何在极低比特宽度下保持模型性能?现有方法在复杂任务中可能会显著下降。
  • 2 核范数计算的效率如何优化?计算复杂度可能会影响实际应用。

应用场景

近期应用

智能手机应用

通过减少内存和计算需求,使视觉Transformer在智能手机上高效运行。

远期愿景

物联网设备

在物联网设备上部署高效的视觉Transformer,实现智能监控和分析。

原文摘要

Recently, transformer has achieved remarkable performance on a variety of computer vision applications. Compared with mainstream convolutional neural networks, vision transformers are often of sophisticated architectures for extracting powerful feature representations, which are more difficult to be developed on mobile devices. In this paper, we present an effective post-training quantization algorithm for reducing the memory storage and computational costs of vision transformers. Basically, the quantization task can be regarded as finding the optimal low-bit quantization intervals for weights and inputs, respectively. To preserve the functionality of the attention mechanism, we introduce a ranking loss into the conventional quantization objective that aims to keep the relative order of the self-attention results after quantization. Moreover, we thoroughly analyze the relationship between quantization loss of different layers and the feature diversity, and explore a mixed-precision quantization scheme by exploiting the nuclear norm of each attention map and output feature. The effectiveness of the proposed method is verified on several benchmark models and datasets, which outperforms the state-of-the-art post-training quantization algorithms. For instance, we can obtain an 81.29\% top-1 accuracy using DeiT-B model on ImageNet dataset with about 8-bit quantization.

cs.CV