AST: Audio Spectrogram Transformer

TL;DR

AST是首个无卷积、纯注意力的音频分类模型,在AudioSet上达到0.485 mAP。

cs.SD 🔴 高级 2021-04-05 8 次浏览
Yuan Gong Yu-An Chung James Glass
音频分类 自注意力 Transformer 卷积网络 深度学习

核心发现

方法论

AST采用纯注意力机制,无需卷积层。通过将音频频谱图分割为16×16的重叠块,利用线性投影生成嵌入,并添加可训练的位置嵌入。使用预训练的Vision Transformer权重进行知识迁移。

关键结果

  • 在AudioSet上,AST单模型达到0.459 mAP,集成模型达到0.485 mAP,超过所有现有方法。
  • 在ESC-50数据集上,AST-S达到88.7%准确率,AST-P达到95.6%,均优于现有最佳模型。
  • 在Speech Commands V2上,AST-S达到98.11%的准确率,优于所有现有方法。

研究意义

AST的推出证明了在音频分类中,卷积层并非不可或缺。它提供了一种简单且高效的架构,能够在不同任务中实现最先进的性能,减少了对架构调整的需求。

技术贡献

AST展示了纯注意力模型在音频分类中的潜力,简化了架构设计,减少了参数量,并加速了训练过程。它还引入了跨模态迁移学习方法,将视觉任务中的知识应用于音频任务。

新颖性

AST是首个无卷积的音频分类模型,利用Transformer架构直接处理音频频谱图,突破了传统CNN的限制。

局限性

  • AST需要大量数据进行训练,尤其是在没有预训练的情况下表现较差。
  • 在某些情况下,位置嵌入的适配可能不够精确,影响性能。

未来方向

未来工作可以探索更高效的预训练方法,优化位置嵌入的适配策略,以及在更广泛的音频任务中测试AST的性能。

AI 总览摘要

近年来,音频分类领域的研究逐渐从基于手工特征的模型转向端到端的深度学习模型。卷积神经网络(CNN)一直是这些模型的核心组件,然而,随着自注意力机制的引入,研究者们开始质疑CNN在音频分类中的必要性。

音频频谱Transformer(AST)是首个无卷积、纯注意力的音频分类模型。通过将音频频谱图分割为重叠的块并进行线性投影,AST能够有效捕捉长距离的全局上下文。它在多个音频分类基准上实现了最先进的性能,证明了纯注意力模型的潜力。

AST的成功不仅在于其性能的提升,还在于其架构的简化和训练效率的提高。未来的研究可以进一步优化预训练方法,探索更广泛的应用场景,并解决当前的局限性。

深度分析

研究背景

音频分类领域经历了从基于手工特征到端到端深度学习模型的转变。卷积神经网络(CNN)因其空间局部性和平移等变性而被广泛采用。然而,随着自注意力机制在视觉领域的成功应用,研究者开始探索纯注意力模型在音频分类中的潜力。

核心问题

传统音频分类模型依赖CNN来提取特征,但这种方法可能限制了模型捕捉长距离上下文的能力。研究者们希望找到一种无需CNN的模型,以提高音频分类的性能和效率。

核心创新

AST是首个无卷积的音频分类模型,利用Transformer架构直接处理音频频谱图。它通过跨模态迁移学习,将视觉任务中的知识应用于音频任务,显著提高了性能。

方法详解

  • �� 输入音频转换为128维log Mel滤波器组特征。
  • �� 将频谱图分割为16×16的重叠块,并进行线性投影。
  • �� 添加可训练的位置嵌入,帮助模型捕捉空间结构。
  • �� 使用预训练的Vision Transformer权重进行初始化。

实验设计

在AudioSet、ESC-50和Speech Commands V2数据集上进行实验。使用ImageNet预训练和数据增强技术,如mixup和频谱图遮罩。评估指标包括mAP和准确率。

结果分析

AST在AudioSet上达到0.485 mAP,在ESC-50上达到95.6%准确率,在Speech Commands V2上达到98.11%准确率,均超过现有最佳模型。

应用场景

AST可用于音频事件分类、语音命令识别等任务。其架构支持不同长度的输入,适用于多种音频任务。

局限与展望

AST需要大量数据进行训练,尤其是在没有预训练的情况下表现较差。位置嵌入的适配可能不够精确,影响性能。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。传统的音频分类模型就像一个厨师,他需要按照食谱一步步来,使用特定的工具来处理食材。而AST就像一个经验丰富的厨师,他可以通过观察和直觉来判断食材的状态,并快速做出调整。AST不需要像传统模型那样依赖特定的工具(卷积层),而是通过注意力机制直接处理音频频谱图,捕捉其中的细微变化。

简单解释 像给14岁少年讲一样

嘿,想象一下你在玩一个超级酷的游戏。在这个游戏里,你需要快速识别各种声音来完成任务。传统的游戏角色可能需要一个指南来告诉他们如何识别这些声音,但AST就像一个超级英雄,他可以通过观察周围的环境来快速判断声音的来源和类型。它使用一种叫做注意力机制的超级能力,能够捕捉到声音中的细节,并做出快速反应。是不是很酷?

术语表

Transformer (变压器)

一种用于处理序列数据的深度学习模型,利用自注意力机制来捕捉输入数据的全局上下文。

AST使用Transformer架构来处理音频频谱图。

AudioSet (音频集)

一个包含超过200万段音频剪辑的数据集,用于音频事件分类研究。

AST在AudioSet上进行了性能评估。

Vision Transformer (视觉变压器)

一种用于图像分类的Transformer模型,通过将图像分割为块来进行处理。

AST使用预训练的Vision Transformer权重进行初始化。

mAP (平均精度)

一种用于评估分类模型性能的指标,表示模型在多个类别上的平均精度。

AST在AudioSet上达到了0.485 mAP。

Self-Attention (自注意力)

一种机制,允许模型在处理数据时关注输入的不同部分,以捕捉其之间的关系。

AST利用自注意力机制来处理音频频谱图。

开放问题 这项研究留下的未解疑问

  • 1 如何在数据量较少的情况下提高AST的性能仍是一个挑战。
  • 2 位置嵌入的适配策略需要进一步优化,以提高模型的准确性。

应用场景

近期应用

音频事件识别

AST可用于识别环境中的各种音频事件,适用于安全监控和智能家居系统。

远期愿景

通用音频分类器

AST有潜力成为一个通用的音频分类器,能够处理各种音频任务,推动智能音频分析的发展。

原文摘要

In the past decade, convolutional neural networks (CNNs) have been widely adopted as the main building block for end-to-end audio classification models, which aim to learn a direct mapping from audio spectrograms to corresponding labels. To better capture long-range global context, a recent trend is to add a self-attention mechanism on top of the CNN, forming a CNN-attention hybrid model. However, it is unclear whether the reliance on a CNN is necessary, and if neural networks purely based on attention are sufficient to obtain good performance in audio classification. In this paper, we answer the question by introducing the Audio Spectrogram Transformer (AST), the first convolution-free, purely attention-based model for audio classification. We evaluate AST on various audio classification benchmarks, where it achieves new state-of-the-art results of 0.485 mAP on AudioSet, 95.6% accuracy on ESC-50, and 98.1% accuracy on Speech Commands V2.

cs.SD cs.AI