Pengi: An Audio Language Model for Audio Tasks

TL;DR

Pengi将音频任务统一为文本生成,在21项任务上实现跨模态理解,AudioCaps SPIDEr达0.4667。

eess.AS 🟡 进阶级 2023-05-20 28 次浏览
Soham Deshmukh Benjamin Elizalde Rita Singh Huaming Wang
音频语言模型 迁移学习 零样本学习 音频字幕 多任务学习

核心发现

方法论

Pengi以HTSAT音频编码器和CLIP文本编码器提取连续表示,经两个8层Transformer映射网络分别扩展为长度40的前缀;拼接成80个连续嵌入后,输入冻结的GPT2-base(124M)。训练将分类、检索、问答和字幕统一成(audio,text)-to-text任务,仅优化音频编码器与映射网络,采用自回归交叉熵和beam size=5解码。

关键结果

  • 在AudioCaps与Clotho字幕任务上,Pengi分别取得SPIDEr 0.4667和0.2709,相比此前最佳结果相对提升6.6%和26%;ClothoAQA准确率为64.5%,较监督基线相对提升1.5%。
  • 零样本ESC50准确率为0.9195,超过AudioCLIP、CLAP和LAION-CLAP约32%、11%和1%;FSD50K mAP为0.4676,UrbanSound8K准确率为0.7185。
  • 多任务训练优于仅字幕训练:AudioCaps SPIDEr从0.4551升至0.4667,Clotho从0.2648升至0.2709,说明共享编码器和映射器具有迁移收益。

研究意义

论文把通常分离的音频分类、检索、字幕和问答放入同一生成式接口,缓解了对每个任务单独设计头部和微调流程的依赖。它证明冻结语言模型也能通过连续音频前缀获得音频理解能力,为通用音频助手、自然语言检索和跨模态交互提供了统一基础。

技术贡献

核心工程贡献是audio-conditional prefix tuning:音频和指令文本经映射网络转成GPT2可接受的连续前缀,而语言模型保持冻结。8种指令模板覆盖字幕、AQA、事件、场景、情绪、音乐和元数据;3.4百万音频—文本对联合训练。文本匹配和对数似然两种闭集评估机制连接了自由生成与分类。

新颖性

Pengi据作者所述首次在音频领域以单一架构、单一字幕式目标,同时支持开放式和闭集任务。相较CLAP、Mulan等对比学习模型只能从候选标签中评分,Pengi能生成自由文本;相较仅面向开放任务的模型,它无需任务专用扩展即可完成分类和检索。

局限性

  • GPT2-base与80长度前缀限制了语言表达能力;音频随机截断为7秒,可能遗漏长时结构、稀有事件及多说话人上下文。
  • 训练数据规模虽达340万对,但大量标签和模板存在分布偏差;闭集任务依赖文本匹配,近义词或生成冗余可能导致评价错误。
  • 论文主要报告单模型结果,尚未系统研究更大语言模型、真实长音频、鲁棒性和公平性。

未来方向

未来可扩展更大或指令优化的语言模型,支持长音频分段与时间定位;研究更丰富的模板、少样本适配和多语言能力;同时改进生成文本到标签的校准,建立统一、抗语义变体的闭集评价,并评估真实部署成本。

AI 总览摘要

音频理解长期被拆成分类、检索、字幕和问答等互不连通的任务。CLAP、Mulan和LAION-CLAP通过对比学习实现了强大的零样本闭集预测,却不能自然生成答案;已有生成模型又往往没有在闭集任务上验证。Pengi试图解决这一鸿沟。

Pengi把所有任务改写为“音频加文字提示生成文字”。HTSAT编码音频,CLIP编码提示,两个8层Transformer映射器将表示转换为各40个连续嵌入,拼接成80长度前缀,提示冻结的GPT2-base。模型仅更新音频侧与映射器,使用340万音频—文本对、8类指令模板和交叉熵训练;推理采用beam search,束宽为5。

在21项下游任务中,AudioCaps和Clotho的SPIDEr分别为0.4667和0.2709,较先前最佳结果相对提升6.6%和26%;ClothoAQA准确率为64.5%。零样本ESC50准确率达0.9195,并超过多种CLAP基线。多任务训练还使字幕性能提升。尽管受7秒截断、GPT2规模和文本匹配评价限制,Pengi展示了连接语言模型与音频模型、构建通用音频理解系统的可行路径。

深度分析

研究背景

自监督学习和对比学习推动了音频迁移学习。CLAP等模型利用音频—文本相似度支持分类和检索,但输出受候选标签限制。AudioCaps、Clotho等生成模型能写字幕,却通常专注开放任务。T5、FLAN在文本域证明统一“输入到文本”范式有效,Frozen、Flamingo则展示了视觉前缀连接语言模型的可能性。音频领域缺少兼顾两类任务的统一模型。

核心问题

目标是让一个模型接受任意音频与自然语言提示,并输出自由文本,同时覆盖分类、回归、检索、字幕和问答。难点在于音频是长时连续信号,标签形式多样,语言模型原本不具备音频接口;此外,自由生成中的同义表达会与严格类别指标冲突。

核心创新

  • ��统一格式:把21类下游任务视为(audio,text)-to-text。
  • ��连续前缀:HTSAT和CLIP表示经映射器转为GPT2前缀,不改动语言模型。
  • ��指令模板:用8种模板模拟FLAN式指令调优。
  • ��统一评估:闭集任务使用候选文本对数似然或文本嵌入余弦匹配。
  • ��规模化迁移:3.4百万音频—文本对共同训练开放和闭集能力。

方法详解

  • ��输入:原始音频以44.1 kHz采样,转为64 Mel bins、320 ms hop、1024 ms window、50–8000 Hz log-Mel谱,并随机截取7秒。
  • ��编码:HTSAT生成音频嵌入;CLIP文本编码器处理最长40 token的提示。
  • ��映射:两个8层Transformer映射器各生成40个嵌入,拼接为80长度前缀。
  • ��生成:冻结GPT2-base根据前缀自回归预测目标文本。
  • ��优化:60 epochs、Adam、batch 384、20张V100、学习率1e-4、2000步warm-up;交叉熵仅更新音频编码器和映射器。
  • ��推理:beam size=5;闭集结果用对数似然或文本编码余弦相似度判定。

实验设计

训练集包含AudioSet、FSD50K、CochlScene、MSP Podcast、CMU MOSI/MOSEI、MELD、NSynth、FMA、AudioCaps、ClothoV2、ClothoAQA及辅助元数据集,共340万对。测试覆盖21项任务,包括ESC50、UrbanSound8K、DCASE2017、TUT2017、CREMA-D、RAVDESS、Vocal Sound、NSynth和Clotho检索。指标包括SPIDEr、准确率、mAP、F1和R@1;与CLAP及监督模型比较,并进行单任务/多任务消融。

结果分析

Pengi在AudioCaps获得SPIDEr 0.4667,在Clotho获得0.2709,超过最佳监督结果0.438和0.215。ClothoAQA达到64.5%。闭集方面,ESC50为0.9195、FSD50K mAP为0.4676、UrbanSound8K为0.7185、TUT2017为0.3525。Clotho文本到音频检索R@1为9.4、R@5为26.1、R@10为36.7。多任务消融证明共享训练带来稳定增益。

应用场景

可用于自然语言音频搜索、会议和环境声音摘要、智能家居事件识别、无障碍声音描述、媒体内容标注及音乐分析。部署前需准备领域音频、提示模板和类别文本;开放任务可直接生成,严格分类则需要文本匹配校准。

局限与展望

模型以7秒片段为主,长事件、时间顺序和弱声源可能被忽略。GPT2-base冻结限制了复杂推理和语言流畅性;3.4百万训练对并不等于均衡覆盖,音乐、语音和环境声音分布可能偏斜。自由文本与固定标签的匹配容易受同义词影响。后续应测试长上下文、更大模型、跨语言和真实噪声场景,并降低推理成本。

通俗解读 非专业人士也能看懂

把Pengi想成一家“声音餐厅”。顾客先把一段声音和一句要求交给前台,例如“这是什么声音?”或“请描述它”。一位听音师把声音整理成内部笔记,另一位把顾客的话整理成订单;两份笔记合在一起,送给一位已经很会写文章、但不会直接听声音的厨师。厨师根据这份菜单写出答案。

关键是,这家餐厅不为每道菜另造厨房。分类、问答、字幕和搜索都使用同一套流程,只改变顾客的问法。训练时,餐厅看过340万份声音—文字订单,逐渐学会把声音笔记翻译成厨师能理解的提示。它甚至能回答开放问题,而不是只从固定菜单中选一个词。

但餐厅也有局限:通常只听每段声音的7秒,长故事可能听不完整;如果厨师写“犬叫声”而菜单写“狗”,严格打分可能判错。尽管如此,Pengi说明声音和文字可以共享一个统一的服务台。

简单解释 像给14岁少年讲一样

想象你在玩一个超级声音游戏:麦克风录到狗叫、地铁声或一段音乐,游戏角色要告诉你“发生了什么”。以前通常每个问题都有一个专用按钮:一个按钮认狗叫,另一个按钮认场景,还有一个按钮写字幕。换任务就得重新训练,像每换一门课都换一台电脑。

Pengi的办法更像给电脑一张“任务卡”。你把声音和问题一起交给它,比如“请描述这段声音”或“这是什么乐器?”。它先把声音变成一串看不见的提示,再把提示放到GPT2这种会写文字的模型前面。GPT2虽然没有真正的耳朵,但经过训练后能根据提示写答案。

研究者用AudioSet、AudioCaps、Clotho等数据训练了约340万组例子,还让模型学习八种不同任务。结果很厉害:AudioCaps字幕SPIDEr为0.4667,ESC50声音分类准确率为91.95%,Clotho问答准确率为64.5%。

当然它不是魔法。它常把音频截成7秒,可能错过前后发生的事情;说出同义词时,机器评分也可能不认。下一步就是让它听更长、更复杂、更嘈杂的声音。

术语表

Audio Language Model(音频语言模型)

把音频理解转化为文字生成的模型。它能用自然语言统一处理开放和闭集音频任务。

Pengi的总体架构名称。

HTSAT

用于音频的Transformer编码器,将log-Mel频谱转换为音频嵌入。它是Pengi的音频前端。

负责提取声音表示。

Prefix tuning(前缀调优)

把外部模态表示映射成连续向量,并作为语言模型输入前缀。语言模型本身可以保持冻结。

Pengi用音频和文本前缀提示GPT2。

CLAP

通过对比学习对齐音频与文本表示的方法。它擅长零样本分类和检索,但原生不能自由生成文本。

Pengi采用其音频Transformer思想并与其比较。

SPIDEr

结合CIDEr与SPICE的音频字幕评价指标,衡量词汇匹配和语义结构。

用于AudioCaps和Clotho字幕结果。

开放问题 这项研究留下的未解疑问

  • 1 长音频与时间定位仍未解决:7秒截断可能隐藏事件顺序,未来需要分段记忆、时间戳监督和长上下文语言模型。
  • 2 生成文本的可信度、幻觉和安全性缺少系统评估,尤其在医疗、监控和儿童环境中需要校准与人工审计。

应用场景

近期应用

自然语言声音搜索

媒体库或监控平台可用音频加提示生成标签和描述,再用文本嵌入检索相似片段。需要领域音频、类别词表和匹配阈值,可减少人工标注。

无障碍环境提示

系统可把门铃、警报、车辆或人声转成简短文字提醒。部署时应结合麦克风降噪、置信度阈值和人工确认,避免漏报关键事件。

远期愿景

通用音频助手

未来助手可同时理解语音、环境声和音乐,并用对话回答“刚才发生了什么”。主要障碍是长时记忆、隐私保护、多语言能力及低延迟推理。

原文摘要

In the domain of audio processing, Transfer Learning has facilitated the rise of Self-Supervised Learning and Zero-Shot Learning techniques. These approaches have led to the development of versatile models capable of tackling a wide array of tasks, while delivering state-of-the-art performance. However, current models inherently lack the capacity to produce the requisite language for open-ended tasks, such as Audio Captioning or Audio Question & Answering. We introduce Pengi, a novel Audio Language Model that leverages Transfer Learning by framing all audio tasks as text-generation tasks. It takes as input, an audio recording, and text, and generates free-form text as output. The input audio is represented as a sequence of continuous embeddings by an audio encoder. A text encoder does the same for the corresponding text input. Both sequences are combined as a prefix to prompt a pre-trained frozen language model. The unified architecture of Pengi enables open-ended tasks and close-ended tasks without any additional fine-tuning or task-specific extensions. When evaluated on 22 downstream tasks, our approach yields state-of-the-art performance in several of them. Our results show that connecting language models with audio models is a major step towards general-purpose audio understanding

eess.AS cs.SD