排序: 最新 热门 引用
eess.AS 2305.11834

Pengi: An Audio Language Model for Audio Tasks

Pengi将音频任务统一为文本生成,在21项任务上实现跨模态理解,AudioCaps SPIDEr达0.4667。

Soham Deshmukh, Benjamin Elizalde, Rita Singh 等

2023-05-20 27
cs.LG 2305.10924

Structural Pruning for Diffusion Models

提出Diff-Pruning,通过Taylor展开实现Diffusion模型约50% FLOPs压缩,训练成本仅为原模型10-20%。

Gongfan Fang, Xinyin Ma, Xinchao Wang

2023-05-18 33
eess.AS 2305.10790

Listen, Think, and Understand

LTU模型结合音频感知与推理能力,利用OpenAQA-5M数据集实现音频理解。

Yuan Gong, Hongyin Luo, Alexander H. Liu 等

2023-05-18 39