Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding

TL;DR

提出音频感知解码(AAD),提升LALMs在对象幻觉数据集上的F1分数0.046到0.428。

eess.AS 🔴 高级 2025-06-09 34 次浏览
Tzu-wen Hsu Ke-Han Lu Cheng-Han Chiang Hung-yi Lee
音频语言模型 对象幻觉 对比解码 机器学习 自然语言处理

核心发现

方法论

音频感知解码(AAD)是一种轻量级的推理策略,通过对比解码来比较有无音频上下文时的token预测logits。AAD通过提升音频存在时概率增加的token来减少幻觉现象。

关键结果

  • 在对象幻觉数据集上,AAD使F1分数提高了0.046到0.428,显著减少了幻觉现象。
  • 在Clotho-AQA数据集上,AAD提高了准确率5.4%到10.3%,展示了其在一般音频问答任务中的有效性。
  • 通过详细的消融研究,验证了AAD各组件的有效性。

研究意义

该研究通过引入音频感知解码,解决了LALMs在音频理解中的幻觉问题,提升了模型在对象幻觉和一般音频问答任务中的表现,具有广泛的学术和工业应用潜力。

技术贡献

AAD通过对比解码显著减少了LALMs的幻觉现象,与现有的提示工程方法相比,提供了更稳健的解决方案,并在多个模型和数据集上验证了其有效性。

新颖性

AAD首次将对比解码应用于LALMs,区别于以往的提示工程方法,通过音频上下文的对比来减少幻觉现象。

局限性

  • AAD需要两次模型前向传播,增加了计算开销,但可以通过并行处理来减轻。
  • 当前研究仅限于是非问答,未来需扩展到更复杂的问答场景。

未来方向

未来工作可以探索不同的空白音频生成策略,以及在其他音频问答任务中的应用,如MMAU或SAKURA。

AI 总览摘要

大型音频语言模型(LALMs)在音频理解任务中表现优异,但存在幻觉问题,即模型可能会错误地识别音频中不存在的对象。现有的提示工程方法虽然能在一定程度上减少幻觉,但其效果不稳定且依赖于提示设计。

为了应对这一挑战,研究人员提出了音频感知解码(AAD),一种轻量级的推理策略,通过对比解码来比较有无音频上下文时的token预测logits。AAD通过提升音频存在时概率增加的token来减少幻觉现象。

实验结果显示,AAD在对象幻觉数据集上显著提高了F1分数,并在Clotho-AQA数据集上提高了准确率,展示了其在一般音频问答任务中的有效性。这一方法不仅减少了幻觉现象,还提升了模型的整体表现。

然而,AAD需要两次模型前向传播,增加了计算开销,但可以通过并行处理来减轻。未来工作可以探索不同的空白音频生成策略,以及在其他音频问答任务中的应用。

总的来说,音频感知解码为解决LALMs的幻觉问题提供了一个稳健的解决方案,具有广泛的应用潜力。

深度解读

原文摘要

Large Audio-Language Models (LALMs) can take audio and text as the inputs and answer questions about the audio. While prior LALMs have shown strong performance on standard benchmarks, there has been alarming evidence that LALMs can hallucinate what is presented in the audio. To mitigate the hallucination of LALMs, we introduce Audio-Aware Decoding (AAD), a lightweight inference-time strategy that uses contrastive decoding to compare the token prediction logits with and without the audio context. By contrastive decoding, AAD promotes the tokens whose probability increases when the audio is present. We conduct our experiment on object hallucination datasets with three LALMs and show that AAD improves the F1 score by 0.046 to 0.428. We also show that AAD can improve the accuracy on general audio QA datasets like Clotho-AQA by 5.4% to 10.3%. We conduct thorough ablation studies to understand the effectiveness of each component in AAD.

eess.AS cs.CL