SVHalluc: Benchmarking Speech-Vision Hallucination in Audio-Visual Large Language Models

TL;DR

提出SVHalluc基准,评估音视频大模型中的语音-视觉幻觉,发现模型在语义和时间对齐上表现欠佳。

eess.AS 🔴 高级 2026-05-31 77 次浏览
Chenshuang Zhang Kyeong Seon Kim Chengxin Liu Tae-Hyun Oh
多模态理解 幻觉检测 语音-视觉对齐 基准测试 深度学习

核心发现

方法论

本文构建了SVHalluc基准,结合语义和时间两个维度设计六个任务,利用YouCook2数据集,通过自动化脚本生成正负样本,评估主流开源模型Qwen3-Omni和商业模型Gemini 2.5 Pro的表现。采用准确率、F1等指标,系统诊断模型在语义一致性和时间关系上的幻觉行为。实验中,模型在全局语义对齐任务中表现接近随机(约50%),而Gemini 2.5 Pro达93.10%的高准确率,显示出模型在跨模态理解上的巨大差距。时间任务中,绝大多数模型表现不佳,验证了模型在时序推理方面的不足。

关键结果

  • 开源模型在全局语义对齐任务中平均准确率仅约50%,远低于Gemini 2.5 Pro的93.10%,显示其在语义匹配上的严重不足。
  • 细粒度语义对齐和跨模态绑定任务中,开源模型表现差异明显,说明其在细节层面理解能力有限。
  • 时间对齐和预测任务中,绝大多数模型表现接近随机,验证了模型在时序推理上的缺陷。Gemini 2.5 Pro在时间任务中表现优异,验证其在跨模态时序理解上的优势。

研究意义

本研究揭示了当前音视频大模型在语音内容与视觉信息对齐方面的根本性不足,特别是在复杂语义和时间关系的理解上。这对多模态AI的安全性和可靠性提出了挑战,也推动了模型在语音-视频理解中的研究方向。通过系统化评估,明确了模型的主要瓶颈,为未来多模态模型的设计提供了理论基础和实践指南,有助于推动多模态AI在视频理解、虚拟助手等应用中的落地。

技术贡献

提出SVHalluc基准,首次系统性评估语音-视觉幻觉,涵盖语义和时间两个维度。设计多层次任务,结合自动化数据生成与人类验证,确保评估的全面性和可靠性。分析了模型在跨模态理解中的局限,强调单模态性能优异但跨模态融合不足的核心问题。引入多任务评估框架,为未来模型优化提供了具体指标和方向。

新颖性

本研究首次系统性提出专门针对语音-视觉幻觉的多维评估基准,突破了以往仅关注环境声音的单一场景,强调语音内容的复杂语义和时间关系,揭示模型在多模态理解中的新挑战。通过结合语义和时间两个关键维度,全面诊断模型的幻觉行为,为多模态AI的安全性和可靠性提供新视角。

局限性

  • 当前基准主要依赖于视频片段和语音内容的静态匹配,未充分考虑动态场景中的连续性和复杂性。
  • 模型评估仅限于静态问答任务,未覆盖多轮交互和生成式场景,限制了实际应用的全面性。
  • 数据集规模有限,未来需扩大多样性和复杂度,以更好反映真实场景中的多模态理解挑战。

未来方向

未来将扩展基准到多轮对话和生成任务,结合更丰富的多模态数据,探索模型在复杂场景中的幻觉机制。同时,推动模型结构创新,增强跨模态语义和时间推理能力,提升多模态理解的鲁棒性和安全性。

AI 总览摘要

随着多模态大模型的快速发展,音视频理解已成为研究热点。然而,模型在实际应用中常出现“幻觉”现象,即输出虽合理但缺乏依据的错误信息。尤其在语音内容与视觉场景的对齐方面,现有模型表现不佳,严重影响其可靠性。为此,本文提出了SVHalluc基准,系统评估模型在语义和时间两个关键维度的幻觉行为。通过设计六个细粒度任务,结合自动化数据生成和人类验证,全面诊断模型在多模态理解中的不足。实验结果显示,主流开源模型在大部分任务中表现接近随机,验证其在跨模态语义和时间推理上的严重缺陷。相比之下,Gemini 2.5 Pro表现优异,验证了商业模型在多模态理解上的优势。分析指出,模型在单模态感知方面表现良好,但跨模态融合能力不足,成为幻觉的根源。该研究不仅揭示了多模态模型的根本局限,也为未来模型设计提供了重要方向。未来工作将关注多轮交互、动态场景和更大规模数据,推动多模态AI的安全性和实用性提升。

深度分析

研究背景

多模态大模型的发展经历了从单一文本理解到复杂的跨模态推理。代表性工作如VisualBERT、LXMERT和VideoBERT,在图像和视频理解方面取得突破,但仍面临多模态融合不足的问题。近年来,随着大规模预训练模型的兴起,模型在多模态任务中表现优异,但“幻觉”问题逐渐凸显,尤其在语音-视觉结合中,模型常产生不符合事实的输出。现有评估多集中于环境声音的事件检测,缺乏对语音内容丰富语义和时间关系的系统考察。

核心问题

当前模型在语音-视觉任务中存在严重的幻觉问题,表现为模型无法准确对齐语音内容与视觉场景,导致错误的语义推断和时间推理。这一问题限制了多模态模型在实际应用中的可靠性,尤其是在视频内容理解、虚拟助手和自动字幕等场景中。现有基准未能充分揭示模型在复杂语义和时间关系上的不足,亟需系统化的评估工具。

核心创新

提出SVHalluc基准,首次结合语义和时间两个维度,全面评估模型的幻觉行为。设计多层次任务,从全局到细粒度,再到跨模态绑定和时间推理,细致诊断模型在多模态理解中的瓶颈。引入自动化数据生成流程,结合人类验证,确保评估的科学性和实用性。该方法突破了以往仅关注环境声音的局限,为多模态理解提供新思路。

方法详解

  • �� 采集YouCook2数据集中的同步语音视频对,利用Whisper模型自动转录语音。
  • �� 构建六个任务:全局语义对齐(判断语音是否描述视频内容)、细粒度语义对齐(识别特定对象是否出现)、跨模态绑定(事件是否被错误结合)、时间对齐(事件是否同时发生)、时间预测(事件发生在过去、现在或未来)、跨模态时间绑定(动作与事件的时间关系)。
  • �� 通过自动化脚本生成正负样本,包括随机配对、对象隐藏、事件错配等。
  • �� 采用多项指标(准确率、F1)评估模型在不同任务中的表现,确保结果的全面性。
  • �� 结合人类验证,筛除不合理样本,提升数据质量。

实验设计

在Qwen3-Omni、Qwen2.5-Omni、VideoSALMONN 2和VideoLLaMA 2等模型上进行评估,使用标准的二选一和多选题格式。模型在全局语义对齐任务中表现极差(约50%),Gemini 2.5 Pro达93.10%。时间任务中,开源模型表现接近随机,Gemini表现优异。通过详细分析模型在不同任务中的错误类型,验证了跨模态融合不足是主要原因。

结果分析

开源模型在语义对齐任务中表现极差,准确率仅约50%,而Gemini达93.10%。细粒度任务中,模型能力有限,难以识别具体对象和事件。时间任务中,绝大多数模型表现接近随机,验证其在时序推理上的不足。Gemini在时间任务中表现优异,显示其在跨模态时间理解方面的优势。整体结果揭示模型在多模态语义和时间理解上的巨大差距。

应用场景

该基准可用于评估未来多模态模型的安全性和可靠性,特别是在视频内容理解、虚拟助手、自动字幕生成等场景。通过系统诊断模型幻觉行为,推动模型在复杂语义和时间关系上的改进,提升实际应用中的表现和信任度。

局限与展望

目前基准主要集中于静态问答场景,未覆盖多轮对话和生成式任务,未来需扩展到动态交互。数据规模有限,难以全面反映真实复杂场景。模型评估未考虑多模态连续性和动态变化,未来需引入更丰富的场景和任务设计。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,食材代表视觉信息,调味料代表语音内容。模型就像厨师,要把调味料和食材结合起来,做出一道美味的菜肴。但有时候,厨师会搞错,把调味料放到错的食材上,或者把菜炒到不对的时间点。这就像模型产生的幻觉——它们会把语音和视频内容混淆,做出不符合实际的“菜”。这项研究就像是给厨师们设计了一套测试,看看他们是否能正确把调味料和食材配对,做出真正的菜。通过这个测试,我们可以知道模型在哪些地方容易出错,未来可以帮他们变得更聪明,做出更靠谱的菜。

简单解释 像给14岁少年讲一样

你知道在看视频的时候,有时候电脑会搞错,把一些不存在的东西告诉你吗?比如视频里没有狗,但它说有狗在叫。或者它说人正在做某件事,但其实根本没有。这个问题叫做“幻觉”,就是模型自己想象出来的内容。最近的研究发现,这些模型在理解视频和语音内容时,经常会出现这种错误。科学家们设计了一套特别的测试,让模型回答一些关于视频和语音的问题,比如:视频里是不是有某个物体?或者:讲述的事件是不是正在发生?他们发现,大部分开源模型在这些测试中表现很差,几乎和随机猜一样,而一些商业模型表现还不错。这个研究告诉我们,虽然模型在识别单一内容方面很厉害,但把语音和视频结合起来理解时,还存在很大问题。未来,我们希望让模型变得更聪明,能更准确地理解视频中的内容,避免出现“幻觉”,让它们在实际应用中更可靠。

原文摘要

Despite the success of audio-visual large-language models (LLMs), they can produce plausible but ungrounded outputs, termed hallucination. Existing benchmarks focus on environmental sounds (e.g., dog barking) to indicate event occurrence. In contrast, human speech carries fundamentally different, rich semantics and temporal structures, yet it remains unexplored whether current models can accurately align speech content with corresponding visual signals. In this work, we show that speech content can induce hallucinations in audio-visual LLMs. To systematically study this, we introduce SVHalluc, the first comprehensive benchmark for evaluating speech-vision hallucination in audio-visual LLMs. Our benchmark diagnoses speech-vision hallucinations from two critical and complementary aspects: semantic and temporal. Experimental results demonstrate that state-of-the-art open-source audio-visual LLMs struggle with aligning speech content with corresponding visual signals, with a near-random accuracy on multiple tasks. In contrast, Gemini 2.5 Pro significantly outperforms the open-source models. Our analysis suggests that their failures stem from limited ability in cross-modality understanding, despite strong performance in single-modality perception. Our work uncovers a new and fundamental limitation of current audio-visual LLMs and highlights the need for speech-grounded video comprehension. Project page: https://chenshuang-zhang.github.io/projects/svhalluc/.

eess.AS cs.AI cs.CV cs.LG cs.MM cs.SD