When Looking Is Not Enough: Visual Attention Structure Reveals Hallucination in MLLMs

TL;DR

LaSCD方法通过拉普拉斯能量减少视觉幻觉,提升准确率。

cs.CV 🔴 高级 2026-05-12 5 次浏览
Fanpu Cao Xin Zou Xuming Hu Hui Xiong
多模态 视觉注意力 幻觉 解码策略 机器学习

核心发现

方法论

本文提出了一种无训练解码策略LaSCD,通过拉普拉斯能量选择信息层并重新映射下一个token的logits。该方法利用视觉注意力的高频结构揭示幻觉的出现层和真实答案短暂恢复的层。

关键结果

  • LaSCD在CHAIR数据集上将幻觉减少了19.8%,在POPE数据集上平均准确率提高了7.9%。
  • 在HallusionBench评估中,LaSCD在所有比较方法中表现最佳,特别是在hardaACC和aACC指标上。
  • 在视频幻觉测试中,LaSCD表现出强大的鲁棒性,超越了基线方法。

研究意义

LaSCD方法显著减少了多模态大语言模型中的视觉幻觉问题,提升了模型在安全敏感应用中的可靠性,如医疗和自动驾驶领域。这项研究为理解视觉注意力结构如何影响模型输出提供了新的视角。

技术贡献

LaSCD通过拉普拉斯能量揭示视觉注意力的高频结构,提供了一种新的解码策略,与现有方法相比,避免了额外的训练步骤,减少了计算开销。

新颖性

这项研究首次利用视觉注意力的高频结构来识别幻觉的出现层,并提出了一种无训练的解码策略来减少幻觉。

局限性

  • LaSCD在某些复杂场景中可能无法完全消除幻觉,尤其是视觉信息不充分的情况下。
  • 该方法依赖于视觉注意力的结构信号,可能对某些模型架构不适用。

未来方向

未来的研究可以探索如何在不同的模型架构中应用LaSCD,并结合其他信号进一步减少幻觉。

AI 总览摘要

多模态大语言模型(MLLMs)在视觉推理和问题回答中起着关键作用,但仍然容易出现视觉幻觉,即生成的响应与图像内容相矛盾或提及不存在的对象。现有的方法多从解码角度修正幻觉,但未能解决幻觉产生的根本原因。本文提出了一种新的解码策略LaSCD,通过拉普拉斯能量揭示视觉注意力的高频结构,识别幻觉出现的层次并进行修正。实验结果表明,LaSCD在减少幻觉的同时保持了模型的整体能力,尤其是在安全敏感应用中具有重要意义。尽管如此,LaSCD在某些复杂场景中仍面临挑战,未来的研究可以进一步优化该方法以适应不同的模型架构和应用场景。

深度分析

研究背景

多模态大语言模型近年来发展迅速,结合视觉和语言预训练技术,已在视觉推理和开放式问题回答中取得了显著进展。然而,这些模型仍然容易出现视觉幻觉,生成的文本可能与图像不一致。这一问题在医疗和自动驾驶等安全敏感领域尤为重要。

核心问题

视觉幻觉是多模态模型中的一个核心问题,现有方法多从解码角度进行修正,但未能解决幻觉产生的根本原因。模型可能在视觉注意力仍然很高的情况下,内部漂移到错误的答案。

核心创新

本文提出了一种新的解码策略LaSCD,通过拉普拉斯能量揭示视觉注意力的高频结构,识别幻觉出现的层次并进行修正。该方法无需额外训练,减少了计算开销。

方法详解

  • �� 使用拉普拉斯能量计算视觉注意力的高频结构
  • �� 选择幻觉出现的层次和真实答案恢复的层次
  • �� 通过对比解码策略重新映射下一个token的logits
  • �� 结合低能量层进行可选的修正

实验设计

实验使用了CHAIR、POPE、HallusionBench等数据集,评估LaSCD在减少幻觉和保持模型能力方面的效果。实验设置包括不同的模型架构和数据集环境。

结果分析

LaSCD在CHAIR数据集上将幻觉减少了19.8%,在POPE数据集上平均准确率提高了7.9%。在HallusionBench评估中,LaSCD在所有比较方法中表现最佳。

应用场景

LaSCD可以直接应用于医疗诊断和自动驾驶等领域,减少视觉幻觉带来的风险,提高系统的可靠性。

局限与展望

LaSCD在某些复杂场景中可能无法完全消除幻觉,尤其是视觉信息不充分的情况下。未来的研究可以探索如何在不同的模型架构中应用LaSCD。

通俗解读 非专业人士也能看懂

想象你在厨房做饭。你有一个食谱,但有时你可能会误解步骤,导致做出错误的菜肴。LaSCD就像一个聪明的助手,它能在你做饭的过程中提醒你哪里可能出错,并帮助你纠正。它通过分析你在每个步骤中关注的重点,找出可能导致错误的地方,并提供建议以确保你做出正确的菜肴。

简单解释 像给14岁少年讲一样

想象一下你在玩一个游戏,你需要根据地图上的线索找到隐藏的宝藏。有时候,你可能会误解线索,导致你走错方向。LaSCD就像一个聪明的指南针,它能在你探索的过程中提醒你哪里可能出错,并帮助你纠正方向。它通过分析你在每个步骤中关注的线索,找出可能导致错误的地方,并提供建议以确保你找到正确的宝藏!

术语表

视觉幻觉 (Visual Hallucination)

模型生成的响应与图像内容不一致或提及不存在的对象。

在多模态模型中,视觉幻觉是一个常见问题,影响模型的可靠性。

拉普拉斯能量 (Laplacian Energy)

用于测量视觉注意力的高频结构,揭示幻觉出现的层次。

本文使用拉普拉斯能量来识别幻觉出现的层次并进行修正。

解码策略 (Decoding Strategy)

用于生成模型输出的策略,影响模型的准确性和可靠性。

LaSCD是一种新的解码策略,通过拉普拉斯能量减少幻觉。

多模态模型 (Multimodal Model)

结合视觉和语言信息进行推理和回答问题的模型。

多模态模型在视觉推理和开放式问题回答中起着关键作用。

注意力机制 (Attention Mechanism)

用于选择模型在处理信息时关注的重点,提高模型的性能。

注意力机制在多模态模型中用于处理视觉和语言信息。

开放问题 这项研究留下的未解疑问

  • 1 如何在视觉信息不充分的情况下减少幻觉?现有方法对视觉注意力依赖较大,可能不适用。
  • 2 如何在不同的模型架构中应用LaSCD?需要探索不同架构下的信号特征。

应用场景

近期应用

医疗诊断

LaSCD可以帮助减少医疗诊断中的视觉幻觉,提高诊断的准确性和可靠性。

远期愿景

自动驾驶

在自动驾驶中应用LaSCD可以减少视觉幻觉带来的风险,提高系统的安全性和可靠性。

原文摘要

Multimodal large language models (MLLMs) have become a key interface for visual reasoning and grounded question answering, yet they remain vulnerable to visual hallucinations, where generated responses contradict image content or mention nonexistent objects. A central challenge is that hallucination is not always caused by a simple lack of visual attention: the model may still assign substantial attention mass to image tokens while internally drifting toward an incorrect answer. In this paper, we show that the high-frequency structure of visual attention, measured by layer-wise Laplacian energy, reveals both the layer where hallucinated preferences emerge and the layer where the ground-truth answer transiently recovers. Building on this finding, we propose LaSCD (Laplacian-Spectral Contrastive Decoding), a training-free decoding strategy that selects informative layers via Laplacian energy and remaps next-token logits in closed form. Experiments on hallucination and general multimodal benchmarks show that LaSCD consistently reduces hallucination while preserving general capabilities, highlighting its potential as a faithful decoding paradigm. The code is available at https://github.com/macovaseas/LaSCD.

cs.CV cs.AI