Trust Before Fusion: QIMG-7 and Source-Aware Resolution for Polluted Multimodal RAG

TL;DR

提出QIMG-7基准和SATR方法,提升多模态RAG在污染环境下的可靠性,平衡得分提升11.7分。

cs.CL 🔴 高级 2026-07-12 43 次浏览
Saadeldine Eletter Owais Aijaz Preslav Nakov
多模态 检索增强生成 污染 信任解析 基准测试

核心发现

方法论

研究提出了QIMG-7基准,用于评估多模态检索污染,并引入了源感知信任解析(SATR)方法。SATR无需训练,通过比较不同候选答案的来源可靠性,选择最可信的答案或回退到参数化答案。该方法在四个生成器/门控堆栈上进行了验证。

关键结果

  • 在gpt-4o-mini堆栈中,Full-MM支持从干净文本的0.908下降到污染文本的0.490,SATR的Field-Selector变体将平衡得分提高到0.816。
  • SATR在处理文本污染时表现优异,尤其在语义实体重写和图像混合攻击中。
  • 消融研究表明,显式的文本可靠性建模是性能提升的主要驱动因素。

研究意义

该研究解决了多模态RAG在污染环境下的脆弱性问题,提出的QIMG-7基准和SATR方法为学术界和工业界提供了新的评估和解决方案。通过选择性信任而非无条件融合,显著提高了生成准确性。

技术贡献

技术贡献包括设计了QIMG-7基准,涵盖七种图像攻击类型,并提出了无需训练的SATR方法,能够在多模态检索冲突中进行可靠性解析和答案选择。

新颖性

这是首次在多模态RAG中引入源感知信任解析,区别于以往的文本检索方法,SATR能够处理文本和图像的联合污染问题。

局限性

  • SATR方法对解析器的质量依赖较大,若解析器的证据可靠性判断不准确,可能影响性能。
  • 在某些开放权重模型上,信任路由可能导致污染文本下的性能下降。

未来方向

未来工作可以探索更复杂的信任解析模型,进一步提高在不同攻击类型下的鲁棒性,并扩展到更多的多模态应用场景。

AI 总览摘要

多模态检索增强生成(RAG)在处理知识密集型问题时常依赖外部证据。然而,检索到的内容可能不可靠,导致错误答案。为此,研究者们提出了QIMG-7基准和源感知信任解析(SATR)方法,以应对多模态检索污染问题。

QIMG-7基准测试涵盖四个数据集和七种图像攻击类型,提供了1,760行评估数据。研究发现,在污染文本下,传统的多模态融合方法表现不佳,而SATR方法通过评估候选答案的来源可靠性,显著提高了生成准确性。

SATR方法无需训练,能够在多模态检索冲突中进行可靠性解析和答案选择,尤其在处理文本污染时表现优异。尽管该方法在某些模型上依赖于解析器的质量,但其在提升多模态RAG的鲁棒性方面的贡献不可忽视。

深度分析

研究背景

多模态检索增强生成(RAG)近年来在知识密集型问答和生成任务中得到广泛应用。然而,检索到的内容可能包含错误信息,尤其是在多模态环境下,图像和文本的联合污染问题尚未得到充分研究。

核心问题

多模态RAG面临的核心问题是检索到的证据可能不可靠,导致生成错误答案。尤其是在长文本生成中,早期的事实错误可能在多段答案中传播。

核心创新

研究引入了QIMG-7基准和源感知信任解析(SATR)方法。QIMG-7基准提供了一个控制良好的测试环境,涵盖多种图像攻击类型。SATR方法无需训练,通过评估候选答案的来源可靠性,选择最可信的答案。

方法详解

  • �� 构建QIMG-7基准,涵盖四个数据集和七种图像攻击类型。
  • �� 引入SATR方法,比较参数化、文本和全多模态候选答案的来源可靠性。
  • �� 通过Field-Selector变体实现最佳平衡得分。

实验设计

实验在四个生成器/门控堆栈上进行,使用QIMG-7基准的1,760行评估数据。对比了参数化、文本和全多模态候选答案的表现,并进行了消融研究。

结果分析

实验结果显示,SATR方法在处理文本污染时表现优异,尤其在语义实体重写和图像混合攻击中。Field-Selector变体将平衡得分提高到0.816。

应用场景

该研究的应用场景包括知识密集型问答系统、多模态信息检索和生成任务,尤其在处理不可靠证据时表现出色。

局限与展望

SATR方法对解析器的质量依赖较大,若解析器的证据可靠性判断不准确,可能影响性能。在某些开放权重模型上,信任路由可能导致污染文本下的性能下降。

通俗解读 非专业人士也能看懂

想象你在厨房准备一顿大餐。你需要从不同的食材中挑选出最好的来做菜。多模态检索增强生成就像是从不同的食材中选择合适的组合,但有时你可能会拿到不新鲜的食材,这就是所谓的“污染”。研究者们提出了一种方法,就像一个聪明的厨师,能够识别哪些食材是新鲜的,哪些需要丢弃,从而确保你做出的每道菜都美味可口。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你需要从不同的线索中找出正确的答案。有时候,这些线索可能会误导你,就像一个陷阱。研究者们发明了一种工具,就像游戏中的超级道具,能帮你识别哪些线索是可靠的,哪些是骗人的。这样,你就能更快地找到正确答案,赢得游戏!

术语表

多模态检索增强生成 (RAG)

结合文本和图像的检索来增强生成模型的准确性。

用于提高知识密集型问答的准确性。

QIMG-7基准

用于评估多模态检索污染影响的测试基准。

测试多模态RAG在污染环境下的表现。

源感知信任解析 (SATR)

无需训练的方法,通过评估候选答案的来源可靠性来选择答案。

用于在多模态检索冲突中进行答案选择。

Field-Selector

SATR方法的一个变体,专注于平衡得分的提升。

在实验中表现出色,提升了平衡得分。

污染文本

包含错误信息或误导性内容的文本。

对多模态RAG的准确性构成挑战。

开放问题 这项研究留下的未解疑问

  • 1 如何在不依赖解析器质量的情况下提高SATR方法的鲁棒性?
  • 2 在更多的多模态应用场景中,SATR方法的表现如何?

应用场景

近期应用

知识密集型问答

SATR方法可以提高问答系统在处理不可靠证据时的准确性,适用于学术研究和商业应用。

远期愿景

多模态信息检索

通过改进SATR方法,可以在更多的多模态应用场景中实现更高的准确性和鲁棒性。

原文摘要

Multimodal retrieval-augmented generation (RAG) is often evaluated with clean evidence, yet real retrieval can return topically relevant but unreliable content: false text and misleading images from corrupted metadata, entity swaps, typographic overlays, semantic edits, adversarial patches, blends, or style transfer. We introduce QIMG-7, a controlled benchmark for multimodal retrieval pollution in multi-sentence factual QA, spanning four datasets, seven image-attack families, and 16 paired clean/polluted regimes, for 1,760 evaluation rows per method. Across four generator/gate stacks, naive multimodal fusion is brittle: in the main gpt-4o-mini stack, Full-MM support drops from 0.908 with clean text to 0.490 with polluted text, often making Parametric fallback safer than retrieval. We propose source-aware trust resolution (SATR), a training-free approach that compares Parametric, Text-only, and Full-MM candidate answers and selects among candidate answers or falls back based on source reliability. The Field-Selector variant achieves the best balanced score, 0.816, improving over Full-MM by 11.7 points and over the Cascaded Router by 2.7 points. Ablations show that, in this text-first setting, explicit text-reliability modeling is the dominant driver of these gains. Overall, in text-first factual QA with multimodal retrieval conflict, our results support selective trust rather than unconditional fusion. Artifacts are available at https://github.com/SaadElDine/Trust_Before_Fusion.

cs.CL