Does RAG Know When Retrieval Is Wrong? Diagnosing Context Compliance under Knowledge Conflict

TL;DR

CDD方法提升RAG模型在知识冲突下的准确性,特别是在实体替换和逻辑矛盾上。

cs.CL 🔴 高级 2026-05-14 4 次浏览
Yihang Chen Pin Qian Su Wang Sipeng Zhang Huan Xu Shuhuai Lin Xinpeng Wei
RAG 知识冲突 上下文合规 机器学习 自然语言处理

核心发现

方法论

本文提出了上下文驱动分解(CDD)方法,旨在诊断RAG模型在知识冲突下的上下文合规性。CDD通过五个步骤进行分解:提取上下文答案、提取参数化答案、比较两者、隔离冲突前提、解决冲突。该方法使得模型在处理冲突时的行为可观察和可测试。

关键结果

  • 在TruthfulQA误解注入测试中,标准RAG模型的准确率仅为15.0%,而CDD方法提高到62.0%。
  • 在Epi-Scale测试中,CDD在实体替换和逻辑矛盾的准确率分别达到88.0%和83.2%,显著高于基线模型。
  • CDD在Gemini-2.5-Flash模型上显示出对抗性准确率的提升,尤其在Claude变体中表现出方向性增益。

研究意义

该研究通过揭示RAG模型在知识冲突下的行为,提供了一种新的观察和诊断方法。CDD方法不仅提高了模型在特定冲突类型下的准确性,还为未来的模型改进提供了新的思路。该方法的提出有助于增强模型在处理复杂信息时的鲁棒性,具有重要的学术和实际应用价值。

技术贡献

CDD方法通过显式的冲突分解步骤,使得RAG模型在知识冲突下的行为可观察。与现有方法相比,CDD不仅提高了模型的准确性,还揭示了模型在冲突处理中的潜在机制。这为未来的模型设计提供了新的理论和工程可能性。

新颖性

CDD首次将冲突处理视为可观察问题,通过上下文和参数化答案的分解,使得模型在冲突下的行为可测试。这种方法与传统的RAG模型不同,提供了新的视角和工具。

局限性

  • CDD方法在处理非局部化冲突(如时间转移和干扰证据)时,效果不如在局部化冲突中显著。
  • 该方法在计算资源上要求较高,尤其是在大规模数据集上的应用。

未来方向

未来的研究可以探索CDD方法在不同模型架构上的适用性,以及如何降低其计算成本。此外,可以研究如何将CDD与其他冲突检测和解决方法结合,以提高模型的整体性能。

AI 总览摘要

在处理复杂信息时,RAG模型通常依赖于检索到的证据。然而,当这些证据与模型的先验知识发生冲突时,模型的表现可能会受到严重影响。现有的方法往往忽视了这一问题,仅关注最终答案的正确性。

本文提出了一种新的方法——上下文驱动分解(CDD),通过将冲突分解为多个步骤,使得模型在处理冲突时的行为可观察和可测试。实验结果表明,CDD方法在处理实体替换和逻辑矛盾等局部化冲突时,显著提高了模型的准确性。

尽管CDD方法在特定类型的冲突下表现出色,但在处理非局部化冲突时,其效果不如预期。未来的研究可以探索如何将CDD与其他方法结合,以提高模型的整体性能,并降低其计算成本。

深度分析

研究背景

随着自然语言处理技术的发展,检索增强生成(RAG)模型在处理复杂信息时表现出色。然而,当检索到的证据与模型的先验知识发生冲突时,模型的表现可能会受到影响。现有的方法往往忽视了这一问题,仅关注最终答案的正确性。

核心问题

RAG模型在知识冲突下的表现往往不稳定,尤其是在检索到的证据与模型的先验知识不一致时。如何有效地检测和处理这些冲突,是一个亟待解决的问题。

核心创新

本文提出的上下文驱动分解(CDD)方法,通过显式的冲突分解步骤,使得模型在冲突下的行为可观察。这种方法不仅提高了模型的准确性,还揭示了模型在冲突处理中的潜在机制。

方法详解

  • �� 提取上下文答案:从检索到的证据中提取答案。
  • �� 提取参数化答案:从模型的先验知识中提取答案。
  • �� 比较两者:检测两者之间的冲突。
  • �� 隔离冲突前提:识别导致冲突的具体前提。
  • �� 解决冲突:通过分析和调整,解决冲突并生成最终答案。

实验设计

实验在Epi-Scale数据集上进行,包含2250个基础样本和2250个对抗样本。使用标准RAG、CDD和其他基线模型进行比较,评估CDD在不同冲突类型下的表现。

结果分析

CDD在实体替换和逻辑矛盾的准确率分别达到88.0%和83.2%,显著高于基线模型。这表明CDD在处理局部化冲突时具有显著优势。

应用场景

CDD方法可以应用于需要处理复杂信息的领域,如法律、医学和金融等。通过提高模型在冲突下的准确性,CDD可以增强这些领域的自动化决策能力。

局限与展望

CDD方法在处理非局部化冲突时效果不如预期。此外,该方法在计算资源上要求较高,尤其是在大规模数据集上的应用。未来的研究可以探索如何降低其计算成本。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你有一本食谱(模型的先验知识),但朋友给你发了一条信息,说某种食材有毒(检索到的证据)。你需要决定是否相信这条信息。CDD方法就像一个助手,它帮助你分析这条信息是否可信,并指导你做出正确的决定。通过分解问题,CDD可以帮助你更好地理解和处理这些冲突。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,游戏里有个问题需要回答。你有一本游戏指南(模型的先验知识),但游戏里突然出现了一条提示,说指南是错的。你需要决定相信哪个。CDD就像一个聪明的助手,帮你分析这些信息,找出哪个是对的。它会一步步地帮你解决问题,让你在游戏中取得更好的成绩!

术语表

RAG (检索增强生成)

一种结合检索和生成的模型,通过检索外部证据来增强生成答案的准确性。

在处理复杂信息时,RAG模型常用于提高答案的准确性。

CDD (上下文驱动分解)

一种分解冲突的诊断方法,通过五个步骤使模型在冲突下的行为可观察。

CDD用于诊断RAG模型在知识冲突下的表现。

上下文合规

指模型在回答问题时是否遵循检索到的证据,即使这些证据与模型的先验知识冲突。

研究中用于评估模型在知识冲突下的表现。

实体替换

一种对抗样本生成方法,通过替换文本中的实体来制造冲突。

在实验中用于测试模型在局部化冲突下的表现。

逻辑矛盾

文本中存在的逻辑不一致,可能导致模型生成错误答案。

在实验中用于测试模型在逻辑冲突下的表现。

开放问题 这项研究留下的未解疑问

  • 1 如何在不增加计算成本的情况下提高CDD方法的适用性?
  • 2 如何将CDD与其他冲突检测方法结合,以提高模型的整体性能?

应用场景

近期应用

法律文档分析

CDD可以用于分析法律文档中的冲突信息,帮助律师更快地找到关键证据。

医学诊断

在医学领域,CDD可以帮助医生识别和处理诊断信息中的冲突,提高诊断的准确性。

远期愿景

智能决策系统

通过提高模型在复杂信息下的鲁棒性,CDD有望推动智能决策系统的发展,应用于各个行业。

原文摘要

Retrieval-Augmented Generation (RAG) is usually evaluated by whether the final answer is correct. Under knowledge conflict, this hides a key question: did the model follow retrieved evidence, rely on its parametric prior, or produce a post-hoc rationale? We study this as context compliance, the regime in which retrieved context controls the answer even when it conflicts with the model's prior knowledge. We introduce Context-Driven Decomposition (CDD), an inference-time diagnostic intervention that elicits contextual and prior answers, isolates the conflicting premise, and records a resolution trace that can be perturbed. Across Epi-Scale stress tests, TruthfulQA misconception injection, and cross-model reruns, CDD makes three behaviors visible. First, misleading retrieval can severely degrade accuracy: under a worst-case TruthfulQA misconception-injection probe, Standard RAG reaches only 15.0%. Second, better answers need not share the same mechanism: CDD improves adversarial accuracy on Gemini-2.5-Flash and shows directional gains across Claude variants, yet trace-perturbation sensitivity is high only on Gemini. Third, explicit decomposition improves controlled-conflict robustness over a conflict-aware instruction baseline on localized factual conflicts, with the clearest margins on Entity Swap (88.0% vs 79.3%) and Logical Contradiction (83.2% vs 75.4%). We frame RAG conflict handling as an observability problem.

cs.CL cs.AI