Grounded Decoding: Retrieval-Anchored Probability Fusion for Faithful RAG

TL;DR

提出了一种无训练解码框架Grounded Decoding,改善RAG的事实一致性。

cs.LG 🔴 高级 2026-05-30 8 次浏览
Ibne Farabi Shihab Fariya Afrin Sanjeda Akter Anuj Sharma
解码 RAG 概率融合 事实一致性 检索

核心发现

方法论

该方法通过构建两个匹配的提示分布来改善RAG的事实一致性:一个是基于查询、检索文档和生成前缀的完整RAG分布,另一个是仅基于检索证据和相同前缀的检索分布。最终的下一个令牌分布通过概率单纯形上的KL-barycenter目标得到。

关键结果

  • 在ALCE、Natural Questions和FActScore上的实验表明,与标准RAG和竞争性解码基线相比,事实准确性和引用质量均有显著提高,同时保持流畅性。
  • 自适应加权方案在高冲突或低检索质量设置中提供额外的改进。
  • 检索分布是主要的改进来源,KL-barycenter公式优于线性混合。

研究意义

该研究提供了一种强大且高效的替代方法来改善RAG解码的忠实性,解决了大型语言模型在处理外部证据时的长期痛点。

技术贡献

提出了一种基于KL-barycenter的概率融合框架,提供了闭式规范化几何混合,并引入了基于分布不一致和检索器置信度的自适应加权策略。

新颖性

首次将KL-barycenter用于RAG解码中的概率融合,与现有的logit级干预方法相比,提供了更清晰的概率解释。

局限性

  • 在低置信度检索条件下可能过度依赖检索证据,影响生成的流畅性。
  • 需要双流解码过程,增加计算复杂度。

未来方向

未来研究可以探索如何进一步优化自适应加权策略,以提高在不同任务中的适用性和效率。

AI 总览摘要

随着检索增强生成(RAG)系统的规模扩大,确保外部证据的忠实性变得越来越具有挑战性。大型语言模型在遇到冲突时可能仍然优先考虑参数知识而不是检索信息。我们提出了一种新的无训练解码框架Grounded Decoding,旨在改善RAG的事实一致性而无需修改模型参数。

我们的方法构建了两个匹配的提示分布:一个是基于查询、检索文档和生成前缀的完整RAG分布,另一个是仅基于检索证据和相同前缀的检索分布。最终的下一个令牌分布通过概率单纯形上的KL-barycenter目标得到,提供了闭式规范化几何融合。这种公式在接地权重为零时自然恢复标准RAG,并随着接地强度的增加平滑地将概率质量转移到检索证据上。

我们进一步引入了一种冲突感知自适应加权方案,根据分布不一致和检索器置信度动态调整接地。实验表明,与标准RAG和竞争性解码基线相比,事实准确性和引用质量均有显著提高,同时保持流畅性。我们的结果表明,概率级融合为忠实RAG解码提供了强大且高效的替代方法。

深度分析

研究背景

检索增强生成(RAG)已成为将大型语言模型连接到外部知识来源的标准机制。然而,这些系统仍然难以确保检索证据的忠实性。虽然检索器提供了可以检查和引用的段落,生成器将其转化为流畅的响应,但这种分离并不能保证生成的输出完全得到提供的上下文支持。

核心问题

RAG模型在长篇问答和传记生成中尤其明显,其中响应包含多个原子事实,只有一部分由检索语料库明确支持。生成器可能仍然依赖参数知识,忽略相关证据,或生成看似合理但未在检索文档中得到支持的陈述。

核心创新

我们提出了一种新的无训练解码框架Grounded Decoding,通过构建两个匹配的提示分布来改善RAG的事实一致性。最终的下一个令牌分布通过概率单纯形上的KL-barycenter目标得到,提供了闭式规范化几何融合。

方法详解

  • �� 构建完整RAG分布,基于查询、检索文档和生成前缀。
  • �� 构建检索分布,仅基于检索证据和相同前缀。
  • �� 通过KL-barycenter目标融合两个分布。
  • �� 引入自适应加权方案,根据分布不一致和检索器置信度动态调整接地。

实验设计

我们在ALCE、Natural Questions和FActScore上进行了实验,评估了Grounded Decoding与标准RAG、CAD、AdaCAD、COIECD、CoCoA、DoLa和kNN-LM的性能。实验设置包括匹配的解码条件、检索段落、提示模板、引用格式、采样温度、截断策略、停止标准和最大生成长度。

结果分析

实验表明,Grounded Decoding在事实准确性和引用质量上优于标准RAG和竞争性解码基线,同时保持流畅性。自适应加权方案在高冲突或低检索质量设置中提供额外的改进。

应用场景

该方法可以直接应用于需要高事实一致性的长篇问答和传记生成场景。它对提高生成内容的可靠性和引用质量具有重要意义。

局限与展望

在低置信度检索条件下可能过度依赖检索证据,影响生成的流畅性。双流解码过程增加了计算复杂度,可能影响实时应用。

通俗解读 非专业人士也能看懂

想象一下你在厨房里做饭。你有一本食谱(检索文档)和你自己的烹饪经验(参数知识)。有时候,食谱和你的经验可能会有冲突,比如食谱说要加盐,而你的经验告诉你不需要。Grounded Decoding就像是一个聪明的助手,它会帮助你在每一步做决定时,考虑食谱和经验的意见,确保你做出的每道菜都符合食谱的要求,同时也不失你的个人风格。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你需要通过回答问题来赢得积分。游戏里有一个助手,它会给你提供一些提示(检索文档),但你也有自己的知识(参数知识)。有时候,提示和你的知识会有冲突,比如提示说答案是A,而你觉得是B。Grounded Decoding就像是一个超级助手,它会帮助你在每次回答问题时,考虑提示和你的知识,确保你的答案既符合提示,又不失你的个人风格。

术语表

Grounded Decoding (接地解码)

一种无训练解码框架,通过概率融合改善RAG的事实一致性。

用于提高生成内容的事实准确性。

RAG (检索增强生成)

一种将大型语言模型连接到外部知识来源的机制。

用于生成基于检索证据的响应。

KL-barycenter (KL重心)

一种概率融合方法,通过优化目标在概率单纯形上实现分布间的平衡。

用于融合完整RAG分布和检索分布。

自适应加权 (Adaptive weighting)

一种动态调整接地强度的策略,基于分布不一致和检索器置信度。

用于提高接地解码的灵活性。

检索分布 (Retrieval distribution)

仅基于检索证据和生成前缀的分布。

用于与完整RAG分布进行概率融合。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化自适应加权策略以提高在不同任务中的适用性?
  • 2 在低置信度检索条件下如何避免过度依赖检索证据?

应用场景

近期应用

长篇问答生成

提高生成内容的事实一致性和引用质量,适用于需要高可靠性的场景。

远期愿景

实时应用

在实时应用中实现高效的双流解码过程,确保生成内容的准确性和流畅性。

原文摘要

As retrieval-augmented generation (RAG) systems scale, it becomes increasingly challenging to ensure faithful grounding in external evidence. Large language models may still prioritize parametric knowledge over retrieved information when conflicts arise. We propose a novel training-free decoding framework, \emph{Grounded Decoding}, designed to improve factual consistency in RAG without modifying model parameters. Unlike standard approaches that rely on a single conditional distribution, our method constructs two matched-prompt distributions at every generation step: (1) a full RAG distribution conditioned on the query, retrieved documents, and generated prefix, and (2) a retrieval-only distribution conditioned solely on retrieved evidence and the same prefix. The final next-token distribution is derived as the unique solution to a KL-barycenter objective over the probability simplex, yielding a normalized geometric fusion of the two distributions.This formulation naturally recovers standard RAG when the grounding weight is zero and smoothly shifts probability mass toward retrieved evidence as grounding strength increases. We further introduce a conflict-aware adaptive weighting scheme that dynamically adjusts grounding based on distributional disagreement and retriever confidence. Experiments on ALCE, Natural Questions, and FActScore demonstrate consistent improvements in factual accuracy and citation quality over standard RAG and competitive decoding-time baselines, while maintaining fluency. Our results indicate that probability-level fusion provides a strong and efficient alternative to logit-level intervention methods for faithful RAG decoding.

cs.LG