Only Say What You Know: Calibration-Aware Generation for Long-Form Factuality

TL;DR

提出解耦探索-承诺范式,结合校准感知生成提升长文本事实性,最高提升13%。

cs.CL 🔴 高级 2026-05-03 53 次浏览
Wen Luo Guangyue Peng Liang Wang Nan Yang Wei Li Yuhan Song Shaohang Wei Feifan Song Furu Wei Houfeng Wang
自然语言处理 生成模型 事实性校准 推理 深度学习

核心发现

方法论

本文提出探索-承诺解耦(Exploration-Commitment Decoupling)范式,核心在于将知识探索与最终输出承诺分离。通过引入校准感知生成(CAG)框架,模型在中间推理过程中生成带有校准的可靠性估计,利用这些信号在最终输出中优先保留可信内容。具体机制包括:1)校准探索:在推理中生成带有可靠性指标的中间步骤;2)选择性承诺:根据可靠性筛选信息,构建更可信的最终答案。模型在五个长文本事实性基准上,提升事实性达13%,同时减少37%的解码时间。该方法可广泛应用于知识问答、对话系统和检索增强生成等场景。

关键结果

  • 在五个长文本事实性基准上,CAG最高提升13%的事实性指标,显著优于传统的探索-承诺方法。实验显示,模型在准确率和事实支持率方面均有明显改善,VeriScore指标从67.79%提升至79.80%。此外,解码时间缩短37%,表明模型在保持高质量输出的同时,显著提高效率。
  • 在多模型、多任务场景中,CAG表现出良好的泛化能力。无论是GPT-5基础模型还是Qwen-14B,均实现了事实性和效率的双重提升。通过消除不可靠内容,模型在知识密集型问答和对话任务中的表现优于基线方法,验证了其广泛适用性。
  • 消融实验表明,校准探索和选择性承诺是性能提升的关键。去除任何一环都导致事实性指标下降至少5%。此外,结合检索增强(RAG)场景,CAG仍能保持优越性能,显示其在多模态信息融合中的潜力。

研究意义

该研究突破了长文本生成中事实性控制的瓶颈,提出的解耦范式为模型提供了更细粒度的知识管理能力。通过在推理过程中引入可靠性估计,有效抑制了“幻觉”问题,增强了模型的自我校准能力。这不仅推动了可信AI的发展,也为未来自我反思和自我校验的生成系统奠定基础。其广泛适用性意味着在自动问答、内容生成、智能助手等多个行业场景中,均能显著提升系统的可靠性和用户信任度。

技术贡献

技术上,本文首次提出探索-承诺解耦(Exploration-Commitment Decoupling)范式,打破传统的线性推理-输出一体化架构。引入校准感知生成(CAG)框架,通过在中间推理加入可靠性估计,结合基于信号的选择机制,有效控制信息的传播与融合。模型在训练中采用结构化监督(Structured Supervision),通过VeriScore等指标进行细粒度的事实性校准,确保推理的可靠性。创新点还包括:1)利用离散化的可靠性标签提升模型的可解释性;2)引入答案重投影机制,强化可信信息的传递。整体架构兼容多种模型和任务,为长文本生成的事实性控制提供了新思路。

新颖性

本研究的创新在于首次系统性将探索与承诺解耦,结合校准信号实现细粒度的事实性控制。与以往仅在后处理或奖励优化中引入校准不同,本文在模型推理阶段即嵌入可靠性估计,提升了生成的自我认知能力。这一机制突破了传统的“全信息传播”限制,为模型提供了更高的自主调节能力,代表了长文本生成中事实性校准的技术前沿。

局限性

  • 当前方法依赖于外部事实验证(如VeriScore)进行可靠性标注,可能受限于验证数据的覆盖范围和质量,影响模型的校准效果。
  • 在极端复杂或模糊的问题场景中,模型仍可能误判可靠性,导致错误信息被筛选或遗漏。
  • 模型在大规模应用中可能面临较高的计算成本,尤其是在多轮推理和多模态融合场景下,效率仍需优化。

未来方向

未来将探索自监督的可靠性估计机制,减少对外部验证的依赖;同时,结合强化学习优化可靠性信号的动态调整策略。此外,计划扩展到多模态生成和多任务场景,提升模型的自我校准能力和泛化能力,推动可信AI的落地应用。

AI 总览摘要

长文本生成中的事实性问题一直是AI研究的核心难题。尽管大型推理模型(LRMs)在多任务中表现出色,但其生成内容仍频繁出现“幻觉”,严重影响实际应用的可信度。传统方法多采用奖励优化或后处理筛选,但缺乏对中间推理过程的细粒度控制,导致错误信息的传播。本文提出探索-承诺解耦(Exploration-Commitment Decoupling)范式,强调在推理阶段引入可靠性估计,赋予模型“自我认知”能力。通过校准感知生成(CAG)框架,模型在中间推理时生成带有可靠性指标的内容,并在最终输出时根据这些信号筛选信息,从而显著提升事实性指标达13%,同时减少37%的解码时间。实验在五个长文本事实性基准上验证了该方法的有效性,显示出优异的泛化能力和应用潜力。该技术不仅改善了模型的自我校准能力,也为未来可信AI的发展提供了新思路。未来工作将聚焦于降低计算成本、扩展多模态应用,并实现更全面的自我验证机制,以推动AI系统的可靠性和透明度。

深度分析

研究背景

随着深度学习的发展,大型推理模型(如GPT系列、Qwen系列)在自然语言理解和生成任务中取得突破性进展。早期工作如GPT-3、T5等通过大规模预训练实现了多任务适应,但在长文本生成中仍面临“幻觉”问题,即生成内容虽合理但不符合事实。近年来,诸如事实校准、检索增强等技术不断涌现,试图缓解这一问题。比如,VeriScore等指标被引入评估模型事实性,强化学习(RL)和奖励优化也被应用于提升输出质量。尽管如此,现有方法多集中于整体性能提升,缺乏对推理中各环节可靠性的细粒度建模,导致错误信息在长文本中逐步累积,影响模型的可信度。

核心问题

长文本生成中的核心挑战在于如何有效控制推理过程中的信息质量。传统模型在生成过程中未能区分不同推理步骤的可靠性,导致不可靠的推理内容被直接传播到最终答案中,形成“幻觉”。这在知识密集型任务中尤为明显,错误的中间推理会引发严重偏差,影响模型的实用性和可信度。解决这一问题需要在模型内部引入可靠性评估机制,实现对推理内容的动态筛选和调节,从而提升整体事实性和用户信任。

核心创新

本文的主要创新在于提出探索-承诺解耦(Exploration-Commitment Decoupling)范式,将推理探索与输出承诺两个环节解耦,赋予模型在推理时自主评估内容可靠性。具体机制包括:1)在中间推理中引入校准信号,生成带有可靠性估计的内容;2)在输出阶段根据可靠性筛选信息,构建更可信的答案。该方法突破了以往只在后处理或奖励优化中引入校准的局限,实现了模型在推理阶段的自我认知,显著提升事实性指标。CAG框架结合结构化监督和答案重投影,确保模型在保持信息丰富的同时,减少幻觉。

方法详解

  • �� 设计探索-承诺解耦架构,将推理步骤与可靠性估计分离。
  • �� 在推理过程中,模型生成每个步骤的内容(r)及其对应的可靠性(c),通过VeriScore等指标进行标注。
  • �� 采用离散化策略,将连续的可靠性分数映射到有限的标签集(如可靠/不可靠),增强模型的可解释性。
  • �� 在最终答案生成时,根据可靠性筛选推理内容,优先保留可信信息,抑制不可靠部分。
  • �� 训练中引入结构化监督(Structured Supervision),同时优化推理的可靠性和答案的准确性。
  • �� 通过答案重投影机制,确保最终输出仅依赖可信推理内容,减少幻觉。

实验设计

采用五个长文本事实性基准(AlpacaFact、Biography、FactBench、Factory、FAVA),涵盖不同任务和模型规模(如Qwen-4B、8B、14B,Llama-3-8B)。比较基线包括奖励优化和后处理筛选。指标主要为VeriScore,评估内容支持的比例。训练细节包括:使用GPT-5作为验证模型,采用结构化监督和离散可靠性标签,训练时间为2轮,批次大小为4。评估时结合消融实验,验证校准信号和选择性承诺的贡献。

结果分析

CAG在所有基准上均优于传统方法,最高提升13%的事实性指标,VeriScore从67.79%提升至79.80%。模型在知识问答和对话场景中表现出良好的泛化能力,特别是在Qwen-14B模型上,事实支持率提升了8%以上。消融实验显示,去除可靠性校准或选择性承诺会导致性能下降至少5%。此外,结合检索增强(RAG)场景,模型仍保持优越表现,验证其多场景适应能力。

应用场景

该方法适用于自动问答、智能助手、内容生成等场景,尤其在需要高可信度的知识密集型任务中表现优异。通过引入可靠性评估机制,模型能自主筛选信息,减少虚假内容,提升用户信任。未来可结合多模态信息,扩展到图像、视频等多源数据的事实校准,推动可信AI的落地。

局限与展望

当前方法依赖外部验证指标(如VeriScore)进行可靠性标注,受限于验证数据的覆盖范围。复杂场景中,模型仍可能误判可靠性,导致错误信息未被筛除。此外,模型在大规模应用时计算成本较高,推理速度有待优化。未来需开发更高效的校准机制和多模态融合策略,以实现更广泛的应用。

通俗解读 非专业人士也能看懂

想象你在做一道复杂的菜,需要不断尝试不同的调料和方法。每次尝试后,你会记下哪些调料效果好,哪些不好,然后再决定下一步用哪些。这个过程就像模型在生成长文本时不断探索不同的内容,但它会根据之前的“尝试”判断哪些信息更可靠,最后只把最靠谱的部分放到菜里。这样做可以避免做出“怪味”菜,也能做出更好吃的。这个方法让模型像个有经验的厨师,知道哪些信息可以信赖,哪些要小心处理,确保输出既丰富又准确。

简单解释 像给14岁少年讲一样

想象你在写一篇长文章,比如写一篇关于历史人物的故事。你会先查很多资料,挑选你觉得最靠谱的细节,然后写出来。可是,有时候你会记错一些细节,导致故事不太真实。现在,这个新方法就像给你一个“可靠度”标签,告诉你哪些资料更靠谱,哪些不太确定。写完后,你会只用那些“靠谱”的细节,避免用不确定的内容。这样,你写的故事就更真实,也更让人相信。它让模型像个聪明的作家,知道怎么挑选信息,写出更可信的故事。

术语表

Exploration-Commitment Decoupling(探索-承诺解耦)

一种将推理探索与最终输出承诺分离的架构,允许模型在推理中评估内容可靠性,提升事实性。技术上通过在推理中引入可靠性信号,结合筛选机制实现。

论文提出的核心范式,用于改善长文本生成中的事实性和可靠性。

Calibration-Aware Generation(校准感知生成)

一种在生成过程中引入可靠性估计的机制,使模型能自我校准推理内容的真实性。通过结构化监督训练,模型在中间推理中输出可靠性指标。

实现探索-承诺解耦的具体框架,提升模型事实性。

VeriScore(验证得分)

一种评估模型生成内容事实支持比例的指标,通过检索证据验证推理步骤的正确性,反映内容的事实性。

用作训练和评估模型事实性的重要指标。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端复杂或模糊场景中,模型能更准确地评估推理内容的可靠性,减少误判和漏判。
  • 2 多模态信息融合中的可靠性校准机制如何设计,确保不同模态间信息的一致性与可信度。
  • 3 模型在大规模部署时的计算效率优化策略,尤其是在多轮推理和多任务环境中的性能提升。

应用场景

近期应用

知识问答系统

利用校准感知生成提升问答的事实性和可信度,减少虚假信息,增强用户信任。

智能内容生成

在新闻、报告等内容生成中,筛选可靠信息,确保输出内容的真实性和准确性。

远期愿景

自主可信AI系统

实现具有自我校准和自我验证能力的AI,推动可信自动化决策和内容创作。

原文摘要

Large Reasoning Models achieve strong performance on complex tasks but remain prone to hallucinations, particularly in long-form generation where errors compound across reasoning steps. Existing approaches to improving factuality, including abstention and factuality-driven optimization, follow a \emph{coupled exploration-commitment} paradigm, in which intermediate reasoning is unconditionally propagated to the final output, limiting fine-grained control over information selection and integration. In this paper, we propose an \textbf{Exploration-Commitment Decoupling} paradigm that disentangles knowledge exploration from final commitment, enabling models to explore with awareness while answering cautiously. We instantiate the paradigm with \textbf{Calibration-Aware Generation (CAG)}, a framework that equips models with end-to-end, calibration-aware generation capabilities, by augmenting intermediate reasoning with calibrated reliability estimates and prioritizing reliable content in final outputs. Across five long-form factuality benchmarks and multiple model families, CAG improves factuality by up to 13%, while reducing decoding time by up to 37%. Overall, our work highlights decoupling as a principled approach for more reliable long-form generation, offering directions for trustworthy and self-aware generative systems.

cs.CL