Diversity-Oriented Fine-Tuning for Uncertainty-Based Hallucination Detection

TL;DR

提出多样性导向微调策略(SFT和DPO),提升模型在语义熵检测中的假象识别能力。

cs.AI 🔴 高级 2026-07-18 41 次浏览
Qiuyuan Li Hongliang Dai Piji Li
大模型 假象检测 微调策略 语义熵 生成多样性

核心发现

方法论

本研究基于语义熵检测框架,采用两种微调策略:一是基于监督微调(SFT),通过多样性答案增强模型输出变异性;二是基于直接偏好优化(DPO),优化模型在多样性回答中的偏好。实验中,利用SQuAD、TriviaQA和NQ-Open数据集,结合LLaMA-3-8B、Qwen-2.5-7B等模型,比较微调前后模型在假象检测中的表现。通过引入多样性生成机制,显著提高模型在多次采样中产生不同答案的能力,从而增强语义熵指标的敏感性。结果显示,微调后模型减少低熵假象回答的生成,提高假象识别的准确率,检测性能优于或接近现有最优方法。

关键结果

  • 微调后模型在TriviaQA、SQuAD和NQ-Open数据集上的AUROC提升平均达4.5%,在部分数据集提升幅度超过6%。特别是在NQ-Open的开放域任务中,模型通过多样性生成增强了对语义不一致的敏感性,有效提升假象检测能力。
  • 结合SFT和DPO策略的模型(Diverse SFT + DPO)在所有测试集均表现优异,AUROC值最高,达0.839(Qwen模型),明显优于未微调模型(0.732-0.778)和单一策略微调模型。
  • 分析显示,微调增强了模型在多次采样中产生不同答案的能力,尤其在假象案例中,语义不一致性显著提高,语义熵的分布也更有区分度,从而改善了假象的检测效果。

研究意义

本研究首次在微调阶段系统性提升大模型的假象检测能力,突破了传统仅在推理阶段依赖后处理的局限。通过引入多样性导向微调策略,有效缓解模型输出重复、低熵的问题,增强了模型对潜在假象的敏感性。这不仅丰富了大模型的安全性和可靠性研究,也为未来在实际应用中实现更鲁棒的事实验证提供了技术路径。该方法兼具理论创新与工程实用价值,有望推动大模型在知识问答、内容审核等场景中的广泛应用。

技术贡献

本文提出两种创新微调策略:一是基于多样性答案的监督微调(SFT),通过构建多样性标注数据,提升模型输出的变异性;二是基于偏好优化(DPO),利用偏好对比学习,强化模型在多样性回答中的偏好表达。这两者结合,显著增强模型在多次采样中的语义差异性,从而提高语义熵检测的敏感性。与传统微调方法不同,本研究强调在训练阶段引入多样性机制,主动塑造模型输出的多样性特征,突破了以往仅在推理后期进行检测的限制。此外,结合具体算法如bi-directional entailment的语义聚类和信息熵计算,提供了理论上的保证和实证验证。

新颖性

本研究首次系统性将多样性导向微调策略应用于大模型的假象检测,突破了以往仅在推理阶段依赖后验检测的局限。通过在训练阶段引入多样性答案生成和偏好对比,显著提升模型在多样性生成和语义熵指标上的表现。这种训练-检测结合的创新方法,为模型安全性提供了新的技术路径,也丰富了生成模型的调控机制,具有较强的创新性和实用价值。

局限性

  • 该方法在开放域任务中可能受到多样性过度引导导致的语义碎片化影响,尤其在多答案场景下,正确答案的语义变异可能被误判为假象。
  • 微调过程依赖大量多样性数据的构建,数据采集和验证成本较高,且在极端复杂任务中效果仍有限。
  • 模型在某些特定场景下仍可能出现低熵假象输出,说明微调策略在极端罕见或复杂事实推理中仍需优化。

未来方向

未来将探索多模态信息融合,结合知识图谱和外部知识库,进一步提升假象检测的鲁棒性。还计划引入自适应多样性调控机制,根据任务难度动态调整多样性生成参数,优化模型在不同场景下的表现。除此之外,将研究多任务联合训练策略,兼顾多样性和准确性,推动模型在实际应用中的广泛部署。

AI 总览摘要

大规模语言模型(LLMs)在自然语言处理领域取得了巨大突破,但其生成内容中的假象问题依然严重,限制了其在知识密集型任务中的应用。传统的假象检测多依赖推理后处理技术,存在效果有限、依赖外部验证等弊端。本文提出一种创新的多样性导向微调策略,通过在训练阶段引入多样性答案生成(SFT)和偏好优化(DPO),显著提升模型在语义熵检测中的假象识别能力。具体而言,SFT通过构建多样性标注数据,鼓励模型输出丰富变异的答案;DPO则利用偏好对比学习,强化模型在多样性回答中的偏好表达。这两者结合,有效增强模型在多次采样中产生不同答案的能力,从而提高语义不一致性检测的敏感性。实验结果显示,在TriviaQA、SQuAD和NQ-Open等多个数据集上,微调后模型的AUROC提升平均达4.5%,在部分场景中超过6%。特别是在开放域任务中,模型通过多样性生成增强了对潜在假象的检测能力。该方法不仅在学术上具有创新意义,也为工业界提供了提升模型安全性和可靠性的实用路径。未来,结合多模态信息和动态多样性调控,将进一步推动大模型在实际应用中的安全性和智能水平。整体而言,本研究为大模型的安全性提升提供了新的技术思路,具有重要的理论和实践价值。

深度分析

研究背景

近年来,大模型在自然语言理解和生成方面取得了突破性进展,代表性工作包括GPT系列、LLaMA、PaLM等。这些模型在多任务、多领域表现出强大能力,但也暴露出生成内容的假象问题,即模型输出看似合理但事实错误或无依据。现有的假象检测方法主要分为外部验证、基于不确定性和一致性、以及表示学习等,虽然取得一定效果,但在模型输出重复、低熵时效果有限。随着模型规模和应用场景的扩大,提升假象检测的鲁棒性成为亟需解决的问题。本研究关注在训练阶段引入多样性机制,旨在从根本上改善模型输出的多样性和语义一致性,为后续检测提供更强的依据。

核心问题

大模型在多次采样中常出现重复低熵回答,导致语义熵检测难以识别潜在假象。这一问题源于模型在训练中偏向生成高置信度、低变异性的答案,限制了其在不确定性检测中的表现。尤其在开放域问答场景中,模型可能因训练偏差或数据分布问题,输出高度一致的错误答案,形成假象但难以被检测到。传统检测方法在此背景下效果不佳,亟需在模型训练阶段引入机制,增强输出的多样性和语义差异,从而提升检测的敏感性和准确性。

核心创新

本研究的核心创新在于引入多样性导向的微调策略,结合SFT和DPO两种机制:

  • �� SFT通过构建多样性标注数据,鼓励模型在回答同一问题时输出多变的答案,增强多样性。
  • �� DPO利用偏好对比学习,优化模型在多样性回答中的偏好表达,使模型在单次推理中生成丰富的答案集合。
  • �� 两者结合,系统性提升模型在多次采样中的语义差异性,从而增强语义熵指标的检测能力。这种训练策略不同于传统微调,强调在训练阶段主动塑造输出多样性,为假象检测提供更强的理论基础和实证支持。

方法详解

  • �� 构建多样性微调数据:采用迭代生成和语义验证,确保每个问题对应多样化但语义一致的答案集。
  • �� SFT训练:利用多样性答案集,最大化模型在多样性答案上的条件概率,促进输出变异。
  • �� DPO训练:在偏好对比框架下,利用偏好样本(多样性强的答案集)与非偏好样本(重复答案)进行对比学习,强化模型偏好多样性回答。
  • �� 结合两者:先进行SFT微调,再进行DPO优化,形成完整的训练流程。
  • �� 评估:采用语义聚类和信息熵指标,检测模型在多次采样中的输出差异,验证微调效果。

实验设计

采用TriviaQA、SQuAD、NQ-Open三大问答数据集,比较微调前后模型在AUROC指标上的表现。模型包括LLaMA-3-8B、Qwen-2.5-7B等,采用高温采样生成多样答案,低温生成正确参考答案。微调采用LoRA参数高效策略,训练轮次为4-5轮,调节学习率和批次大小。对比基线包括未微调模型和仅用标准SFT模型。重点在于验证多样性生成对假象检测的提升效果,分析语义熵分布变化,进行消融实验验证不同策略的贡献。

结果分析

微调后模型在所有数据集上的AUROC均有明显提升,平均提升4.5%,最高达0.839(Qwen模型)。多样性增强使模型在多次采样中产生差异化答案,特别在假象案例中,语义不一致性显著增加,检测敏感性提高。结合SFT和DPO策略的模型表现优异,验证了多样性导向微调的有效性。分析显示,微调显著增强了模型在潜在假象中的语义差异性,提升了检测的准确率和鲁棒性。

应用场景

该方法适用于知识问答、内容审核、事实验证等场景,特别在需要识别潜在虚假信息的应用中。模型在训练阶段引入多样性机制后,能够更敏感地检测出潜在假象,提高系统的可靠性。未来可结合外部知识库和多模态信息,进一步增强模型的事实一致性和鲁棒性,推动智能内容审核和自动事实核查的发展。

局限与展望

该策略在开放域任务中可能受到多样性过度导致的语义碎片化影响,尤其在多答案场景中,正确答案的语义变异可能被误判为假象。微调成本较高,数据采集和验证复杂,且在极端复杂或罕见场景中效果仍有限。未来需优化多样性生成的平衡机制,减少误判,提高效率。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,平时你总是用一样的食材和方法,做出来的菜都差不多。现在你尝试加入一些不同的调料或换个做法,虽然菜的味道会变得丰富多样,但也可能出现不合口味的情况。这就像模型在回答问题时,如果总是用一样的答案,就难以发现它的错误。通过让模型学会多样化回答,就像你在厨房尝试不同的调料,答案变得丰富了,也更容易发现其中的错误。这样一来,模型的回答就像一道丰富多彩的菜肴,不仅味道多样,还更可靠。

简单解释 像给14岁少年讲一样

想象你在学校里参加一个问答比赛,你经常会给出一样的答案,比如每次都说“我不知道”。如果你学会了用不同的方式回答,比如“我不确定,但我觉得可能是这个”,你的答案就变得多样了。这就像模型在回答问题时,如果每次都给出一样的答案,就很难发现它是不是搞错了。现在,研究人员让模型学会用不同的答案回答同一个问题,就像你用不同的句子表达自己。这样一来,如果模型回答的答案都差不多,就说明它可能在搞错;如果答案不同,但都表达了相似的意思,就说明它更聪明,也更容易被发现出错的地方。这就像你用不同的方式表达自己,让别人更容易看出你是不是在说谎或搞错了。

原文摘要

Existing hallucination detection methods are typically conducted at the inference stage, without making any modifications to the model itself. In this paper, we are interested in exploring fine-tuning strategies that enhance the detectability of hallucinations in the resulting model. Focusing on semantic-entropy-based detection, we observe that many erroneous outputs remain undetected because the model produces nearly identical incorrect answers across multiple runs. To address this, we propose diversity-oriented fine-tuning to encourage more varied generations. We introduce two specific strategies: one based on Supervised Fine-Tuning (SFT) and the other on Direct Preference Optimization (DPO). Extensive experiments are conducted to evaluate our approach and analyze the behavior of the models before and after fine-tuning. We find that after adopting our fine-tuning methods, the models become less likely to produce low semantic entropy responses for hallucinated answers, thereby improving the effectiveness of hallucination detection, eventually yielding results better than or comparable with state of the art methods. The code will be publicly released.

cs.AI cs.CV