核心发现
方法论
研究提出了知识对齐的监督微调(SFT)方法,通过限制训练目标在基础模型的参数知识内,减少生成幻觉。比较了生成和估计两种对齐方法,并引入了证据重写和回忆重写两种新变体。
关键结果
- 回忆重写在WildHalu和Biography数据集上显著减少幻觉,提升事实性,支持率分别为84.2%和56.2%。
- 证据重写在减少幻觉的同时保持了较高的支持率,尤其是在Biography数据集上。
- 与标准SFT相比,知识对齐方法在UnknownBench上改善了拒绝行为。
研究意义
该研究通过知识对齐的SFT方法,显著减少了语言模型生成中的事实性幻觉问题。这对学术界和工业界都有重要意义,尤其是在需要高可信度回答的应用中。
技术贡献
提出了两种新的知识对齐方法:证据重写和回忆重写,提供了减少幻觉的新路径。与现有方法相比,这些方法在保持模型能力的同时,显著提高了生成内容的事实性。
新颖性
首次将知识对齐引入SFT中,通过限制训练目标在基础模型已知范围内,减少了幻觉。这种方法与传统的SFT方法有根本不同。
局限性
- 方法依赖于基础模型的参数知识,可能无法处理完全未知的信息。
- 在某些情况下,可能会导致过多的拒绝行为,影响用户体验。
未来方向
未来可以探索如何结合外部知识库来进一步提高模型的事实性,以及在不同领域的应用效果。
AI 总览摘要
当前大规模语言模型在生成内容时常出现事实性幻觉,即生成的内容与真实世界不符。这在需要高可信度回答的应用中尤其成问题。现有的监督微调方法虽然能提高模型的指令跟随能力,但也可能导致幻觉的产生。
本文提出了一种知识对齐的监督微调方法,通过限制训练目标在基础模型的参数知识内,减少生成幻觉。研究比较了生成和估计两种对齐方法,并引入了证据重写和回忆重写两种新变体。实验结果表明,这些方法能在WildHalu和Biography数据集上显著减少幻觉,同时保持模型的整体能力。
尽管如此,方法也存在局限性,如对完全未知信息的处理能力有限。未来的研究可以探索如何结合外部知识库来进一步提高模型的事实性。
深度分析
研究背景
大规模语言模型在生成内容时常出现幻觉,即生成的内容与真实世界不符。这一问题在需要高可信度回答的应用中尤其严重。现有的监督微调方法虽然能提高模型的指令跟随能力,但也可能导致幻觉的产生。
核心问题
核心问题在于如何减少语言模型生成中的幻觉。现有的SFT方法可能会导致模型生成超出其知识范围的内容,从而产生幻觉。
核心创新
本文提出了知识对齐的SFT方法,通过限制训练目标在基础模型的参数知识内,减少生成幻觉。引入了证据重写和回忆重写两种新变体,提供了减少幻觉的新路径。
方法详解
- �� 证据重写:通过外部证据验证基础模型生成的内容。
- �� 回忆重写:仅保留模型能一致回忆的声明。
- �� 比较生成和估计两种对齐方法。
实验设计
实验在Qwen 3 4B和OLMo 3 7B模型上进行,使用WildHalu和Biography数据集。评估了不同方法在减少幻觉和保持模型能力方面的表现。
结果分析
回忆重写在WildHalu和Biography数据集上显著减少幻觉,支持率分别为84.2%和56.2%。证据重写在减少幻觉的同时保持了较高的支持率。
应用场景
该方法可用于需要高可信度回答的应用,如医疗诊断、法律咨询等领域。
局限与展望
方法依赖于基础模型的参数知识,可能无法处理完全未知的信息。在某些情况下,可能会导致过多的拒绝行为,影响用户体验。
通俗解读 非专业人士也能看懂
想象你在厨房里做饭。你有一本食谱(基础模型的知识),但有些菜谱你不太熟悉(未知信息)。为了避免做出不好吃的菜(幻觉),你决定只做那些你熟悉的菜(知识对齐)。如果你不确定某个菜的做法,你会查阅食谱或请教他人(证据重写)。这种方法确保你做出的每道菜都符合你的知识范围。
简单解释 像给14岁少年讲一样
想象你在玩一个游戏,你的角色有特定的技能(模型的知识)。当你遇到一个任务时,你只能用你角色的技能去完成(知识对齐)。如果你不确定某个任务怎么做,你可以查看游戏指南或请教其他玩家(证据重写)。这样,你就不会在游戏中犯错啦!
术语表
监督微调 (Supervised Fine-Tuning)
一种训练方法,通过给模型提供特定的输入输出对来调整模型的行为。
用于将预训练的基础模型转变为指令跟随模型。
幻觉 (Hallucination)
模型生成的内容与真实世界不符的现象。
在大规模语言模型生成中常见的问题。
知识对齐 (Knowledge Alignment)
限制训练目标在模型已知范围内的方法。
用于减少生成幻觉。
证据重写 (Evidence Rewrite)
通过外部证据验证基础模型生成内容的方法。
用于确保生成内容的事实性。
回忆重写 (Recall Rewrite)
仅保留模型能一致回忆的声明的方法。
用于减少幻觉。
开放问题 这项研究留下的未解疑问
- 1 如何在不增加拒绝率的情况下进一步减少幻觉?
- 2 如何结合外部知识库来提高模型的事实性?
应用场景
近期应用
医疗诊断
医生可以使用这种方法来确保诊断建议的准确性,减少错误诊断的风险。
远期愿景
法律咨询
可以用于法律咨询,确保提供的建议符合当前法律法规,减少误导性信息。
原文摘要
Supervised fine-tuning (SFT) trains a base language model to imitate target responses, and these targets may require knowledge the base model has not robustly internalized. We study this as a source of hallucinations and frame a group of mitigation methods as \emph{knowledge-aligned SFT}: constraining SFT training targets to the base model's parametric knowledge. Under a unified setup, we compare existing generation-based and estimation-based knowledge-alignment methods and introduce two new variants: Evidence Rewrite, which verifies base-model generations using external evidence, and Recall Rewrite, which retains claims only when they can be consistently recalled by the base model. Experiments with Qwen 3 4B and OLMo 3 7B show that knowledge-aligned SFT can reduce factual hallucinations on WildHalu and Biography while largely preserving general capabilities. Recall Rewrite yields the strongest factuality gains and improves refusal behavior on UnknownBench. It thereby confirms that SFT targets beyond the base model's knowledge drive hallucination behavior.