Prompt Embedding Probes (PEP): Hallucination Detection in LLMs from Hidden States

TL;DR

提出Prompt Embedding Probes(PEP)用于冻结大模型的隐藏状态检测幻觉,提升在分布内表现。

cs.CL 🔴 高级 2026-08-08 34 次浏览
Zakhar Mrykhin Valentin Malykh
大模型 幻觉检测 白盒方法 提示学习 模型解释

核心发现

方法论

PEP通过在冻结的LLM输入中引入少量可训练的提示嵌入,扩展线性探测器。具体做法是将提示嵌入插入输入序列,经过模型后在特定层提取隐藏状态,训练线性分类器判断答案是否幻觉。该方法结合提示学习与白盒探测,参数极少,保持模型参数不变。实验中在TriviaQA、GSM8K、MedQA上评估,使用Qwen3模型(0.6B、8B、32B)实现。PEP在分布内检测效果优于标准线性探测,且在预生成和跨模型迁移场景中表现稳健,但跨数据集迁移仍具挑战。

关键结果

  • 在TriviaQA、GSM8K、MedQA上,PEP在ROC AUC指标上平均提升约3-11个百分点,尤其在中大型模型(8B、32B)中表现显著。对比线性探测,PEP在多任务、多尺度模型中提升检测准确性,验证其提示嵌入的有效性。
  • 在预生成(TBG)设置中,PEP仍优于线性探测,提升幅度达2-10个百分点。跨模型迁移实验显示,模型特异性提示嵌入提升检测能力,但跨数据集迁移效果有限,提示泛化仍需改进。
  • 参数分析表明,插入位置和提示嵌入数量对检测性能影响显著,偏好在模型中层附近插入少量提示,且在序列开头插入效果较佳。

研究意义

本研究提出的PEP方法在保持模型参数冻结的同时,通过少量可训练提示增强了隐藏状态的探测能力,为大模型幻觉检测提供了高效、参数节省的白盒方案。其在实际应用中可实现快速、低成本的幻觉识别,有助于提升LLM在高风险领域的可靠性。该技术突破了传统线性探测的局限,为模型内部表示的利用提供新思路,推动模型解释与安全检测的发展。

技术贡献

PEP创新性在于将提示学习与白盒线性探测结合,提出参数极少的可训练提示嵌入,显著提升隐藏状态信息的利用效率。不同于以往仅用线性探测或复杂微调,PEP在保持模型参数不变的基础上,通过优化提示嵌入实现更灵活的任务适应。该方法在多任务、多模型、多尺度场景中验证了其普适性和有效性,为模型内部表示的白盒检测提供了新工具。

新颖性

首次将提示嵌入引入白盒探测框架,系统性验证其在幻觉检测中的优势。不同于传统线性探测只调节线性层参数,PEP通过少量可训练提示嵌入增强模型内部信号的表达能力,突破了参数限制,显著改善检测性能。这一创新为提示学习在模型解释和安全检测中的应用开辟新路径。

局限性

  • 跨数据集迁移效果有限,原因在于不同任务和答案格式差异大,提示嵌入难以泛化。模型在训练数据之外的表现仍需提升。
  • 训练过程较线性探测复杂,需多次前向传播和梯度计算,计算成本较高,限制了大规模部署。
  • 目前仅在答案级别进行检测,长文本或细粒度检测场景尚未覆盖,未来需扩展到更细粒度的任务。

未来方向

未来可探索多任务训练策略以增强跨数据集泛化能力,结合更复杂的提示设计和多层次探测架构。同时,研究更高效的训练算法以降低成本,拓展到更细粒度的检测任务,提升模型在实际高风险场景中的应用潜力。

AI 总览摘要

大规模语言模型(LLMs)在生成连贯且实用的文本方面取得了巨大进展,但幻觉问题依然严重,尤其在医疗、法律等高风险领域,错误信息可能带来严重后果。传统检测方法多依赖后期验证或外部工具,成本高且难以实时应用。本文提出Prompt Embedding Probes(PEP),一种白盒方法,通过在模型输入中引入少量可训练的提示嵌入,增强隐藏状态的判别能力,从而实现高效的幻觉检测。PEP在保持模型参数冻结的同时,利用提示学习优化检测效果,参数极少,训练简单。实验证明,PEP在TriviaQA、GSM8K、MedQA等多个数据集和不同模型规模(0.6B、8B、32B)上均优于传统线性探测器,尤其在分布内检测中表现突出。其在预生成和跨模型迁移场景中同样表现良好,验证了方法的鲁棒性。尽管跨数据集迁移仍具挑战,PEP展示了提示学习在模型解释和安全检测中的潜力,为未来高效、可解释的幻觉检测提供了新思路。该技术有望推动LLMs在高风险应用中的安全性和信任度,成为模型安全监控的重要工具。

深度分析

研究背景

近年来,LLMs在自然语言处理领域取得突破性进展,代表模型如GPT、BERT、Qwen系列不断扩大规模,提升生成质量。然而,幻觉问题依然严重,模型可能输出不支持或虚假的信息。早期方法多依赖后验验证或外部知识库,成本高且难以实时应用。白盒方法利用模型内部表示,逐渐成为研究热点,包括线性探测、神经元选择等技术,但多局限于特定任务或模型。提示学习的兴起为模型内部信号利用提供新途径,结合白盒检测,成为提升可靠性的重要方向。

核心问题

核心问题在于如何在保持模型参数不变的情况下,有效利用隐藏状态信息检测幻觉。传统线性探测在某些任务上效果有限,难以捕获复杂信号。模型内部表示的多样性和任务差异使得检测泛化困难,尤其在跨数据集和跨模型迁移中表现不佳。此外,现有方法多依赖单一特征或复杂微调,成本高且不易部署。如何设计参数少、效果优的白盒检测方案,成为亟待解决的问题。

核心创新

本研究提出PEP,将提示学习引入白盒检测框架,创新点包括:

1)引入少量可训练提示嵌入,增强隐藏状态的判别能力;

2)在保持模型参数冻结的基础上,优化提示嵌入和线性分类器;

3)系统验证其在多任务、多模型、多尺度场景中的有效性。该方法突破传统线性探测的局限,通过提示学习实现更灵活的信号利用,显著提升检测性能,为模型解释和安全监控提供新工具。

方法详解

  • �� 输入:查询x和答案a,将答案编码成输入序列z。• 提示嵌入:初始化M个提示嵌入p(j),每个大小为d。• 插入:将提示嵌入插入输入序列前端,形成增强序列˜E。• 传递:增强序列经过冻结的LLM,提取第ℓ层隐藏状态˜H(ℓ),对应插入位置π(q)。• 分类:用线性分类器w对隐藏状态进行二分类,判断答案是否幻觉。• 训练:只优化提示嵌入和线性层参数,保持模型参数不变。• 实验:在TriviaQA、GSM8K、MedQA上评估,调整提示数量、插入位置、层数,验证效果。

实验设计

采用TriviaQA、GSM8K、MedQA三大数据集,分别代表事实问答、数学推理和医学问答。模型包括Qwen3(0.6B、8B、32B)和Gemma3(12B)。对比线性探测、概率自评估等基线指标主要用ROC AUC。训练中调整提示嵌入数量(1-10)、插入位置(开头、结尾、两端)、探测层(中间层、末层)。在多任务、多模型、多尺度场景中,验证PEP的检测能力和鲁棒性。还进行跨模型和跨数据集迁移实验,分析泛化能力。

结果分析

PEP在所有任务中均优于线性探测,平均提升ROC AUC达5-11个百分点,尤其在中大型模型中效果更佳。在预生成场景中,提升幅度为2-10个百分点。跨模型迁移中,模型特异性提示嵌入提升检测准确,但跨数据集迁移仍受限,提示泛化仍需改进。参数分析显示,插入位置偏好在模型中层附近,少量提示在序列前端效果最佳。整体验证了提示嵌入在白盒检测中的有效性和灵活性。

应用场景

该方法可应用于高风险行业的模型安全监控,如医疗、金融、法律等。只需在模型推理前插入提示,快速检测潜在幻觉,提升系统可信度。未来可结合多任务训练和更复杂提示设计,增强泛化能力,推动模型安全和解释性发展。

局限与展望

跨数据集迁移效果有限,主要因任务和格式差异大。训练成本较高,需多次前向传播和梯度计算。目前仅在答案级别检测,长文本和细粒度检测尚未实现。未来需优化提示设计和训练策略,提升泛化和效率。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,食材代表模型的知识,厨师代表模型本身。幻觉就像厨师误把假材料当成真食材,做出不合实际的菜肴。为了避免这个问题,你可以在食材上贴标签(提示嵌入),帮助厨师辨别真假。PEP就像给厨师提供一小块标签,告诉它哪些食材可信,哪些可能是虚假的。这样,即使厨师不改变自己,只用这块标签,也能更好地判断菜肴是否可靠。这个方法简单又高效,不需要重新训练厨师,只需在厨房里放点小标签,就能大大提高菜的质量和安全性。

简单解释 像给14岁少年讲一样

想象你在学校里写作文,老师告诉你要写得真实可靠,但有时候你会写错或胡说八道。为了帮你写得更靠谱,老师给你一些提示,比如“要写真话”。PEP就像老师给你一些特别的小贴纸,贴在你的作文里,提醒你哪些内容要特别小心。你不用重新学写作,只是在原有的基础上加点提示,就能写得更靠谱。这就像给你的作文加了个“真话标签”,让老师更容易判断内容是否可信。这个方法简单又实用,能帮助你写出更真实的作文,避免胡说八道。

原文摘要

Large language models (LLMs) can generate fluent and useful responses but remain prone to hallucinations. We introduce Prompt Embedding Probes (PEP), a white-box method for answer-level hallucination detection from the hidden states of a frozen LLM. PEP extends standard linear probes by augmenting the input with a small number of learnable prompt embeddings. We evaluate PEP on TriviaQA, GSM8K, and MedQA using Qwen3 models at multiple scales. PEP improves hidden-state-based detection over standard linear probes in the main in-distribution setting. We further evaluate PEP for pre-generation prediction, cross-model transfer, and out-of-distribution generalization. PEP remains effective in the pre-generation and cross-model settings, whereas robust cross-dataset transfer remains difficult. These results show that prompt-based adaptation can strengthen hidden-state probing while keeping the backbone frozen and adding only a small number of trainable parameters.

cs.CL cs.AI