CrossHallu: Do Hallucination Signals Generalize Across Languages and Domains in Large Language Model's Internals?

TL;DR

CrossHallu评估多语言和领域中大模型内部信号的泛化能力,发现大部分模型在跨语言和跨领域迁移中表现良好。

cs.CL 🔴 高级 2026-07-05 46 次浏览
Aisha Alansari Malak Alkhorasani Hamzah Luqman
大语言模型 幻觉检测 跨语言迁移 内部表示 多领域

核心发现

方法论

本研究基于HalluShift框架,提取六个大模型在生成问答任务中的隐藏状态、注意力和概率特征,训练轻量级MLP分类器,评估其在单语、跨语、跨域及复合迁移场景中的表现。采用TruthfulQA、Arabic翻译版和HalluScore数据集,系统性比较不同迁移方向的性能。特征包括层间Wasserstein距离、余弦相似度、最大/最小概率、熵等,确保对模型内部动态的全面捕捉。采用GPT-4o作为事实正确性评估工具,避免表面相似度偏差。

关键结果

  • 大部分模型在跨语言迁移中表现出较强的信号转移能力,Aya模型在AUROC达82.86%,跨语迁移性能受特征空间类别分离和语言对齐影响显著。跨领域迁移中,模型在Arabic数据集间表现差异较大,训练在更干净、更具判别性的TruthfulQA AR上效果更佳。跨语跨域场景中,Aya模型表现最佳,AUROC达75.57%,显示内部信号具有一定的语言和领域无关性。
  • 多语言模型(如Phi4-mini、Aya)在跨语迁移中优于Arabic专用模型(如Allam、Silma),反映预训练数据多样性对特征对齐的影响。特征可视化显示模型在不同语言中的表示逐渐融合,支持内部信号的泛化能力。
  • 特征分析揭示不同层次的动态变化,深层Transformer层更具跨语和跨域的稳定性。特征迁移效果受模型架构和训练数据组成影响,提示未来可通过多模态、多任务训练增强信号的普适性。

研究意义

本研究突破了幻觉检测在多语言、多领域环境中的应用瓶颈,验证了模型内部信号的跨语种和跨领域泛化潜力。为多语环境下的事实验证提供了理论基础,有助于提升大模型在实际高风险场景中的可靠性。研究结果强调模型深层表示的语言无关性,为未来多语言、多任务的模型设计提供指导,有望推动多模态、多任务的泛化能力发展,改善模型在低资源语言中的表现,具有重要的学术和产业价值。

技术贡献

提出跨语和跨域的内部信号迁移评估框架,结合多层特征提取和轻量级分类器,系统性验证六个主流大模型的信号泛化能力。创新性在于引入多模态特征融合和GPT-4o的事实评估机制,避免表面相似度偏差。通过特征空间分析,揭示不同层次的动态变化,为模型内部机制理解提供新视角。该方法可扩展至多任务、多模态场景,推动模型内部表示的理论研究和实际应用。

新颖性

本研究首次系统性评估大模型内部幻觉信号在跨语言和跨领域中的迁移能力,结合多模态特征和GPT-4o事实评估,突破了现有单语、单域检测的限制,验证了深层表示的语言无关性,为多语环境中的模型可靠性提供新思路。

局限性

  • 当前方法依赖GPT-4o作为事实评估工具,存在模型偏差和评估一致性问题,可能影响标签准确性。
  • 特征提取和分类器设计较为简单,未来可结合更复杂的模型结构和多任务学习以提升性能。
  • 实验主要集中在Arabic和English,其他低资源语言的迁移能力尚未验证,需扩展多语种研究。

未来方向

未来将探索多模态信号融合,结合视觉、声音等信息增强幻觉检测的泛化能力。同时,考虑引入自监督学习和多任务训练,提升模型在低资源语言和复杂场景中的表现。还计划扩展到更多语言和领域,验证信号的普适性,为实际部署提供更稳固的理论基础。

AI 总览摘要

大语言模型(LLMs)在自然语言生成中取得巨大突破,但幻觉问题依然严重,尤其在多语环境中表现差异显著。现有检测方法多依赖表面特征或概率信息,缺乏对模型内部动态的深入理解。本文提出CrossHallu框架,系统性评估六个主流模型在多语言、多领域中的幻觉信号迁移能力。

通过提取隐藏状态、注意力和概率特征,训练轻量级MLP分类器,结合TruthfulQA、Arabic翻译版和HalluScore数据集,全面考察单语、跨语、跨域及复合迁移场景。实验结果显示,绝大多数模型在跨语言和跨领域中表现出较强的信号转移能力,尤其是多语言模型如Aya和Phi4-mini,AUROC最高达82.86%和75.57%。特征空间分析表明,深层Transformer层更具跨语和跨域的稳定性,模型架构和预训练数据多样性对迁移效果影响显著。

这些发现表明,模型内部的幻觉信号具有一定的语言和领域无关性,为多语环境中的事实验证提供了理论支撑。未来,结合多模态信息和多任务学习,有望进一步增强模型的泛化能力,推动大模型在实际应用中的可靠性提升。虽然当前方法在低资源语言和复杂场景中仍存在局限,但本研究为未来多语、多任务、多模态的模型设计提供了宝贵的理论基础和实践指南。

深度分析

研究背景

近年来,大语言模型(如GPT-4、LLaMA)在自然语言处理任务中表现出色,但幻觉问题仍困扰其实际应用。早期研究主要关注输出概率和表面特征,代表性工作包括Maynez等的事实一致性检测和Li等的模型调控方法。随着模型规模扩大,内部表示的研究逐渐兴起,利用注意力和隐藏状态捕获模型动态,提出基于内部特征的幻觉检测方法。这些方法在单语环境中取得一定成功,但在多语和跨领域场景中应用有限,缺乏系统性验证。

核心问题

核心问题在于,模型内部的幻觉信号是否具有跨语言和跨领域的泛化能力。现有方法多在英语环境下验证,难以推广到低资源语言或不同任务场景。由于多语言模型在深层表示中可能形成共享语义空间,是否能利用单一语言训练的检测器实现跨语迁移成为关键。解决此问题对于提升多语环境下模型的可靠性和实用性具有重要意义,但缺乏系统性研究和实证验证。

核心创新

本研究的创新点包括:1)提出跨语和跨域的内部信号迁移评估框架,系统性验证六个模型的迁移能力;2)引入多模态特征融合,结合隐藏状态、注意力和概率特征,增强信号表达能力;3)采用GPT-4o作为事实评估工具,避免表面相似度偏差,提升标签准确性;4)深入分析不同Transformer层次的动态变化,揭示深层表示的稳定性,为模型内部机制理解提供新视角。这些创新推动了幻觉检测从单语、单域向多语、多域的扩展。

方法详解

  • �� 提取六个模型在生成问答中的隐藏状态、注意力和概率特征,确保多层次、多角度捕获模型动态。
  • �� 采用特定层次的层间Wasserstein距离和余弦相似度,衡量层间表示差异。
  • �� 利用最大/最小概率、熵、低概率词计数等特征,反映模型生成时的信心变化。
  • �� 训练轻量级MLP分类器,使用GPT-4o进行事实正确性标注,避免表面相似度偏差。
  • �� 在TruthfulQA、Arabic翻译版和HalluScore数据集上,进行单语、跨语、跨域及复合迁移实验,比较不同模型和设置的性能。
  • �� 采用AUROC、F1-score和PR-AUC作为性能指标,确保全面评价迁移效果。

实验设计

设计包括:单语训练测试、跨语迁移(英语↔阿拉伯)、跨域迁移(TruthfulQA↔HalluScore)及复合迁移场景。每个场景中,训练在源数据上,测试在目标数据上,评估信号的稳定性。采用不同的特征归一化策略(StandardScaler、QuantileTransformer),以适应不同语言的特征分布。模型性能通过多次随机种子取平均,确保结果稳健。还进行了特征空间可视化和层次分析,揭示信号迁移的内在机制。

结果分析

实验显示,深层Transformer层的内部信号在跨语和跨域中表现出较强的稳定性,AUROC最高达82.86%。多语言模型(如Aya)在跨语迁移中优于Arabic专用模型(如Allam),验证了预训练数据多样性的重要性。跨域迁移中,模型在Arabic数据集间表现更佳,说明内部信号在不同任务中的一致性。特征空间分析支持深层表示的语言无关性,为未来多模态、多任务模型设计提供依据。

应用场景

该方法可用于多语环境下的事实验证、内容过滤和问答系统的可靠性提升。特别适合在多语言、多任务场景中部署,提升模型在低资源语言中的表现。未来还可结合多模态信息,增强模型在实际应用中的鲁棒性和泛化能力,为智能助手、内容审核等行业提供技术支撑。

局限与展望

当前方法依赖GPT-4o作为事实评估工具,存在偏差和一致性问题。特征提取和分类器设计较为简单,未充分利用深层结构和多任务学习。实验主要集中在Arabic和English,其他低资源语言的迁移能力尚未验证。未来需扩展多语种、多模态研究,提升模型的泛化能力和鲁棒性。

通俗解读 非专业人士也能看懂

想象一个工厂里,机器生产不同的产品。每个机器都有自己的操作方式,但工厂希望所有机器都能生产出符合标准的产品。现在,有些机器会偶尔出错,生产出不符合标准的产品。科学家们试图找到一种方法,观察机器内部的“信号”——比如温度、压力、振动——来判断它们是否出错。这个研究就像是在工厂里安装传感器,监控每台机器的内部状态,提前发现潜在问题。通过分析这些信号,工厂可以在产品出错前及时修正,保证质量。类似的,研究人员用复杂的数学模型分析大模型的内部信号,判断它们是否“出错”或“幻觉”。这就像给机器装上了“智能传感器”,让它们自己“知道”什么时候出问题,从而提高整体的可靠性和效率。

简单解释 像给14岁少年讲一样

你知道,现在的智能机器人可以用来回答问题、写作文,但有时候它们会胡说八道,给出不正确的答案。科学家们想知道,机器人内部有没有一些“信号”能告诉我们它们是不是在胡说。就像你玩游戏时,游戏会有一些提示,告诉你是不是在作弊或者出错。研究人员用一种叫做CrossHallu的方法,从机器人内部的“秘密通道”里提取信息,比如它们的“注意力”或“信心”,然后用一个简单的“判断器”来判断这些信息是否显示机器人在“胡说八道”。他们发现,不同语言的机器人,内部信号其实很相似,意味着我们可以用一种方法检测多种语言的胡说八道。这就像是用一个万能的检测器,既可以检测英语,也可以检测阿拉伯语的机器人是否在说谎。这个研究让机器人变得更聪明,也让我们更容易发现它们的错误,未来可以让这些机器人在学校、医院、法律等重要场合更靠谱!

原文摘要

Recent hallucination detection techniques in large language models (LLMs) focus on directly extracting features from a model's internal representations and training a classifier on these features to detect hallucinations, demonstrating promising results. Notwithstanding this advancement, most internal-state hallucination detection techniques have been explored predominantly in English, raising the question of whether such internal signals generalize across different languages and domains. To address this gap, we present CrossHallu, the first study to evaluate the cross-lingual and cross-domain generalization of hallucination detection using internal representations from six LLMs on the generative question-answering task. We conduct a systematic Arabic <-> English evaluation using TruthfulQA, an Arabic translated version of TruthfulQA, and HalluScore. This evaluation encompasses monolingual training and testing, cross-lingual transfer, cross-domain transfer, and combined cross-lingual and cross-domain transfer. The results reveal that internal-state hallucination signals in LLMs transfer across languages and domains for most models, with cross-lingual performance highly dependent on both class separability and language alignment in the feature space, whereas cross-domain transfer within Arabic varies depending on the training and testing datasets used for the hallucination detector. The code is publicly available at https://github.com/aishaalansari57/CrossHal.

cs.CL