Optimal Transport for Unsupervised Hallucination Detection in Neural Machine Translation

TL;DR

提出基于最优传输的无监督神经机器翻译幻觉检测器,显著优于模型和外部方法。

cs.CL 🔴 高级 2022-12-20 46 次浏览
Nuno M. Guerreiro Pierre Colombo Pablo Piantanida André F. T. Martins
神经机器翻译 幻觉检测 最优传输 无监督学习 注意力机制

核心发现

方法论

本文利用变换器模型中的交叉注意力图,结合最优传输(OT)理论,提出一种无监督的幻觉检测方法。该方法通过衡量翻译的源注意力分布与参考分布(均匀或模型生成的良好样本分布)之间的Wasserstein距离,识别偏离正常分布的异常翻译。具体步骤包括:提取最后一层交叉注意力矩阵,计算源注意力质量分布,使用OT距离衡量其与参考分布的差异,结合多种场景(单一参考或数据驱动)设计检测指标。该方法无需标注数据,具有良好的泛化能力。

关键结果

  • 在WMT18德英数据集上,Wass-Combo检测器在AUROC达87.17%,FPR@90TPR仅0.07%,优于所有模型和外部检测器。与基于大模型的检测器(如LaBSE)相比,性能差距缩小,显示出优越的效率和效果。单一参考的Wass-to-Unif在偏离源分布方面表现良好,但结合数据驱动的Wass-to-Data后,检测能力进一步提升,证明两者互补性。
  • 在不同幻觉类型(完全脱离、振荡、强脱离)中,检测器表现差异显著。Wass-Data在检测完全脱离和强脱离方面尤为敏感,FPR低至0.15%,而Wass-Unif在振荡幻觉中表现较好。结合两者的Wass-Combo在所有类型中均表现优异,验证其多样化检测能力。
  • 实验还显示,基于交叉注意力的OT距离优于传统的模型置信度和质量评分指标,尤其在无参考场景下表现出色。该方法具有良好的可扩展性和实用性,可直接应用于任何注意力机制的NMT模型,提升系统的安全性和可信度。

研究意义

该研究突破了神经机器翻译中幻觉检测的理论瓶颈,提出一种无监督、模型无关的检测框架,有助于提升自动翻译系统的可靠性。通过引入最优传输理论,提供了对注意力异常的量化指标,为未来模型安全性和鲁棒性研究提供了新方向。该方法不仅适用于高资源语言,还能推广到低资源场景,具有广泛的应用潜力。其优越的检测性能,有望在实际翻译系统中实现实时监控和风险控制,增强用户信任。

技术贡献

本文的核心技术创新在于将最优传输(OT)理论引入幻觉检测,提出基于Wasserstein距离的无监督指标,突破了依赖人工特征或大规模标注的限制。通过分析最后一层交叉注意力图的源质量分布,结合数据驱动的参考集,设计出Wass-Data检测器,显著优于传统的置信度或质量评分方法。该框架具有理论上的严格性和实践中的高效性,为模型内部特征的利用提供了新途径。此外,提出的Wass-Combo融合两种场景,增强检测的鲁棒性和泛化能力。

新颖性

本研究首次将最优传输距离应用于神经机器翻译中的幻觉检测,提出无监督、模型无关的检测机制。不同于以往依赖大模型或人工特征的方案,本文利用交叉注意力的源质量分布差异,量化异常程度,提供了理论基础和实证验证。结合数据驱动的参考集,显著提升检测性能,展示了新颖的跨领域应用潜力。

局限性

  • 该方法依赖于最后一层交叉注意力的质量,可能在模型结构或注意力分布异常的情况下表现不佳。此外,检测效果在极端或复杂幻觉类型中仍有限,尤其是在低资源场景下数据驱动的参考集构建可能受限。计算成本较高,尤其在大规模数据集上,OT距离的计算可能成为瓶颈。未来需优化算法效率,并结合多模态信息提升鲁棒性。
  • 目前只在德英数据集验证,跨语言和多任务场景下的泛化能力仍待验证。模型的参数选择(如阈值)对性能影响较大,需进一步自动调优机制。

未来方向

未来工作将探索多层次、多模态的注意力特征融合,结合深度学习中的对抗训练,增强检测的鲁棒性。同时,考虑引入自监督预训练模型,提升低资源场景下的检测效果。还计划将该方法集成到端到端的翻译系统中,实现实时监控和自动修正,推动智能翻译的安全性发展。

AI 总览摘要

神经机器翻译(NMT)已成为自动翻译的主流技术,但幻觉现象严重影响用户信任。幻觉是指翻译内容与源句脱节,难以提前检测,成为系统安全的隐患。本文提出一种基于最优传输(OT)理论的无监督幻觉检测方法,利用模型中的交叉注意力图,衡量源注意力分布与参考分布的差异,从而识别异常翻译。该方法无需标注数据,具有良好的泛化能力,在WMT18德英数据集上,检测器Wass-Combo的AUROC达87.17%,FPR仅0.07%,优于所有对比方法。实验还显示,不同类型的幻觉(完全脱离、振荡、强脱离)都能被有效检测,验证了方法的多样性和鲁棒性。相比传统的置信度和质量评分指标,基于OT的距离提供了更具理论依据的异常量化工具。该技术的核心创新在于将最优传输引入NMT安全检测,为未来自动翻译系统的安全性和可信度提供了新思路。未来,结合多模态特征和端到端监控,将进一步推动该领域的发展。

深度分析

研究背景

神经机器翻译(Vaswani et al., 2017)经过多年的发展,已成为自动翻译的主流方法。早期依赖统计模型,逐步演进到基于深度学习的Transformer架构(Vaswani et al., 2017),极大提升了翻译质量。近年来,研究集中于模型的鲁棒性和安全性,幻觉(hallucination)作为一种严重的翻译异常,逐渐引起关注(Lee et al., 2018; Müller et al., 2020)。现有方法多依赖外部模型(如QE或跨语句相似度)或人工特征(如注意力分布),但缺乏理论基础和高效的无监督检测机制。本文在此背景下,提出基于最优传输的注意力异常检测,为解决幻觉检测的瓶颈提供新思路。

核心问题

幻觉在高资源场景中虽较少出现,但在实际应用中仍难以避免,尤其在低资源或域外迁移时表现更为明显。现有检测方法多依赖大模型或人工特征,成本高、泛化差,难以实现实时监控。核心问题在于如何在无标注、无参考的条件下,准确识别出脱离源内容的翻译。由于幻觉的多样性和复杂性,单一特征难以覆盖所有类型,亟需一种具有理论支撑、可扩展的检测框架。

核心创新

本研究的主要创新包括:1)引入最优传输(OT)理论,利用Wasserstein距离量化注意力分布的偏离;2)提出无监督的检测指标,结合源注意力分布与参考分布(均匀或模型良品分布);3)设计Wass-Data方案,利用模型生成的良品样本构建数据驱动参考集,提升检测效果;4)融合两种场景(Wass-to-Unif与Wass-to-Data),实现多角度异常检测。该框架突破了传统依赖人工特征或大模型的局限,为模型内部特征的利用提供了新途径。

方法详解

  • �� 提取NMT模型最后一层的交叉注意力矩阵Ω(x),得到源-目标注意力分布。
  • �� 计算源质量分布πM(x),作为源注意力的概率分布。
  • �� 在单一参考场景中,定义均匀分布u,计算Wasserstein距离W(πM(x), u),作为异常分数。
  • �� 在数据驱动场景中,利用良品样本构建参考集Rx,计算πM(x)与Rx中每个样本的Wasserstein距离,取最小k个距离的平均值。
  • �� 设计Wass-Combo,将两者结合,先用Wass-to-Unif筛选,再用Wass-to-Data增强检测能力。
  • �� 通过阈值设定(如P99.9百分位)实现二分类判定。
  • �� 在WMT18德英数据集上,采用AUROC和FPR@90TPR指标评估性能,进行超参数调优和消融分析。

实验设计

采用WMT18德英数据集,标注幻觉类型,比较包括模型内特征(注意力)和外部模型(如LaBSE、COMET)。设置不同参考场景(单一均匀、数据驱动),调节参数(δ、k、阈值)。通过多次随机初始化,验证检测稳定性。还进行不同幻觉类型的性能分析,确保检测的多样性和鲁棒性。实验结果显示,Wass-Combo在AUROC和FPR方面均优于对比方法,验证了其有效性。

结果分析

检测器Wass-Combo在WMT18德英数据集上,AUROC达87.17%,FPR仅0.07%,显著优于传统模型置信度和外部模型(如LaBSE、COMET)。数据驱动方案(Wass-Data)优于单一均匀参考(Wass-to-Unif),结合两者后性能进一步提升。不同幻觉类型检测中,Wass-Data在完全脱离和强脱离方面表现尤为优异,FPR低至0.15%。此外,检测速度适中,适合实际部署。整体而言,实验验证了OT距离在无监督幻觉检测中的潜力。

应用场景

该方法可应用于自动翻译系统的实时监控,提升系统安全性。适合企业部署在生产环境中,作为自动内容过滤或风险预警机制。未来还可结合多模态信息(如语音、图像)扩展到多任务场景,增强多源数据的异常检测能力。长远来看,有望推动智能翻译系统的可信度和用户体验提升。

局限与展望

当前方法主要依赖最后一层交叉注意力,可能在模型结构变化或注意力异常时表现不佳。对极端幻觉类型的检测仍有限,尤其在低资源场景下参考集构建受限。计算成本较高,OT距离的求解在大规模数据中存在瓶颈。未来需优化算法效率,结合多层次特征和多模态信息,提升鲁棒性和适应性。

通俗解读 非专业人士也能看懂

想象你在一个工厂里,工人们每天都在生产不同的产品。每个工人都需要根据设计图(源内容)来制造产品(翻译)。但有时候,工人可能会偏离设计图,自己想象出一些没有的东西,生产出奇怪的产品(幻觉)。工厂管理者希望能及时发现这些偏离设计的产品,确保质量。于是,他们用一种特殊的测量工具,比较每个产品和设计图的差异,尤其关注工人在制造过程中关注的重点区域。这个工具就像用数学的“最优传输”原理,衡量产品偏离设计的程度。通过这个方法,工厂可以自动检测出偏离设计的产品,保证每个出厂的产品都符合标准。这种检测方法不仅快速,而且不需要提前知道所有可能的偏差类型,适应性强,能在生产线上实时工作。它就像一个智能的质量检测员,确保每件产品都符合设计要求,避免出现“怪异”产品影响用户体验。

简单解释 像给14岁少年讲一样

想象你在学校的食堂里,每天都要准备很多不同的饭菜。有时候,有些菜会偏离正常的味道,变得奇怪或者不一样。这就像翻译中的幻觉,内容和原文完全不一样。现在,想象有个聪明的机器人厨师,它可以用一种特别的办法,快速检测出这些偏离正常的菜肴。它会观察每道菜的配料(注意力图),看看哪些配料特别集中,或者和正常菜肪的差别有多大。这个机器人用一种叫“最优传输”的数学方法,衡量每个菜和正常菜的差异。如果差异很大,就说明这道菜可能出了问题。这样一来,厨师就可以及时修正,保证每份饭菜都符合标准。这个机器人厨师不需要提前学习所有菜谱,只要观察和比较,就能自动发现怪味菜肴,保证大家吃得安心。这就像论文里用的技术,帮助检测翻译中的“怪异内容”,让机器翻译变得更可靠、更安全。

原文摘要

Neural machine translation (NMT) has become the de-facto standard in real-world machine translation applications. However, NMT models can unpredictably produce severely pathological translations, known as hallucinations, that seriously undermine user trust. It becomes thus crucial to implement effective preventive strategies to guarantee their proper functioning. In this paper, we address the problem of hallucination detection in NMT by following a simple intuition: as hallucinations are detached from the source content, they exhibit encoder-decoder attention patterns that are statistically different from those of good quality translations. We frame this problem with an optimal transport formulation and propose a fully unsupervised, plug-in detector that can be used with any attention-based NMT model. Experimental results show that our detector not only outperforms all previous model-based detectors, but is also competitive with detectors that employ large models trained on millions of samples.

cs.CL cs.LG