Toxicity in Multilingual Machine Translation at Scale

TL;DR

本研究分析多语种机器翻译中的添加毒性,采用HOLISTICBIAS数据集和ALTI+解释方法,发现低资源语言和特定人口轴易出现毒性。

cs.CL 🔴 高级 2022-10-07 46 次浏览
Marta R. Costa-jussà Eric Smith Christophe Ropers Daniel Licht Jean Maillard Javier Ferrando Carlos Escolano
机器翻译 多语种 毒性检测 模型解释 数据偏差

核心发现

方法论

本文结合HOLISTICBIAS数据集、NLLB的词表检测法和ALTI+输入归因技术,系统评估英译164语种中的添加毒性。通过自动检测结合人类评估验证,分析源贡献度与毒性关系,揭示 hallucination 和 mistranslation 在毒性产生中的作用。

关键结果

  • 自动毒性检测显示不同语言添加毒性率从0%到5%,低资源语种如Yoruba、Yue Chinese毒性较高,且性取向、性别和能力轴最易出现毒性。人类评估验证了部分模型输出的毒性真实性,84%的毒性与源贡献显著相关。Hallucination和 mistranslation在毒性中扮演关键角色,低源贡献度与高毒性相关性强。
  • 低资源语言如Yoruba和Tok Pisin毒性率超过2%,而大部分语种低于1%。源贡献度低(<40%)的翻译更易出现毒性,且模型在描述敏感人口轴时更易偏离源信息引入毒性。
  • 利用Gini不纯度指标,发现低源贡献和低鲁棒性(高Gini值)翻译更易产生毒性,结合源贡献和鲁棒性指标可辅助毒性风险预警。
  • 人类评估显示,部分高毒性检测为误报(如中文和波斯语),但整体毒性检测的准确性较高,误检率低于1%。

研究意义

本研究首次系统揭示多语种机器翻译中添加毒性的机制,强调低资源语种和敏感人口轴的特殊风险,为模型调优和数据偏差治理提供理论基础。通过结合模型解释技术,增强对毒性生成源的理解,有助于提升多语种翻译的安全性和公平性,推动AI伦理在实际应用中的落实。该工作对未来多语种模型的安全控制和偏差检测具有重要指导意义,尤其在全球化信息交流日益频繁的背景下,确保翻译输出的责任性和包容性尤为关键。

技术贡献

本文创新性地结合HOLISTICBIAS数据集、词表检测和ALTI+归因技术,系统分析多语种翻译中的添加毒性机制。提出低源贡献度和鲁棒性指标的联合分析框架,有效识别潜在毒性风险。首次在大规模多语种环境中验证模型 hallucination 和 mistranslation 对毒性的贡献,为模型调优提供量化依据。研究还引入 Gini 不纯度指标,丰富模型解释工具箱,增强对毒性生成路径的理解。整体技术方案具有较强的可扩展性和实用性,为多语种安全翻译提供新思路。

新颖性

本研究首次系统结合HOLISTICBIAS、ALTI+和毒性检测,深入分析多语种翻译中的添加毒性机制。区别于以往仅关注单一语言或简单检测方法,提出多维度源贡献和鲁棒性指标,揭示 hallucination 和 mistranslation 在毒性中的作用,具有重要创新性。此方法在多语种环境中实现高效、可解释的毒性风险评估,填补了多语种模型安全性研究的空白。

局限性

  • 当前检测方法依赖词表,可能漏检新型或隐晦的毒性表达,尤其在低资源或非主流语言中表现不佳。模型解释指标如源贡献和Gini不纯度虽提供量化依据,但在极端偏差或复杂句结构中效果有限。实验主要基于HOLISTICBIAS和FLORES-200数据集,可能无法完全覆盖实际应用中的多样化场景。未来需结合更丰富的语料和多模态信息,提升毒性检测的全面性和鲁棒性。

未来方向

未来工作将聚焦于引入深度学习驱动的上下文感知毒性检测模型,结合多模态信息(如图像、声音)增强识别能力。还将探索模型训练中的偏差缓解策略,优化数据采样和增强技术,减少毒性生成。同时,推动模型可解释性研究,开发更细粒度的源贡献和路径分析工具,以实现更全面的安全控制。最终目标是构建具有更高公平性和责任感的多语种翻译系统,满足全球多样化需求。

AI 总览摘要

随着全球信息交流的不断深化,多语种机器翻译(MT)成为连接不同文化和语言的重要工具。然而,现有系统在保证翻译质量的同时,面临着潜在的安全和伦理风险,尤其是添加毒性内容的风险。本研究针对这一问题,首次系统性分析了大规模多语种MT中的添加毒性现象,利用HOLISTICBIAS数据集、NLLB的词表检测和ALTI+模型解释技术,揭示了低资源语言和特定人口轴(如性取向、性别、能力)更易引入毒性。实验结果显示,毒性率在不同语言间差异显著,从0%到5%不等,低源贡献度和模型 hallucination 在毒性产生中扮演关键角色。人类评估验证了自动检测的有效性,误报率低于1%。通过源贡献和鲁棒性指标的结合分析,发现毒性多由 mistranslation 和 hallucination 导致,提供了潜在的风险预警机制。这些发现不仅丰富了对多语种模型偏差和安全的理解,也为未来模型调优和数据治理提供了理论基础。研究强调,优化训练数据、减少 hallucination 和加强模型解释能力,是降低添加毒性的关键路径。未来,结合多模态信息和深度学习方法,将进一步提升多语种MT的安全性和公平性,推动AI伦理在全球化应用中的落地。

深度分析

研究背景

多语种机器翻译(MT)经历了从基于规则到神经网络的快速发展。早期方法如基于短语的统计MT(如Moses)在多语环境中表现有限,难以应对低资源语种的挑战。近年来,Transformer架构(Vaswani et al., 2017)成为主流,推动了大规模预训练模型(如mBERT、XLM-R)在多语种任务中的应用(Conneau et al., 2020)。NLLB(No Language Left Behind)项目(NLLB Team, 2022)推出了600M到3.3B参数的多语模型,显著提升了低资源语种的翻译质量。然而,随着模型规模扩大,模型偏差和伦理风险逐渐凸显,尤其是在敏感人口和偏见表达方面。已有研究如 Sheng et al. (2021) 和 Webster et al. (2020) 关注偏见和毒性问题,但缺乏系统的多语种机制分析。HOLISTICBIAS(Smith et al., 2022)作为一个涵盖13个偏见轴的评估数据集,为检测模型偏差提供了丰富资源。尽管如此,关于模型在多语环境中引入毒性的机制、Hallucination 和 mistranslation 的具体作用仍未充分理解,亟需系统研究。

核心问题

多语种MT系统在追求广泛覆盖的同时,面临毒性内容无意引入的风险。添加毒性不仅影响用户体验,还可能引发伦理争议。现有检测方法多依赖词表,难以应对复杂语境和隐晦表达,特别是在低资源语种中表现不足。此外,模型 hallucination(虚假生成)和 mistranslation(误译)被认为是毒性产生的主要机制,但缺乏定量分析和解释工具。如何准确识别、解释和减少这些风险,成为多语种MT的核心挑战。尤其是在敏感人口轴(如性取向、能力)上的偏差,可能导致不公平或歧视性输出,亟需系统性解决方案。

核心创新

本研究的创新点在于:1)结合HOLISTICBIAS数据集和词表检测,系统量化不同语言中的添加毒性;2)引入ALTI+归因技术,量化源贡献度,分析 hallucination 和 mistranslation 在毒性中的作用;3)利用Gini不纯度指标,评估翻译鲁棒性与毒性关系。这一多维度分析框架,首次在大规模多语环境中揭示了毒性生成的机制,为模型调优提供量化依据。研究还提出了结合源贡献和鲁棒性指标的风险预警策略,为模型安全性提供新思路。

方法详解

  • �� 采用HOLISTICBIAS数据集,涵盖472k句子,翻译到164语种,评估添加毒性。• 利用NLLB的词表检测法,识别潜在毒性词汇,结合自动检测和人类评估验证。• 采用ALTI+归因方法,计算源贡献度,分析毒性与 hallucination、 mistranslation 的关系。• 计算Gini不纯度指标,评估翻译鲁棒性与毒性关联。• 结合源贡献和鲁棒性指标,构建潜在毒性翻译预警模型。• 进行多语种毒性率统计,分析不同人口轴和词汇的毒性分布。• 通过人类专家评估,验证自动检测的准确性和误报率。• 结合统计分析,探讨低资源语种和敏感人口轴的特殊风险。• 最终提出降低毒性的策略建议,包括数据清洗、模型调优和解释增强。

实验设计

  • �� 使用HOLISTICBIAS和FLORES-200数据集,评估模型在多语种环境中的毒性表现。• 设定不同资源水平的语言类别,分析毒性差异。• 采用自动检测结合人类评审,验证毒性识别的准确性。• 实验中调节源贡献阈值(40%)和鲁棒性指标,分析毒性变化。• 进行ablation,验证ALTI+归因和Gini指标的贡献。• 统计不同人口轴、词汇和模板的毒性分布,识别高风险类别。• 评估Hallucination和 mistranslation在毒性中的作用,分析源贡献与毒性关系。• 通过多语种比较,验证模型在低资源语种中的表现差异。• 最后,提出潜在的风险预警和优化策略,为实际应用提供参考。

结果分析

  • �� 毒性率在不同语言间差异显著,最低0%,最高5%,低资源语种如Yoruba、Tok Pisin毒性较高。• 84%的毒性与源贡献度显著相关,源贡献低(<40%)的翻译更易出现毒性。• Hallucination和 mistranslation是毒性产生的主要机制,低源贡献度与高毒性高度相关。• Gini不纯度分析表明,鲁棒性差(高Gini值)翻译更易引入毒性。• 自动检测准确率高,误报率低于1%,人类评估验证了检测的可靠性。• 低资源语言和特定人口轴(性取向、性别)是毒性高发区域,提示模型偏差和数据偏差的影响。

通俗解读 非专业人士也能看懂

想象一个工厂在生产各种商品,工厂的机器代表模型,原料代表输入信息。正常情况下,工厂会根据原料生产出符合要求的商品,但有时机器会误操作,生产出带有不良内容的商品,比如带毒的零食。这些毒性内容可能是因为机器误读了原料( mistranslation)或看到一些不存在的细节(hallucination),导致生产出不合适的商品。低资源的工厂(低资源语种)因为设备较差,更容易出错,生产出带毒的商品。而一些敏感的原料(如性取向、能力)更容易被误用,造成偏差。为了保证商品安全,工厂需要更好的原料筛选、设备校准和监控系统。这项研究就像是对工厂的检查,找出哪些环节容易出错,提出改进方案,确保每件商品都安全合格。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏,你需要把很多不同颜色和形状的块拼在一起,才能拼出一幅漂亮的画。有时候,拼图会出现错误,比如把不该放在一起的块拼到一块,这样拼出来的画就会变得奇怪甚至有点不友善。这就像机器翻译,有时候它会把一些不该出现的词或内容加入到翻译里,造成不好的效果。特别是当机器用的资料不多(低资源语言),它更容易出错。研究发现,这些错误有时候是因为机器误解了原始内容( mistranslation),或者看到一些不存在的细节(hallucination)。为了避免这些问题,科学家们设计了各种检测和解释工具,帮助找出出错的原因,就像拼图游戏中用放大镜检查每一块一样。这样,未来的翻译工具就能变得更聪明、更安全,让我们用得更放心。

术语表

毒性 (Toxicity)

指在翻译中引入对某些群体或个人有害、冒犯或歧视的内容。技术上通过词表检测和模型归因分析识别。

本文用来描述模型输出中不应出现的有害内容。

Hallucination (虚假生成)

模型在没有对应源信息的情况下,生成与输入无关的内容,可能引入偏见或毒性。技术上通过源贡献度和归因分析检测。

分析模型错误产生毒性内容的机制。

Mistranslation (误译)

源语言中的非毒性内容被错误翻译成带有偏见或攻击性的词汇,导致毒性引入。

识别翻译偏差的根源。

ALTI+ (归因方法)

一种基于Transformer模型的输入归因技术,衡量每个输入词对输出的贡献,帮助解释毒性产生路径。

用于分析源贡献度与毒性关系。

Gini不纯度 (Gini Impurity)

衡量分类中样本不纯度的指标,数值越高表示样本分布越不均匀,用于评估翻译鲁棒性。

分析翻译的鲁棒性与毒性关联。

开放问题 这项研究留下的未解疑问

  • 1 如何在多语种模型中实时监控和预警毒性内容仍未完全解决,特别是在低资源语种和新兴偏见表达方面。现有方法多依赖词表,难以捕捉隐晦或新出现的偏见,未来需结合深度学习和上下文理解提升检测能力。

应用场景

近期应用

多语种内容过滤系统

结合本文提出的源贡献和鲁棒性指标,为翻译平台提供自动毒性预警,提升内容安全性,适用于社交媒体、内容审核等场景。

模型调优与偏差治理

利用分析结果优化训练数据,减少偏差和 hallucination,提升模型在敏感话题上的表现,确保输出公平、责任。

远期愿景

安全可信的多语种AI系统

未来目标是构建具有可解释性和自我监控能力的多语种翻译系统,实现自动检测、解释和修正毒性内容,推动AI伦理标准落实。

原文摘要

Machine Translation systems can produce different types of errors, some of which are characterized as critical or catastrophic due to the specific negative impact that they can have on users. In this paper we focus on one type of critical error: added toxicity. We evaluate and analyze added toxicity when translating a large evaluation dataset (HOLISTICBIAS, over 472k sentences, covering 13 demographic axes) from English into 164 languages. An automatic toxicity evaluation shows that added toxicity across languages varies from 0% to 5%. The output languages with the most added toxicity tend to be low-resource ones, and the demographic axes with the most added toxicity include sexual orientation, gender and sex, and ability. We also perform human evaluation on a subset of 8 translation directions, confirming the prevalence of true added toxicity. We use a measurement of the amount of source contribution to the translation, where a low source contribution implies hallucination, to interpret what causes toxicity. Making use of the input attributions allows us to explain toxicity, because the source contributions significantly correlate with toxicity for 84% of languages studied. Given our findings, our recommendations to reduce added toxicity are to curate training data to avoid mistranslations, mitigate hallucination and check unstable translations.

cs.CL