Multilingual Denoising Pre-training for Neural Machine Translation

TL;DR

提出mBART多语种去噪预训练,显著提升低资源MT性能,最高达12BLEU点。

cs.CL 🔴 高级 2020-01-23 55 次浏览
Yinhan Liu Jiatao Gu Naman Goyal Xian Li Sergey Edunov Marjan Ghazvininejad Mike Lewis Luke Zettlemoyer
多语种预训练 神经机器翻译 自监督学习 Seq2Seq模型 迁移学习

核心发现

方法论

本文采用基于BART目标的多语种序列到序列去噪自编码器预训练,利用大规模单语语料库(CC25)进行训练。模型结构为12层Transformer编码器和解码器,输入文本经过句子打乱和掩码处理,目标是恢复原始文本。预训练后,模型可直接微调应用于句子级和文档级的有监督及无监督MT任务,无需任务特定的调整。通过多语种预训练,模型参数实现跨语言迁移,尤其在低资源场景表现优异。

关键结果

  • 在低资源MT(<10M双语句对)中,mBART初始化提升BLEU达12点,显著优于随机初始化。结合反向翻译(BT)后,在WMT16罗马尼亚语-英语任务中刷新了状态,超越现有预训练模型。文档级MT中,预训练提升最高达5.5 BLEU点。无监督MT在少相关语对(如尼泊尔-英语)中也取得9.5 BLEU的提升,证明模型具备良好的迁移能力。

研究意义

该研究突破了传统只在编码器或解码器上预训练的局限,首次实现完整Seq2Seq模型的多语种去噪预训练,极大地推动了多语种机器翻译的发展。模型无需任务特定调整即可应用于多种场景,特别在低资源和无监督环境中表现出巨大潜力,为多语种信息交流提供了强有力的技术支撑。

技术贡献

提出mBART模型,结合BART目标与多语种预训练策略,首次实现全模型端到端的多语种预训练,显著改善了跨语言迁移能力。模型架构采用12层Transformer,利用Poisson分布掩码和句子重排增强鲁棒性。通过大规模CC25语料库训练,模型参数具有较强的泛化能力。实验中,模型在多项MT基准测试中超越现有方法,验证了其优越性。

新颖性

该工作首次将完整的Seq2Seq模型通过多语种去噪自编码器进行预训练,区别于以往只在编码器或解码器单一部分进行预训练的方法。引入全模型预训练策略,结合多语种数据,显著提升低资源场景的翻译质量,开启了多语种预训练的新方向。

局限性

  • 模型在高资源场景(>25M句对)中,预训练效果趋于饱和,反而略有下降,表明预训练在数据丰富时边际收益递减。
  • 训练成本较高,需大量GPU资源(约2.5周在256卡V100上完成),限制了其普及。
  • 对未在预训练语料中出现的语言迁移能力仍有限,尤其在极低资源或语系差异大的场景中表现不足。

未来方向

未来可探索更高效的预训练策略,降低计算成本;增强模型对未见语言的迁移能力,结合多模态信息丰富预训练语料;同时,结合更复杂的文档理解和多任务学习,推动多语种自然语言理解与生成的深度融合。

AI 总览摘要

随着全球信息交流的日益频繁,多语种机器翻译(MT)成为自然语言处理的核心挑战之一。传统方法多依赖大量双语平行语料,难以应对低资源语言或新兴语种的需求。近年来,预训练模型如BERT、GPT等在单语任务中取得突破,但在多语种MT中仍存在局限。本文提出mBART,一种基于BART目标的多语种Seq2Seq去噪预训练模型,利用大规模单语语料库进行训练,实现了端到端的全模型预训练。模型结构采用12层Transformer编码器和解码器,结合句子打乱和掩码技术,增强模型的鲁棒性和迁移能力。预训练完成后,模型可以直接微调应用于多种MT任务,无需任务特定的调整,极大简化了流程。实验结果显示,在低资源场景下,mBART提升BLEU达12点,远超随机初始化模型,并在结合反向翻译后刷新了多项状态。文档级MT和无监督MT中也取得显著提升,验证了模型的广泛适应性。该研究不仅推动了多语种预训练技术的发展,也为低资源语言的普及提供了新途径。未来,优化训练效率、扩展未见语种迁移能力,将是持续的研究方向。整体来看,mBART为多语种自然语言处理开启了新的可能,具有深远的学术和产业价值。

深度分析

研究背景

多语种机器翻译经历了从基于规则到统计模型,再到神经网络的演变。早期方法依赖大量平行语料,难以扩展到低资源语种。近年来,预训练模型如BERT、GPT在单语任务中展现出强大能力,但在多语种MT中的应用仍有限。现有多语种预训练多集中在编码器或解码器的单一部分,缺乏端到端的全模型预训练策略。随着大规模单语语料库的出现,研究者开始探索多语种自监督预训练的潜力,旨在提升跨语言迁移能力和低资源场景表现。

核心问题

传统多语种MT模型依赖大量平行语料,难以应对低资源语种或新兴语种的翻译需求。现有预训练多集中在模型的部分组件,限制了模型的整体迁移能力。如何设计一种端到端的多语种预训练框架,既能充分利用单语语料,又能实现跨语种迁移,成为亟待解决的问题。此外,模型在高资源场景中的边际收益递减也限制了其应用范围。

核心创新

本研究提出mBART模型,结合BART目标的多语种Seq2Seq去噪预训练,首次实现全模型端到端的多语种预训练。创新点包括:1)利用Poisson分布掩码和句子重排增强模型鲁棒性;2)在大规模CC25语料库上训练,提升泛化能力;3)模型参数实现跨语种迁移,尤其在低资源场景表现优异;4)无需任务特定调整即可应用于多种MT任务。这些创新极大推动了多语种预训练技术的发展。

方法详解

  • �� 构建多语种语料库:从Common Crawl提取25种语言,平衡语料比例。• 设计预训练目标:采用BART的掩码和句子重排机制,掩码比例35%,句子随机重排。• 模型架构:12层Transformer编码器和解码器,模型参数约680M。• 训练过程:在256卡V100上训练500K步,使用Adam优化器,学习率线性衰减。• 多语种训练:同时训练25种语言,模型参数共享,增强跨语种迁移。• 微调:在具体MT任务上进行微调,结合反向翻译等增强技术。• 迁移能力测试:在未见语种和不同语料规模下验证模型泛化能力。

实验设计

采用WMT、IWSLT、FLoRes等公开数据集,涵盖句子级和文档级MT任务。对比随机初始化、单语预训练和多语预训练模型,评估BLEU、d-BLEU等指标。调优超参数如学习率、dropout,进行消融实验验证不同技术贡献。结合反向翻译提升低资源场景表现,测试未见语种迁移能力。实验在高资源场景中也进行验证,分析预训练边际收益。

结果分析

在低资源(<10M句对)场景中,mBART提升BLEU达12点,优于其他预训练模型。结合反向翻译后,刷新WMT16罗马尼亚语-英语状态,超越多项SOTA。文档级MT中,最高提升5.5 BLEU点。无监督MT在尼泊尔-英语等少相关语对中表现优异,验证迁移能力。模型在高资源场景中表现稳定,但略有边际递减。整体结果显示预训练极大改善多语种MT性能,尤其在低资源和无监督场景。

应用场景

该模型适用于多语种翻译平台、低资源语种推广、跨语言信息检索等场景。只需少量微调,即可实现多语种间的高质量翻译,降低了对平行语料的依赖。未来可结合多模态信息,拓展到多任务自然语言理解与生成,推动多语种AI应用普及。

局限与展望

模型训练成本高昂,需大量GPU资源,限制普及。高资源场景中预训练收益递减,模型对未见语种迁移仍有限。未来需优化训练效率,增强未见语种迁移能力,降低成本,提升模型泛化能力。

通俗解读 非专业人士也能看懂

想象你在一家大型厨房里准备各种菜肴。每次做菜都需要不同的食材和调料,但厨房里有一台特别的厨师机器人,它学会了如何用各种食材和调料做出不同的菜。这个机器人通过观察大量的菜谱(单语语料),学习了各种做菜的方法(预训练),然后根据你给的食材(任务数据)快速做出你想要的菜肴(翻译)。它还学会了如何在没有完整菜谱的情况下,用已有的经验(迁移能力)应对新菜式(未见语种)。这台机器人就是mBART,它用一种叫做“去噪”的技巧,把菜谱打乱、遮盖一部分,然后学会还原。这样,它就能在不同的厨房(语言环境)中,快速学会做出美味的菜肴(高质量翻译),无论是少量食材还是丰富的材料,都能应对自如。

简单解释 像给14岁少年讲一样

想象你在学校里学做饭。老师给你很多食谱(语料库),你观察学习,然后尝试自己做菜。刚开始可能会搞错,比如忘记放盐或者顺序错了,但你不断练习,渐渐就能用不同的食材做出各种菜肴。mBART就像这个学习做菜的学生,它看了很多单语的菜谱(单语语料),学会了怎么把菜谱中的内容还原(去噪训练)。之后,你只需要告诉它想做什么菜(任务),它就能用之前学到的技巧,快速做出符合要求的菜肴(翻译)。这个方法特别厉害,因为它不需要每个菜都给出详细的做法(平行语料),就能学会很多菜,甚至还能用在从未见过的菜式上(未见语种迁移)。

原文摘要

This paper demonstrates that multilingual denoising pre-training produces significant performance gains across a wide variety of machine translation (MT) tasks. We present mBART -- a sequence-to-sequence denoising auto-encoder pre-trained on large-scale monolingual corpora in many languages using the BART objective. mBART is one of the first methods for pre-training a complete sequence-to-sequence model by denoising full texts in multiple languages, while previous approaches have focused only on the encoder, decoder, or reconstructing parts of the text. Pre-training a complete model allows it to be directly fine tuned for supervised (both sentence-level and document-level) and unsupervised machine translation, with no task-specific modifications. We demonstrate that adding mBART initialization produces performance gains in all but the highest-resource settings, including up to 12 BLEU points for low resource MT and over 5 BLEU points for many document-level and unsupervised models. We also show it also enables new types of transfer to language pairs with no bi-text or that were not in the pre-training corpus, and present extensive analysis of which factors contribute the most to effective pre-training.

cs.CL