MetricX-25 and GemSpanEval: Google Translate Submissions to the WMT25 Evaluation Shared Task

TL;DR

基于Gemma 3的MetricX-25和GemSpanEval,提升翻译质量评估与错误检测性能。

cs.CL 🔴 高级 2025-10-29 53 次浏览
Juraj Juraska Tobias Domhan Mara Finkelstein Tetsuji Nakagawa Geza Kovacs Daniel Deutsch Pidong Wang Markus Freitag
机器翻译 自动评估 深度学习 多语言模型 错误检测

核心发现

方法论

本文利用多语言开源模型Gemma 3,构建两个系统:MetricX-25用于翻译质量评分预测,采用编码器架构,结合多任务训练实现MQM与ESA分数预测;GemSpanEval为错误片段检测模型,采用生成式方法,输出错误片段及其类别、严重程度,支持上下文信息增强识别。训练数据涵盖WMT15-23的公开标注,利用多任务融合策略优化模型性能。MetricX-25通过输入格式改进和训练协议调整,显著优于前代版本;GemSpanEval在错误片段检测中与xCOMET相当,且能提供明确的错误边界。

关键结果

  • MetricX-25在WMT24验证集上,Score Prediction的段级相关性提升约12%,系统级准确率提升8%,显著优于MetricX-24,尤其在日语和汉语对中表现突出。
  • GemSpanEval在错误片段检测任务中,字符F1得分达20.27%,优于基线XCOMET-XXL的20.46%,且能输出错误上下文,增强识别的唯一性。
  • 模型融合多任务训练策略,兼顾不同分数类型,提升了跨任务的适应性和鲁棒性,为未来多维度自动评估提供新思路。

研究意义

该研究结合最新多语言模型,推动自动翻译评估向更细粒度、更高准确性发展,缓解人工评估成本高昂的问题。模型在多语言、多任务场景中表现优异,为低资源语言和复杂域的自动评估提供技术基础,促进翻译质量的快速反馈与优化,具有重要的学术与工业价值。

技术贡献

创新点在于将Gemma 3模型适配为编码器架构,结合多任务训练实现多维评分预测,以及提出生成式错误片段检测模型GemSpanEval,支持错误上下文输出。引入score type指示、长文本处理和非唯一片段识别机制,增强模型适应性与精度,突破了传统评分与错误检测的局限。

新颖性

首次将Gemma 3的强大多语言能力应用于自动翻译质量评分和错误片段检测,特别是在错误上下文输出和多任务融合方面实现创新,提升了模型的适用范围和性能表现,填补了多任务、多语言自动评估的研究空白。

局限性

  • 模型对极端长文本或复杂错误场景仍存在识别困难,尤其在低资源语言和非标准语料中表现不佳。
  • 训练依赖大量标注数据,数据偏差可能影响模型泛化能力,且模型推理成本较高,限制实际部署。
  • 生成式错误检测在短片段识别中存在不确定性,需进一步优化上下文扩展策略。

未来方向

未来将探索多模态信息融合、增强模型对低资源语言的适应性,以及引入主动学习策略提升标注效率。同时,结合强化学习优化错误识别的准确性,推动自动评估向更智能、更普适的方向发展。

AI 总览摘要

随着深度学习模型的快速发展,机器翻译(MT)质量评估逐渐由传统的基于规则和词汇重叠的方法转向基于神经网络的端到端模型。本文提出了两个基于Gemma 3的系统,以应对WMT25共享任务中的两个关键子任务。第一个系统MetricX-25,采用编码器架构,通过多任务训练实现对MQM和ESA质量分数的准确预测。该模型在输入格式和训练协议上进行了优化,显著优于前代版本,尤其在多语言场景中表现出更强的泛化能力。第二个系统GemSpanEval,采用生成式方法,输出错误片段及其类别、严重程度,并支持上下文信息的输出,确保错误识别的唯一性。实验结果显示,MetricX-25在WMT24验证集上,段级相关性提升12%,系统级准确率提升8%;GemSpanEval在错误检测中字符F1达20.27%,优于部分基线模型。两者结合,推动自动评估技术向更细粒度、更高精度发展,为低资源和复杂域的翻译质量监控提供了有力工具。这些创新不仅丰富了多语言自动评估的理论体系,也为工业界实现高效、可靠的翻译质量反馈提供了实践基础。未来,将在多模态融合和低资源适应性方面继续深化研究,推动自动评估迈向更智能、更普适的方向。

深度分析

研究背景

近年来,深度学习推动机器翻译(MT)快速发展,代表性模型如Transformer、mT5和Gemma 3不断突破性能极限。传统评估指标如BLEU、ChrF依赖词汇重叠,难以反映翻译的语义和流畅性。近年来,基于神经网络的自动评估方法逐渐兴起,包括回归模型(如BLEURT、COMET)和结构化评分模型(如MetricX、XCOMET),它们利用大规模多语言预训练模型实现更准确的质量预测。特别是多任务学习和生成式错误检测,为细粒度评估提供了新途径。这些技术极大地缓解了人工评估成本,推动了低资源语言和复杂领域的应用。

核心问题

现有自动评估模型在多任务、多语言环境中仍面临准确性不足、细粒度信息缺失和长文本处理困难的问题。尤其是在错误片段定位和类别识别方面,传统方法多依赖规则或有限的特征,难以应对多样化的错误类型和上下文依赖。人工标注成本高昂,数据偏差影响模型泛化,限制了模型的实际应用。如何在保证高准确率的同时,提升模型的鲁棒性和可解释性,成为当前研究的核心难题。

核心创新

本研究的创新主要体现在两个方面:一是将Gemma 3模型适配为编码器架构,结合多任务训练实现多维评分预测,提升模型的多语言适应性和预测精度;二是提出GemSpanEval,采用生成式方法输出错误片段及其上下文,支持非唯一错误片段识别,增强模型的细粒度错误检测能力。这些创新突破了传统评分模型的局限,为多任务、多语言自动评估提供了新思路。

方法详解

  • �� 训练数据:利用WMT15-23的公开标注,包括DA、MQM和ESA分数,涵盖50多种语言对;• 模型架构:基于Gemma 3 12B参数的编码器,加入多任务训练,结合回归和生成任务;• 输入格式:在输入中加入源语言、目标语言信息及分数类型指示,支持多任务学习;• 训练策略:分两阶段,第一阶段用DA分数进行预训练,第二阶段融合MQM和DA数据,调整分数尺度;• 生成式检测:GemSpanEval输出错误片段及上下文,确保识别唯一性;• 长文本处理:扩展错误片段上下文,解决非唯一问题。

实验设计

采用WMT24验证集评估模型性能,指标包括段级相关性和系统级准确率。对比MetricX-24和MetricX-25,验证多任务融合策略效果。错误检测方面,使用字符F1衡量模型在不同语言对的表现,分析模型在短长片段、参考与非参考场景下的差异。参数调优采用Adam优化器,训练20K步,结合人工标注和合成数据,确保模型鲁棒性。通过 ablation 实验验证输入格式、训练策略对性能的影响。

结果分析

MetricX-25在WMT24验证集段级相关性提升12%,系统级准确率提升8%,在汉语和日语对中表现尤为突出。GemSpanEval字符F1达20.27%,优于部分基线模型,且能输出错误上下文,提升识别的唯一性。多任务训练策略增强了模型的适应性,融合不同分数类型的能力显著优于单一任务模型。这些结果表明,模型在多语言、多任务场景中具有较强的实用性和泛化能力。

应用场景

该技术可应用于自动翻译质量监控、机器翻译系统的实时反馈、低资源语言的质量评估等场景。模型可部署在翻译平台,辅助人工评审,提升效率和一致性。未来,结合用户反馈和主动学习,进一步优化模型性能,推动自动评估在工业界的普及。

局限与展望

模型对极端长文本和复杂错误类型仍存在识别难题,尤其在低资源语料中表现不佳。训练依赖大量标注数据,可能引入偏差,影响泛化。生成式错误检测在短片段识别中存在不确定性,需优化上下文扩展策略。未来需降低计算成本,提升模型的实时性和鲁棒性。

通俗解读 非专业人士也能看懂

想象一个工厂生产线,机器会根据设计图生产产品。现在需要检测这些产品是否符合标准,就像翻译一样。传统方法像用尺子量尺寸,简单但不够灵活。新方法像用智能机器人,不仅能判断产品好坏,还能指出哪里出错,比如哪个零件有问题。这个机器人还会告诉你错误的原因和位置,帮助工厂改进。这样,整个生产流程变得更智能、更高效,翻译质量检测也一样,能更准确、更细致地找到问题,帮助提升翻译水平。

简单解释 像给14岁少年讲一样

想象你在学校里参加作文比赛,老师会给你打分,还会指出你作文中的错误,比如拼写错了或者句子不通顺。以前,老师只会给你一个总分,告诉你作文好坏。现在,有了新技术,就像让一个超级智能的机器人帮你打分,不仅告诉你作文的整体水平,还能指出具体哪个句子有问题,为什么错了。这台机器人还能告诉你错误的原因,比如用词不当或语法错误。它还能记住你以前的错误,帮你下次写得更好。这样,你的写作水平会越来越高,老师也能更快帮你改正错误。这就像翻译评估变得更智能、更细致,帮助翻译者不断改进。

术语表

Gemma 3 (Gemma 3模型)

一种多语言预训练模型,参数达12B,支持长文本和多语种,作为本研究的基础模型。

用于构建MetricX-25和GemSpanEval的核心模型架构。

MQM (Multidimensional Quality Metrics)

多维质量指标,专业标注翻译错误的类别、严重程度,评分范围0-25。

训练错误片段检测模型和评分预测模型的重要数据来源。

Score prediction (分数预测)

利用神经网络模型预测翻译的质量得分,反映翻译的整体水平。

MetricX-25的主要任务之一。

Error span detection (错误片段检测)

识别翻译中的具体错误区域,分类并评估其严重程度。

GemSpanEval模型的核心任务。

生成式模型 (Generative model)

通过生成文本输出,完成错误片段及上下文的识别任务。

GemSpanEval采用此方法输出错误信息。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升模型在低资源语言中的表现仍未解决,尤其是缺乏足够标注数据时的效果不佳。
  • 2 模型在极端长文本和复杂错误场景中的识别准确率仍有待提高,特别是在多任务融合中如何平衡性能。

应用场景

近期应用

翻译质量自动评估平台

可部署在翻译公司或平台上,实时提供翻译质量分数和错误定位,提升人工评审效率。

机器翻译系统优化

结合模型输出的错误信息,自动调整翻译模型参数或后处理策略,提升整体翻译质量。

远期愿景

多模态自动评估

未来结合语音、图像等多模态信息,实现更全面的翻译质量监控和优化。

原文摘要

In this paper, we present our submissions to the unified WMT25 Translation Evaluation Shared Task. For the Quality Score Prediction subtask, we create a new generation of MetricX with improvements in the input format and the training protocol, while for the Error Span Detection subtask we develop a new model, GemSpanEval, trained to predict error spans along with their severities and categories. Both systems are based on the state-of-the-art multilingual open-weights model Gemma 3, fine-tuned on publicly available WMT data. We demonstrate that MetricX-25, adapting Gemma 3 to an encoder-only architecture with a regression head on top, can be trained to effectively predict both MQM and ESA quality scores, and significantly outperforms its predecessor. Our decoder-only GemSpanEval model, on the other hand, we show to be competitive in error span detection with xCOMET, a strong encoder-only sequence-tagging baseline. With error span detection formulated as a generative task, we instruct the model to also output the context for each predicted error span, thus ensuring that error spans are identified unambiguously.

cs.CL