AskQE: Question Answering as Automatic Evaluation for Machine Translation

TL;DR

AskQE利用问答框架检测机器翻译关键错误,基于ContraTICO和BioMQM数据集,采用LLaMA-3 70B模型实现高相关性评估。

cs.CL 🔴 高级 2025-04-16 50 次浏览
Dayeon Ki Kevin Duh Marine Carpuat
机器翻译 质量估计 问答系统 深度学习 高风险场景

核心发现

方法论

本研究提出AskQE框架,通过源句子提取事实信息,利用自然语言推理(NLI)筛选可靠事实,再基于LLAMA-3 70B模型生成问题,随后用单语QA系统对源句和反向翻译的MT输出回答问题。通过比较答案一致性,评估翻译质量。使用CONTRATICO合成高风险错误,验证不同设计选择,优化模型参数,最终在BioMQM数据集上表现优异,相关系数达0.878,决策准确率显著优于传统QE指标。

关键结果

  • ASKQE在CONTRATICO数据集上能有效区分次要与关键错误,平均F1值达0.815,EM值0.682,显著高于基线方法。对不同语言对(如EN-ZH、EN-FR)均表现出强鲁棒性,误差严重度越高,得分越低,验证了其敏感性。
  • 在BioMQM自然错误数据集上,ASKQE的Kendall's τ达0.878,优于XCOMET-QE和BT-Score,与人类评判的相关性更高,显示其良好的解释性和实用性。
  • 决策模拟实验表明,基于ASKQE的质量反馈能提升高风险场景下的接受决策准确率,超越传统指标,具有实际应用潜力。

研究意义

该研究突破了现有机器翻译质量估计的局限,提出基于问答的可解释性评估框架,特别适用于单语用户在高风险场景中的决策需求。通过引入事实提取、推理和生成机制,有效提升了对关键错误的敏感性和解释能力,为自动化质量控制提供新思路,推动机器翻译在医疗、法律等关键领域的应用落地。

技术贡献

本研究创新性地结合自然语言推理(NLI)与大规模语言模型(LLM)进行问答生成,提出基于事实提取和推理的问答质量评估方法,突破了传统单一分值或错误标注的局限。采用LLAMA-3 70B模型实现高质量问题生成,结合多模态评估指标,有效提升了对错误严重度的区分能力。提出的框架兼具可解释性和鲁棒性,为未来自动化质量评估提供新技术路径。

新颖性

本工作首次将问答机制引入机器翻译质量估计,利用事实提取和推理增强模型的解释性,区别于以往仅依赖参考翻译或单一指标的评估方法。通过合成高风险错误数据验证模型敏感性,展示了问答框架在高风险场景中的优越性,为自动化质量检测提供创新思路。

局限性

  • 模型对复杂语义错误的检测仍存在局限,尤其在多义或隐晦表达中表现不足,可能导致误判。
  • 依赖大规模预训练模型(如LLAMA-3 70B),计算成本较高,实际部署需考虑效率优化。
  • 反向翻译引入噪声可能影响答案一致性,未来需结合多模态信息或增强推理能力以提升鲁棒性。

未来方向

未来将探索多语言、多模态数据融合,提升模型对多样化错误的敏感性。结合主动学习和人机交互机制,优化问答生成策略,增强模型的可解释性和适应性。此外,将扩展到更多行业应用场景,如法律、金融等高风险领域,推动自动化质量评估的商业化落地。

AI 总览摘要

在全球化背景下,机器翻译(MT)已成为跨语言交流的重要工具。然而,尤其在医疗、法律等高风险场景中,翻译的准确性直接关系到生命安全和社会稳定。传统的质量估计(QE)指标多依赖于整体分值或错误标注,难以为非专业用户提供直观、可操作的反馈。为解决这一难题,本文提出AskQE框架,结合问答机制实现高效、可解释的翻译质量评估。

AskQE的核心思想是通过源句子提取事实信息,利用自然语言推理(NLI)筛选可靠事实,再由大规模语言模型(LLAMA-3 70B)生成针对性问题。随后,利用单语QA系统对源句和反向翻译的MT输出回答这些问题,比较答案的一致性以判断翻译的关键错误。该方法不仅能识别出严重的语义偏差,还能提供详细的错误解释,增强用户信任。

在CONTRATICO合成高风险错误数据集上,AskQE表现出优异的敏感性和区分能力,平均F1值达0.815,EM值0.682,显著优于传统QE指标。在自然错误的BioMQM数据集上,其Kendall's τ达0.878,相关性优于现有方法,验证了其在真实场景中的应用潜力。此外,决策模拟实验显示,基于AskQE的反馈能显著提升高风险场景下的决策准确率,为自动化质量控制提供新思路。

总之,AskQE通过结合事实提取、推理和问答生成,突破了传统指标的局限,为机器翻译在关键领域的应用提供了强有力的技术支撑。未来,将致力于多语言、多模态融合,优化模型效率和鲁棒性,推动高风险场景下的自动化质量评估落地。

深度解读

原文摘要

How can a monolingual English speaker determine whether an automatic translation in French is good enough to be shared? Existing MT error detection and quality estimation (QE) techniques do not address this practical scenario. We introduce AskQE, a question generation and answering framework designed to detect critical MT errors and provide actionable feedback, helping users decide whether to accept or reject MT outputs even without the knowledge of the target language. Using ContraTICO, a dataset of contrastive synthetic MT errors in the COVID-19 domain, we explore design choices for AskQE and develop an optimized version relying on LLaMA-3 70B and entailed facts to guide question generation. We evaluate the resulting system on the BioMQM dataset of naturally occurring MT errors, where AskQE has higher Kendall's Tau correlation and decision accuracy with human ratings compared to other QE metrics.

cs.CL