Last Translation Benchmark

TL;DR

提出Last翻译基准,结合人类审查和验证规则,提升模型失败检测能力。

cs.CL 🔴 高级 2026-09-04 97 次浏览
Vilém Zouhar Niyati Bafna Mukund Choudhary Maike Züfle Sara Rajaee Pinzhen Chen Jannis Vamvas Sara Papi Ona de Gibert Bhavitvya Malik Eliya Habba Orfeas Menis Mastromichalakis Patrícia Schmidtová Michelle Wastl Sheriff Issaka Leshem Choshen Stella Biderman Antonis Anastasopoulos Jan Niehues Rico Sennrich Mrinmaya Sachan Ondřej Bojar Kenton Murray Jörg Tiedemann Alham Fikri Aji Philipp Koehn Christof Monz Alexandra Birch Sowmya Vajjala Chalamalasetti Kranti Cristina España-Bonet Nobin Sarwar David Kaczér Shunta Asano Malik Marmonier Daban Q. Jaff Vaisakhi Mishra Hend Al- Khalifa Gabriele Sarti Sourajit Saha Nils Rehlinger Juan Daniel Cuervo Villa Jonathan Tonglet Saugata Purkayastha Dominik Macháček Jagannathan Ramanujam Heejin Do Zuzana Nadova Fred Philippy Fabian Retkowski Maria Lymperaiou Silvia Casola Hanna Yukhymenko Shubhashis Roy Dipta Sangwon Ryu Andrés Jerez Ron Keinan Shuaib Shuaib Yusuf Avantica Vempati Maria Carmen Staiano Sukannya Purkayastha Adrian Cosma Vitalii Babenko Erivan Inan Aviral Nigam Wafa Aissa Fatima Haouari Venkata Prasanth Kumar Gummadi Mehdi Jafarzadeh Valentin Scourneau Lukas Edman Kaiser Sun Shaomu Tan Mohammad Sadegh Gholizadeh Johannes-Rudolf David Dipankar Srirag Javier García Gilabert Ruta Binkyte Manar Ali Ana-Maria Bucur Sabry E. Farrag Youssef Saber Yihong Liu Jean Maillard Cojocaru Nicoleta Xiaochuang Yuan Sina Ahmadi Philipp Mondorf Kaustubh Dhole Roman Wixinger Shenbin Qian Manuel Tuor Sergey Troshin Jonathan Yahav Fida Mohammad Thoker Amir Arsalan Rezapour Lance Calvin Lim Gamboa Manon Reusens Kätriin Kukk Koel Dutta Chowdhury Giuseppe Gallipoli Christian Hoang Shaswati Saha Seth Aycock Jan Kocoń Bo Chen Linh Vu Vatsal Venkatkrishna Arafat Ahsan Luan Thanh Nguyen Hassan Soliman Daryna Dementieva Theresia Veronika Rampisela Ngoc Quynh Tram Do Marius Huber Kazuki Egashira Azmine Toushik Wasi Vladislav Poritski Mike Zhang Deep Shah Paul Gavrikov Luis Frentzen Salim David Africa R. Damanhuri Bello Umar Bello Anumit Garg Gengyu Rao Pawan Sasanka Ammanamanchi Kamile Dementaviciute Andrianos Michail L D M S Sai Teja Dawei Zhu Yi Fan Wei Liu Farhan Farsi Elias Herranen Sankalan Pal Chowdhury Karen Sanchez Farzad Shami Ashok Urlana Zimu Wang Tomasz Limisiewicz Priyaranjan Pattnayak Marii Ojastu Hongbin Na Emilian Radoi Chenyi Zhao Carlos Hinojosa Andrea Gregor de Varda Zaid Alyafeai Reem Alzahrani Nehal Kathrotia Alex Flückiger Ulysses Sekai Tully Carr Jimson Paulo Layacan Guy Kaplan Ritwik Tiwari Rishit Dagli Oksana Volchek Isaac R Caswell Bowen Yi Blanka Kövér Amir Hossein Yari Aicha Chorana Zhengxiang Wang Selja Keränen Samuel Simko Joy Olusanya Jenny Chim Enzo Doyen Vivek Harsha Lakkamaneni Sophia Conrad Pouya Sadeghi Panayiotis Panayiotou Luis Lara Jannatul Nayem Eran Yahav Debanshu Das Antonia Karamolegkou Anmol Goel Aishik Mandal Tommaso Cerruti Raoyuan Zhao Mykola Haltiuk Thura Aung Naser Almousa Amir Hossein Kargaran Rachel Bawden Qiaoyuan Zheng Mateusz Lango Beni Egressy Fidel Rodríguez Velásquez Natchapon Jongwiriyanurak Minh Ngoc Do Marco Gaido Lena Libon Dzmitry Kuzmin Badal Nyalang Antoine Taroni Andrei Niculae Abdulaziz Nura Kani Rushikesh Zawar Marek Šuppa Beatrice Savoldi Andreas Simons Rayyan Merchant Ilai Yaron Levy Francesco Pinto Ziyi Yang Yolanda Xavier Samuel Frontull Muhammad Ravi Shulthan Habibi Kenneth Enevoldsen Harris Abdul Majid Francesca Padovani Tim Graf Tatiana Bielakova Sharifa Djurabaeva Shaoxiong Ji Raia Abu Ahmad Pavel Stepachev Jirui Qi Ayush Sunil Munot Alireza Pakniat Ayla Rigouts Terryn Yuxing Lu Yurii Paniv Xiyan Fu Tosin Adewumi Sunisth Kumar Stéphane J. P. S. Thunus Shree Harsha Bokkahalli Satish Shayan Bali Prakhar Gupta Papa Abdou Karim Karou Diallo Matija Akrap Marko Culjak Kristýna Onderková Joseph Attieh Esrael Teferi Tensay Elisabeth Fittschen Benoît Sagot Jingwei Ni Yu Fan
机器翻译 评估基准 模型失败检测 验证规则 持续更新

核心发现

方法论

该研究构建了包含人类撰写、同行评审的难翻译样例的Last翻译基准(LTB),每个样例配备手工设计的验证规则,用于识别模型的具体失败模式。利用大规模众包收集数据,结合基于验证规则的自动评估,确保评估的可重复性、客观性和细粒度。该方法突破了传统指标的局限,强调模型在真实复杂场景中的表现,推动持续改进。

关键结果

  • LTB目前包含3456个跨109种语言的难翻译样例,显著超越现有基准的难度。多款主流模型在此基准上表现不佳,平均成功率低于20%。验证规则有效识别性别、文化、语境等多维失败类型,为模型改进提供明确方向。实验显示,基于验证规则的自动评估比传统BLEU、COMET等指标更具解释性和稳定性。
  • 在最新模型(如GPT-5.6、Gemini 3.1 Pro)上,成功率提升有限,说明模型仍存在严重的局限性。验证规则的引入显著降低了评估偏差,提高了检测的可靠性。通过对不同语言和场景的分析,发现模型在多义性、文化差异和长文本理解方面尤为薄弱。
  • 持续更新的机制使得LTB成为动态的挑战平台,鼓励社区不断贡献新样例。未来版本计划涵盖更多低资源语言和多模态数据,推动模型在复杂、多样场景下的鲁棒性提升。该基准为行业提供了衡量模型实际能力的工具,有望引领翻译技术的长远发展。

研究意义

该研究解决了自动翻译评估中缺乏真实复杂场景、难以量化失败的核心问题,为模型的持续改进提供了可靠的诊断工具。通过引入验证规则,增强了评估的解释性和可操作性,有助于行业从根本上提升翻译质量。LTB的动态特性激励社区持续贡献,推动学术界和工业界共同应对多模态、多语言、多文化背景下的翻译挑战。此方法为未来构建更智能、更鲁棒的翻译系统奠定基础,具有深远的科研和应用价值。

技术贡献

本研究提出了结合人类专家设计验证规则的自动化评估框架,突破了传统指标的局限,实现了对模型失败的细粒度检测。引入多模态、多语言的难例样本,丰富了评估场景。通过构建持续更新的活跃数据集,推动了基准的长期演进。该方法兼容大规模众包和自动验证机制,为模型诊断提供了可解释的工具,增强了评估的科学性和实用性。

新颖性

首次系统性结合人类设计验证规则与大规模众包数据,建立了动态、可扩展的翻译失败检测平台。不同于传统静态指标和单一参考的评估体系,LTB强调真实复杂场景和具体失败类型,提供了更具操作性和解释性的模型诊断工具。这一创新架构为未来多模态、多语言评估提供了新思路,具有开创性意义。

局限性

  • 验证规则的设计依赖专家经验,可能存在偏差或遗漏,影响评估全面性。
  • 样例偏向极端或特殊场景,难以代表普通用户体验,泛化能力有限。
  • 持续贡献机制依赖社区积极性,可能导致数据偏差或更新不及时。

未来方向

未来将扩展多模态数据(如图像、音频、视频),增强模型在跨模态场景中的鲁棒性。计划引入自动化验证规则生成技术,降低专家依赖,提升效率。同时,推动低资源语言的样例收集,促进多语言公平性。还将结合用户反馈,优化验证规则的覆盖面,逐步实现更全面、细粒度的模型诊断体系。

AI 总览摘要

随着深度学习模型的不断增强,机器翻译的性能已接近饱和,但实际应用中仍存在诸多难点。传统评估指标如BLEU和自动化模型在反映真实场景中的失败方面表现不足,难以指导模型改进。人类评审虽然可靠,但成本高、难以规模化,且缺乏可重复性。为解决这一困境,本文提出了“Last翻译基准”(LTB),通过收集由专家撰写、同行评审的难翻译样例,结合手工设计的验证规则,建立了一个动态、可持续更新的挑战平台。每个样例都配备具体的失败检测规则,利用大模型作为验证者,自动评估模型在复杂、多样场景中的表现。实验结果显示,当前主流模型在此基准上的成功率极低,验证规则有效识别了多种失败类型,为模型改进提供了明确方向。LTB的设计强调真实性、解释性和持续性,激励社区不断贡献新样例,推动翻译技术的长远发展。未来,基准将涵盖更多低资源语言和多模态数据,助力构建更鲁棒、普适的翻译系统。该平台不仅为学术研究提供了宝贵工具,也为工业界提供了衡量模型实际能力的标准,有望引领行业迈向更高的智能化水平。

深度分析

研究背景

机器翻译作为自然语言处理的核心任务,经历了从基于规则到深度学习的飞跃。早期的统计机器翻译(SMT)和神经机器翻译(NMT)模型在标准数据集(如WMT)上取得了显著进步,但仍存在多义性、文化差异和长文本理解等难题。现有评估多依赖BLEU、METEOR等表面匹配指标,难以反映模型在复杂场景中的真实表现。近年来,随着大规模预训练模型(如GPT系列、BERT)和多模态技术的发展,翻译质量有了提升,但模型在特定语境、文化敏感性和多模态理解方面仍显不足。代表性工作如WMT评测、COMET指标、以及人类评审,虽在一定程度上反映了模型能力,但都存在可重复性差、偏差大、无法细粒度诊断的问题。此背景下,亟需一种能真实反映模型在复杂、多样场景下失败的基准,推动模型的持续改进。

核心问题

当前的翻译评估体系面临多重挑战。首先,静态基准逐渐饱和,难以区分不同模型的微小差异,也无法揭示模型在真实复杂场景中的失败点。其次,自动指标如BLEU、COMET等偏向表面匹配,无法捕捉语义、文化和多模态信息的深层次差异。人类评审虽具权威性,但成本高昂、难以规模化,且评估结果缺乏一致性和可重复性。更严重的是,现有方法难以识别模型在多义性、性别偏见、文化差异等方面的具体失败类型,限制了模型的有针对性改进。解决这一问题,要求建立一种既能反映真实场景复杂性的,又能提供细粒度失败诊断的评估体系,成为当前研究的核心难题。

核心创新

本研究的创新点在于:1)构建了包含专家撰写、同行评审的难翻译样例的动态数据集,确保样例的真实性和挑战性;2)引入验证规则,明确描述模型在特定场景下的失败类型,实现细粒度诊断;3)利用大模型作为验证者,自动评估翻译是否满足验证规则,兼具客观性和可重复性;4)实现持续更新机制,激励社区贡献,推动基准的长期演进。这一体系突破了传统静态指标的局限,强调模型在真实、多样、复杂场景中的表现,为模型诊断和改进提供了科学工具。

方法详解

  • �� 数据收集:通过众包平台,专家和用户贡献难翻译样例,涵盖多语言、多模态内容。• 样例设计:每个样例由专家撰写,确保真实性和挑战性。• 验证规则:针对每个样例,设计具体的失败检测规则,描述模型可能出现的问题(如性别错误、文化误解、长文本错译等)。• 自动评估:利用大模型(如GPT-4)作为验证者,自动检测翻译是否满足验证规则。• 评估指标:成功率即为满足所有验证规则的样例比例,提供可解释的成功/失败判断。• 持续更新:社区成员不断贡献新样例,平台实时整合,保持基准的动态性。

实验设计

采用WMT、IWSLT等公开数据集作为基础,结合社区贡献的难例样本,评估多款主流模型(如GPT-4、PaLM、T5)在LTB上的表现。对比传统指标(BLEU、COMET)与验证规则成功率,分析模型在不同类型失败中的表现差异。设置不同验证规则,进行消融实验,验证规则设计对评估效果的影响。通过多轮迭代优化验证规则,确保其覆盖模型常见失败场景。实验还包括低资源语言、多模态内容的测试,验证基准的广泛适用性。

结果分析

结果显示,主流模型在LTB上的平均成功率不足20%,远低于在标准基准上的表现。验证规则有效识别了性别、文化、长文本理解等多方面的失败类型,提供了细粒度的诊断信息。与传统指标相比,验证规则的成功率更稳定、更具解释性。模型在多模态、多语言场景中的表现差异明显,验证规则帮助揭示模型在复杂语境下的局限。实验还表明,持续贡献机制能不断丰富样例库,提升评估的全面性和代表性。

应用场景

该基准可广泛应用于模型开发的诊断与优化,帮助研究者识别具体的失败模式。工业界可利用LTB进行模型性能验证,确保翻译系统在复杂场景中的鲁棒性。多模态内容的评估也为跨模态翻译、文化适应等应用提供支持。未来,结合自动生成验证规则,将进一步降低评估成本,推动个性化、多场景的翻译系统发展。

局限与展望

验证规则设计依赖专家经验,可能存在偏差或遗漏,影响全面性。样例偏向极端或特殊场景,难以代表普通用户体验。持续贡献机制受社区积极性影响,可能导致数据偏差或更新不及时。未来需引入自动化验证规则生成和多样化样例采集,以提升评估的广泛适用性和公平性。

通俗解读 非专业人士也能看懂

想象你在一家工厂里,生产各种商品。每个商品都要经过检测,确保没有缺陷。传统的检测方法就像用简单的尺子比对商品是否符合标准,但有时候尺子不够灵敏,不能发现所有问题。现在,工厂引入了一个新系统,设计了详细的检测规则,比如:颜色是否正确、尺寸是否合格、标签是否贴错。每个商品都要经过这些规则的检测,只有全部符合,才能出厂。这个系统还能自动检测出哪些商品有缺陷,告诉工厂工人具体哪里出错了。这个方法就像论文中的验证规则,不仅能自动检测问题,还能告诉你具体出错的原因,帮助工厂不断改进产品质量。它让检测变得更科学、更精准,也更容易持续改进。

简单解释 像给14岁少年讲一样

想象你在学校里参加一个比赛,老师设计了一套特别的评分标准,比如:答题内容是否完整、表达是否清楚、用词是否得当。每次你答题后,老师会用这些标准仔细检查,确保每个方面都符合要求。如果你答得不好,老师会告诉你具体哪里出了问题,比如:没有回答全部问题,或者表达不够清楚。这样,你就知道自己在哪些地方需要改进。论文里的验证规则就像这些评分标准,它们告诉模型在翻译时要注意哪些细节,比如性别、文化差异或长句理解。通过这种方法,不仅可以自动检测出翻译中的错误,还能帮模型变得更聪明、更可靠。就像老师帮你指出不足,让你不断变得更棒!

原文摘要

For scientific progress, we need benchmarks that test the limits of state-of-the-art models, and evaluation methods that inform us about failure cases. As models get stronger, standard benchmarks for machine translation are approaching saturation. Further, automatic translation metrics are unreliable, vulnerable to reward-hacking, and provide unactionable assessments. Even gold human evaluation is not problem-free, because it often lacks reproducibility, objectivity, and scalability. Overall, this prevents us from tracking objective progress in the field and identifying pathways for improvement. We introduce the Last Translation Benchmark, a collection of human-authored and peer-reviewed examples (texts, images, audio, videos) that break leading machine translation models. We also present a new evaluation approach: each example comes with handcrafted verification rules describing concrete failure cases on that example, therefore allowing reliable and actionable future evaluation. The Last Translation Benchmark is a live dataset that accepts ongoing contributions. The latest version is LTBv1, containing accepted contributions prior to September 1st 2026, with future releases planned as new data is continuously collected.

cs.CL