MTEB-BR: A Text Embedding Benchmark for Brazilian Portuguese

TL;DR

提出MTEB-BR基准,涵盖22个本土任务,评估93个模型,采用统计分析区分模型层级。

cs.CL 🔴 高级 2026-07-06 48 次浏览
Tardelli Ronan Coelho Stekel
文本嵌入 基准测试 葡萄牙语 统计分析 模型评估

核心发现

方法论

本研究构建了一个纯粹源自巴西葡萄牙语的任务集,涵盖分类、相似度、聚类、检索等七大类别,排除所有翻译数据。评估了从2,300万到270亿参数的93个模型,包括开源和商业API。采用引入自举置信区间、配对自举显著性检验、基于项目反应理论的模型区分度分析,以及模型排名的交叉相关性,确保统计结果的稳健性。通过多层次统计指标,系统区分模型能力层级,发现前六名模型在统计上极为接近,难以区分。模型排名与多语种排行榜相关性中等(Spearman ρ=0.75),表明本土基准具有独特的评估价值。

关键结果

  • 基准能明确区分约12个模型层级,尽管前六名模型在统计上难以排序。最高模型Gemini-Embedding-001在22任务平均得分为0.682,显著优于大部分模型。自有许可证模型已达前沿水平,无需商业API。模型在多语种排行榜上的排名与葡萄牙语表现相关性中等(ρ=0.75),说明本土任务能捕捉特定语言能力。
  • 统计分析显示78.7%的模型对在任务层面上可以被清晰区分,模型间差异多在0.05左右。检索类别表现出最高的区分能力,聚类任务区分较弱。模型能力的细粒度差异在前沿模型中极为微妙,需更复杂任务或指标进行区分。
  • 模型排名的稳健性通过多种统计指标验证,模型间的差异在高层级几乎无法用单一指标区分,表明模型能力趋于饱和。基准提供了多角度的模型能力评估,为未来模型优化提供参考。

研究意义

本研究填补了葡萄牙语本土文本嵌入评估的空白,为研究者和开发者提供了科学、系统的模型选择依据。通过引入严格的统计检验,增强了模型性能比较的可信度,推动了低资源语言模型的研究进展。该基准的建立有助于推动葡语NLP技术的本土化发展,减少对翻译数据的依赖,提升模型在真实场景中的表现能力。它还揭示了模型在多任务、多领域中的能力差异,为未来多模态、多任务模型的设计提供了理论基础。

技术贡献

本研究创新性地构建了纯葡萄牙语任务集,排除所有翻译数据,确保评估的本土真实性。引入多层次统计分析工具,包括自举置信区间、配对显著性检验、项目反应理论模型区分度分析,以及模型排名的交叉相关性,极大提升了评估的科学性和可信度。评估涵盖了从开源到商业的多样模型,提供了全面的模型能力画像。该方法突破了传统单一指标的局限,为低资源语言模型的性能评估树立了新标杆。

新颖性

本研究首次系统性地为葡萄牙语构建纯本土任务集,避免翻译噪声,结合多层次统计分析,提供了比以往更为细粒度的模型区分能力。与现有多语种基准相比,强调本土任务的独特性,揭示模型在特定语言环境中的真实能力差异。创新性地引入项目反应理论分析模型区分度,增强了评估的科学性和解释力。

局限性

  • 尽管统计分析提供了模型层级的划分,但前六名模型在统计上极为接近,难以明确排序,存在一定的不确定性。部分任务样本较小,可能影响置信区间的精确性。模型评估未涵盖所有可能的应用场景,如生成任务和多模态任务,未来需扩展。
  • 基准只评估了纯嵌入模型,未考虑端到端的任务性能,不能完全反映模型实际应用能力。模型训练数据的多样性和偏差可能影响评估结果的普适性。未来应结合实际应用场景进行验证。
  • 统计方法虽增强了评估的科学性,但复杂性较高,可能限制非专业用户的理解和应用。未来需开发更易用的工具和指标,推动广泛应用。

未来方向

未来将扩展任务集,涵盖更多实际应用场景如问答、生成等。引入多模态数据,评估模型在多模态任务中的表现。结合模型训练数据分析,探讨模型能力的偏差和提升路径。推动模型在低资源环境中的优化,提升其实际应用价值。加强模型解释性研究,增强模型的可解释性和可信度。最终目标是建立一个全面、科学、可持续的低资源语言模型评估体系。

AI 总览摘要

在全球多语言信息处理的背景下,葡萄牙语作为使用人口超过两亿的主要语言,亟需专属的文本嵌入评估基准。现有的多语种基准如MTEB和MMTEB虽覆盖葡萄牙语,但多依赖翻译数据或覆盖有限,难以真实反映本土模型能力。为此,本文提出了MTEB-BR——一个纯粹源自巴西葡萄牙语的任务集,涵盖22个任务,分布于分类、相似度、聚类、检索等七大类别,确保评估的本土真实性。该基准筛选了93个模型,从开源到商业API,参数规模从2千万到270亿,提供了丰富的模型能力画像。采用多层次统计分析方法,包括引入自举置信区间、配对显著性检验、项目反应理论的模型区分度分析,以及模型排名的交叉相关性,确保结果的科学性和可信度。结果显示,基准能有效区分模型能力层级,约12个模型层级被明确划分,前六名模型在统计上极为接近,难以排序。最高模型Gemini-Embedding-001在22任务上的平均得分为0.682,显著优于大部分模型。值得注意的是,模型在多语种排行榜上的排名与本土表现相关性中等(ρ=0.75),表明本土基准能捕捉到模型在葡萄牙语环境中的真实能力差异。该研究不仅为葡萄牙语NLP提供了科学评估工具,也为低资源语言模型的研究提供了新的思路和方法。未来,研究将扩展任务集,涵盖更多实际应用场景,推动模型在低资源环境中的优化,促进本土化技术的发展。该基准的建立,有望推动葡萄牙语NLP技术的快速发展,减少对翻译数据的依赖,提升模型在真实场景中的表现能力,为全球多语言AI生态系统贡献力量。

深度分析

研究背景

近年来,文本嵌入技术在自然语言处理领域取得了显著发展,代表性工作包括BERT、RoBERTa、Sentence-BERT等模型。这些模型在多任务、多语种环境中表现优异,但对低资源语言如葡萄牙语的支持仍有限。现有的评估体系如MTEB和MMTEB虽涵盖部分葡语任务,但多依赖翻译数据或样本有限,难以真实反映模型在本土语境中的能力。特别是在检索、聚类和语义相似度任务中,缺乏专门针对葡语的纯本土任务集,导致模型性能评估存在偏差和盲区。随着低资源语言模型的崛起,建立专属的本土评估基准成为亟需解决的问题,以推动技术的本土化应用和提升模型的实际表现。

核心问题

当前葡萄牙语文本嵌入评估缺乏纯本土任务集,导致模型性能难以在真实语境中得到准确衡量。多依赖翻译数据引入噪声,掩盖模型在本土语料中的潜在优势或不足。此外,缺乏系统的统计分析工具,难以区分模型能力的细微差别。这些问题限制了模型的优化方向,也影响了实际应用的推广。解决方案需要构建专门的本土任务集,采用科学的统计方法,确保评估的可靠性和区分度,从而推动低资源语言模型的研究和应用。

核心创新

本研究的创新点在于:1)构建纯葡萄牙语任务集,排除翻译噪声,确保评估的真实性;2)引入多层次统计分析,包括自举置信区间、配对显著性检验和项目反应理论,增强评估的科学性;3)评估范围涵盖93个模型,兼容开源和商业API,提供全面的模型能力画像;4)通过多角度统计指标,系统区分模型能力层级,揭示模型在本土环境中的表现差异。这些创新极大提升了低资源语言模型的评估体系,为未来研究提供了新范式。

方法详解

  • �� 任务选择:筛选纯葡萄牙语源数据,涵盖分类、相似度、聚类、检索等类别,排除翻译数据。• 数据集构建:从公开资源和本土数据中采集22个任务,确保多样性和代表性。• 模型评估:涵盖73个开源模型和20个商业API,参数规模从2千万到270亿。• 统计分析:引入自举置信区间、配对显著性检验、项目反应理论模型区分度分析,以及模型排名的交叉相关性。• 结果呈现:提供每个任务的得分、置信区间、显著性检验、模型能力层级和模型排名的多角度分析。• 代码和数据:全部开源,确保可复现性和透明度。

实验设计

采用22个纯葡萄牙语任务,评估模型在分类、相似度、聚类、检索等任务中的表现。每个任务使用对应的指标,如准确率、余弦相似度、V-measure、nDCG@10和MAP。模型参数和架构多样,从开源小模型到大型商业API。通过多次抽样和统计分析,确保结果的稳健性。对模型间的差异进行显著性检验,识别能力层级,验证模型排名的可靠性。还分析了模型在不同任务类别中的表现差异,揭示模型在本土语境中的优势和不足。

结果分析

基准能有效区分约12个模型层级,最高模型在22任务上的平均得分为0.682,显著优于其他模型。模型间差异在统计上显著,78.7%的模型对可以被清晰区分。前六名模型在统计上极为接近,难以排序,但整体排名稳健。检索任务表现出最高的区分能力,聚类任务区分较弱。模型排名与多语种排行榜相关性中等(ρ=0.75),表明本土任务能捕捉模型在葡语环境中的真实能力。

应用场景

该基准适用于模型开发者筛选适合葡萄牙语的文本嵌入模型,提升搜索、分类、问答等应用的性能。企业可以借助此基准优化模型,减少对翻译数据的依赖,增强模型在本土场景中的适应性。未来,结合多模态和生成任务,将推动葡语NLP技术的全面提升,促进本土产业数字化转型。

局限与展望

模型排序在前六名极为接近,存在一定的不确定性。样本规模有限,部分任务数据较少,影响置信区间的精确性。未涵盖生成任务和多模态任务,未来需扩展。评估只针对嵌入模型,未反映端到端任务性能。统计方法复杂,可能限制非专业用户的理解和应用。未来应简化指标体系,丰富任务类型,提升实用性。

通俗解读 非专业人士也能看懂

想象你在一个工厂里,工厂每天都要生产不同的产品。有些产品是用不同的材料做的,有些是用不同的机器制造的。为了保证每个产品都符合标准,你需要一个检测系统,能快速判断每个产品的质量。现在,研究人员就像在设计这样一个检测系统,他们用很多不同的测试(任务)来检查这些“产品”——也就是模型的能力。每个测试都像是检查产品的某个方面,比如外观、耐用性或功能性。通过这些测试,他们可以知道哪个模型更靠谱,哪个还需要改进。这个基准就像是工厂的质量检测标准,帮助大家公平比较不同的模型,找到最适合用在葡萄牙语场景的“优质产品”。

简单解释 像给14岁少年讲一样

想象你在学校里参加一个考试,老师用很多不同的题目来测试你的能力。有些题是关于数学,有些是关于语文,还有一些是关于科学。每个题目都代表你在某个方面的表现。现在,假设你有很多朋友也参加了这个考试,有的朋友擅长数学,有的擅长语文。老师想知道谁的水平最高,但每个人的强项不同。于是,老师设计了一套特别的评分系统,既看每个题目的表现,也考虑每个人的整体能力。这个系统会用一些数学方法,确保每个题目的难度都被公平对待,最后得出每个人的排名。这个研究就像是用这样的方法,来衡量不同的模型在理解葡萄牙语方面的能力,确保评估公平、科学,帮助开发出更聪明、更贴近真实使用场景的模型。

原文摘要

Text embeddings for Portuguese have no dedicated benchmark: evaluation rests on translated corpora such as English MS MARCO or on thin multilingual coverage, with native tasks scattered and unconsolidated. We introduce MTEB-BR, a benchmark of 22 native Brazilian-Portuguese tasks across seven categories (classification, multilabel classification, pair classification, semantic textual similarity, clustering, retrieval, and reranking), admitting only data created or found in Portuguese and excluding translations by construction. We evaluate 93 models spanning 23M to 27B parameters: 73 open-weight and 20 closed commercial APIs. Alongside the leaderboard we report a statistical layer for every headline comparison: per-task bootstrap confidence intervals, paired-bootstrap significance, a task- and instance-level discrimination analysis (how sharply each task separates models) adapted from Item Response Theory, and a cross-leaderboard correlation. Three findings stand out. The benchmark cleanly separates about a dozen tiers of models, though the top six are statistically too close to order. An openly licensed, self-hostable model reaches that leading tier, so strong Portuguese embedding quality does not require a commercial API. And a model's rank on the global multilingual leaderboard predicts its Portuguese rank only moderately (Spearman rho = 0.75 over 55 shared models; one model ranks 3rd there and 49th here), so a native benchmark measures something the multilingual boards do not. We release every task, our code, and a public leaderboard, so practitioners can choose Portuguese embedding models on native evidence.

cs.CL cs.IR cs.LG