LEMUR: A Corpus for Robust Fine-Tuning of Multilingual Law Embedding Models for Retrieval

TL;DR

LEMUR构建多语法律语料库,利用对比学习微调多语言法律嵌入模型以提升检索性能。

cs.CL 🔴 高级 2026-02-10 47 次浏览
Narges Baba Ahmadi Jan Strich Martin Semmann Chris Biemann
法律信息检索 多语模型 对比学习 法律语料库 多语言嵌入

核心发现

方法论

论文提出LEMUR大规模多语法律语料库,基于24,953份欧盟环境立法PDF,结合PDF到文本的Lexical Content Score(LCS)评估文本保真度。利用对比目标在单语和双语环境下微调三种最先进的多语嵌入模型(如Qwen和E5),实现长文本的语义检索。模型训练采用多负样本对比损失(MNR),构建查询-文档对,利用ChromaDB进行向量索引。通过跨语言和低资源语言的实验验证,微调显著提升Top-k检索准确率,尤其在低资源语言中表现优越,且迁移能力强。

关键结果

  • 微调后,模型在高资源语言(如英语、德语)上的Top-1准确率提升约5-10%,在低资源语言(如马耳他语、拉脱维亚语)中提升幅度更大,达15-20%。以Qwen3-4B为例,Top-1准确率在英语上达96.04%,在拉脱维亚语上达87.50%。跨语言评估显示,微调模型在未见语言中的表现也有明显改善,验证了内容层面的语言无关性增强。
  • 利用对比学习的多正样本策略,有效对齐不同语言的法律内容,增强模型的跨语语义理解能力。实验还表明,模型在长文本检索任务中表现优于传统方法,尤其在多语言环境下,提升了检索的鲁棒性和准确性。
  • 结果显示,微调不仅改善了单语检索性能,还显著增强了跨语迁移能力,验证了模型学习到的法律内容的语言无关特性,为多语法律信息检索提供了新思路。

研究意义

该研究填补了多语法律语料库和跨语检索基准的空白,为欧盟法律信息的多语环境下智能检索提供了基础数据和模型支撑。通过引入高质量的PDF文本转换评估指标(LCS),确保数据的可靠性。模型微调策略显著改善低资源语言的检索性能,推动多语法律AI的普及。研究成果不仅提升了法律检索的效率,也为多语信息处理提供了通用框架,有望在国际法律、政策制定和多语数据管理中发挥重要作用。

技术贡献

论文提出LEMUR语料库,结合PDF到文本的LCS评估,确保数据质量。创新性地采用对比目标在多语环境下微调多种SOTA嵌入模型(Qwen、E5),实现长文本的语义匹配。引入多正样本对比损失(MNR)策略,有效对齐不同语言的法律内容,增强模型的跨语能力。构建基于ChromaDB的向量索引,支持大规模高效检索。实验验证模型在低资源语言中的优越表现,展示了内容层面无关的法律表示学习能力。这些技术突破为多语法律信息检索提供了新工具和新方法。

新颖性

首次构建涵盖25种语言的欧盟环境立法PDF语料库,系统评估PDF文本转换质量(LCS),确保数据可靠性。提出在法律领域应用的多语对比学习微调策略,显著提升低资源语言的检索性能,并验证其跨语迁移能力。不同于传统单语或预训练模型,强调内容层面而非语言特征的模型优化,推动多语法律AI的实用化发展。

局限性

  • 模型在极端长文本或复杂布局的PDF中仍存在信息丢失或误差,尤其在较旧文档中表现不佳。数据依赖高质量PDF转换工具,转换质量受限于OCR和排版复杂度,影响模型效果。微调过程计算成本较高,特别是在多语环境下,模型训练时间和资源消耗较大。此外,模型对特定法律体系和专业术语的适应性仍有限,未来需结合领域知识增强模型理解能力。

未来方向

未来将扩展LEMUR语料库覆盖更多法律领域和多语种,提升数据多样性。探索结合知识图谱和领域知识的模型增强策略,改善专业术语理解。开发端到端的PDF文本提取与检索系统,降低数据预处理难度。研究模型在实时法律咨询和智能问答中的应用潜力,推动多语法律AI的商业化落地。加强模型的可解释性和鲁棒性,确保在实际法律场景中的可靠性。

AI 总览摘要

随着全球化和信息化的发展,法律信息的多语环境检索成为法律科技的重要方向。传统的法律检索系统多依赖结构化文本或单语模型,难以应对多语、多长文本和复杂排版带来的挑战。本文提出LEMUR——一个涵盖25种语言、基于欧盟环境立法PDF的多语法律语料库,结合PDF到文本的质量评估指标(LCS),确保数据的高质量。通过对比学习策略,微调三种最先进的多语嵌入模型(如Qwen和E5),实现长文本的高效语义匹配。实验结果显示,微调显著提升低资源语言的检索准确率,Top-1性能提升达15%以上,跨语迁移能力也得到验证。这一突破不仅改善了多语法律检索的效果,也为未来多语AI在法律、政策等领域的应用奠定基础。研究的创新点在于结合PDF文本质量评估与多语对比学习,解决了多语法律数据的噪声和偏差问题。未来,研究将向更广泛的法律领域扩展,结合知识图谱和端到端系统,推动多语法律AI的实际应用。尽管如此,模型在极端复杂布局和极端长文本中的表现仍有提升空间,未来需持续优化数据处理和模型鲁棒性。总体而言,LEMUR为多语法律信息检索提供了坚实的基础和创新路径,具有重要的学术价值和应用潜力。

深度分析

研究背景

法律信息检索技术经历了从关键词匹配到语义理解的演变。早期方法如TF-IDF和BM25在结构化文本中表现良好,但在多语环境和长文本中效果有限。近年来,深度学习模型如BERT、LegalBERT等推动了法律自然语言处理的发展,特别是在法律实体识别、判例分析等任务中取得突破。然而,现有多语法律语料库多偏重预训练或分类任务,缺乏专门面向语义检索的高质量数据。PDF格式的法律文件广泛使用,但文本提取存在噪声,影响模型性能。此前研究多集中在单语或有限语种,跨语检索仍是难点。本文旨在通过构建多语法律语料库,结合文本质量评估,推动多语法律检索技术的发展。

核心问题

多语法律检索面临数据噪声大、文本结构复杂、跨语能力不足等瓶颈。PDF格式的法律文件在提取时常出现排版错乱、表格丢失等问题,导致训练数据不可靠。现有多语语料库多为预训练数据或分类任务,缺乏针对语义检索的高质量标注。多语模型在低资源语种表现差,迁移能力有限,限制了多语法律AI的实际应用。如何保证数据质量、提升模型跨语能力成为亟待解决的问题。

核心创新

本文创新在于:一是构建涵盖25语种的欧盟环境立法PDF语料库LEMUR,结合LCS指标确保文本质量;二是提出基于对比学习的多语微调策略,利用多正样本增强内容对齐;三是引入长文本检索机制,支持复杂排版的法律文件。不同于传统预训练或单语微调,强调内容层面无关性,提升模型跨语能力。还创新性地利用向量数据库实现大规模高效检索,为多语法律信息系统提供技术支撑。

方法详解

  • �� 数据采集:从EUR-Lex获取24,953份PDF法律文件,涵盖25语种,筛选环境立法。• PDF到文本:采用olmOCR工具,转换为结构化JSONL,评估文本保真度(LCS),确保内容一致性。• 预处理:去除样式、归一化,构建查询(元数据)与目标(正文)对。• 模型微调:基于对比学习(MNR),在单语和双语环境下微调Qwen、E5模型,优化内容匹配。• 构建索引:利用ChromaDB存储向量,实现高效Top-k检索。• 评估:在多语和低资源语种上进行Top-k准确率测试,验证模型性能。

实验设计

采用五种语言(EN、DE、FR、LV、MT)进行单语微调,比较基线与微调模型的Top-k性能。设计双语微调,分析高低资源语种的交互效果。跨语迁移测试检验内容层面无关性。指标包括Acc@1、3、5,使用全数据集和测试集进行评估。模型训练采用对比损失,参数调优在GPU上完成,确保实验可复现。结果显示微调显著提升低资源语种表现,验证模型的泛化能力。

结果分析

微调后,模型在英语上的Top-1准确率达96.04%,拉脱维亚语达87.50%,比预训练模型提升约10-15%。跨语迁移实验中,未见语种的表现也有明显改善,验证内容无关性。多语对比学习策略增强了不同语言间的内容对齐能力,长文本检索效果优于传统方法,验证了模型在复杂法律文本中的适应性。结果表明,微调显著提升多语环境下的检索准确率和鲁棒性。

应用场景

该技术可应用于多语法律数据库的智能检索、法律咨询、政策制定支持等场景。用户只需提供简短元数据,即可检索完整法律文本,极大提升效率。适合国际法律机构、多语法律服务平台,以及跨国公司法律合规部门。未来可结合知识图谱和端到端系统,推动法律AI的商业化和普及。

局限与展望

模型在极端复杂布局或极长文本的PDF中仍存在信息丢失问题。数据依赖高质量PDF转换工具,OCR误差影响效果。训练成本较高,特别是在多语环境下。模型对特定法律体系和专业术语的理解有限,需结合领域知识进行优化。未来需提升模型的可解释性和适应性,解决实际应用中的鲁棒性问题。

通俗解读 非专业人士也能看懂

想象你在一个大工厂里,工厂里有很多不同的机器(代表不同语言的法律文本)。过去,我们用简单的工具(关键词搜索)找到需要的机器,但效率不高,也容易出错。现在,科学家们设计了一种智能机器人(模型),它可以理解每台机器的详细信息(法律内容),还能用不同的语言交流。为了让机器人更聪明,他们给它看了很多工厂的操作手册(法律文件),并教它如何用不同语言找到相应的机器。通过特殊的训练方法(对比学习),机器人学会了不管用什么语言描述,都能准确找到目标机器。这样,无论是英语、德语还是其他语言,机器人都能快速帮你找到需要的机器,大大提高了工厂的效率。这就像是给机器人装上了多语理解的“超级大脑”,让它在多语环境中都能表现出色。

简单解释 像给14岁少年讲一样

想象你在学校图书馆找书,但每本书用不同的语言写成。以前,你只能用关键词搜索,可能找不到最合适的那本。而现在,有个聪明的机器人朋友,它可以理解不同语言的书的内容,还能帮你快速找到你想要的那本书。这个机器人经过特别训练,学会了用不同语言描述同一本书的内容,然后用这些描述找到对应的书。比如,你用英语问,它能用法语、西班牙语甚至马耳他语找到答案。它还知道长长的书可能会有很多章节,能在复杂的排版中找到关键信息。这样,你就不用担心语言不通或找不到书的问题了。这个机器人就像一个多语的超级图书管理员,帮你节省了很多时间,让学习变得更轻松!

原文摘要

Large language models (LLMs) are increasingly used to access legal information. Yet, their deployment in multilingual legal settings is constrained by unreliable retrieval and the lack of domain-adapted, open-embedding models. In particular, existing multilingual legal corpora are not designed for semantic retrieval, and PDF-based legislative sources introduce substantial noise due to imperfect text extraction. To address these challenges, we introduce LEMUR, a large-scale multilingual corpus of EU environmental legislation constructed from 24,953 official EUR-Lex PDF documents covering 25 languages. We quantify the fidelity of PDF-to-text conversion by measuring lexical consistency against authoritative HTML versions using the Lexical Content Score (LCS). Building on LEMUR, we fine-tune three state-of-the-art multilingual embedding models using contrastive objectives in both monolingual and bilingual settings, reflecting realistic legal-retrieval scenarios. Experiments across low- and high-resource languages demonstrate that legal-domain fine-tuning consistently improves Top-k retrieval accuracy relative to strong baselines, with particularly pronounced gains for low-resource languages. Cross-lingual evaluations show that these improvements transfer to unseen languages, indicating that fine-tuning primarily enhances language-independent, content-level legal representations rather than language-specific cues. We publish code\footnote{\href{https://github.com/nargesbh/eur_lex}{GitHub Repository}} and data\footnote{\href{https://huggingface.co/datasets/G4KMU/LEMUR}{Hugging Face Dataset}}.

cs.CL cs.AI cs.IR