Do Small Models Use the Law You Give Them? Context-Injected Fine-Tuning for Legal QA in Bangladesh

TL;DR

研究通过上下文注入微调提升法律问答性能,Qwen3.5模型在0.8B参数下提升显著。

cs.CL 🟡 进阶级 2026-07-26 4 次浏览
Moniruzzaman Mahadi Abrar Mohammed Tanzim Alam Sayma Siddika Monalisa Mir Mohammad Asif Abdullah Swakkhar Shatabda Md Adnan Arefeen
法律问答 微调 上下文注入 双语模型 孟加拉国

核心发现

方法论

研究采用上下文注入微调方法,通过在训练过程中将相关法律文本注入到问答对中,以提高模型在推理时对法律上下文的利用能力。使用Qwen3.5模型在0.8B、2B和4B参数下进行实验。

关键结果

  • 在0.8B参数下,微调后模型在2022年英语FAISS检索条件下从2分提升至34分,显示出显著的性能提升。
  • 2B参数模型在大多数条件下也显示出改进,尽管4B参数模型在英语条件下表现有所下降。
  • 微调显著减少了从孟加拉语漂移到英语的回答比例,从53.2%降至0.7%。

研究意义

该研究展示了在法律问答中,上下文注入微调可以显著提高小型语言模型的性能,特别是在低资源语言如孟加拉语的应用中。这为提高法律信息获取的准确性提供了新的思路。

技术贡献

提出了一种新的微调方法,通过在训练中注入法律文本,提高了模型对上下文的利用能力。与现有方法相比,该方法在小型模型上实现了更高的性能提升。

新颖性

首次在孟加拉国法律问答中应用上下文注入微调,显著提升了小型模型的性能,尤其是在低资源语言环境下。

局限性

  • 4B参数模型在英语条件下未显示出显著提升,可能由于模型复杂性导致。
  • 模型在不同语言条件下表现不一致,尤其是在英语和孟加拉语之间。

未来方向

未来工作可以探索更大规模的数据集和更复杂的模型结构,以进一步提高模型在多语言法律问答中的性能。

AI 总览摘要

在孟加拉国,法律援助的获取对许多人来说仍然是一个挑战。现有的法律问答模型在处理孟加拉语时表现不佳,尤其是小型模型。本文提出了一种新的上下文注入微调方法,通过在训练中注入相关法律文本,提高了模型在推理时对法律上下文的利用能力。

研究使用了Qwen3.5模型,在0.8B、2B和4B参数下进行了实验。结果显示,0.8B参数模型在微调后性能显著提升,尤其是在2022年英语FAISS检索条件下,从2分提升至34分。此外,微调还显著减少了从孟加拉语漂移到英语的回答比例。

尽管4B参数模型在英语条件下未显示出显著提升,但研究结果表明,上下文注入微调在提高小型法律问答模型性能方面具有潜力。未来工作可以探索更大规模的数据集和更复杂的模型结构,以进一步提高模型在多语言法律问答中的性能。

深度分析

研究背景

法律问答系统在孟加拉国的应用面临挑战,尤其是在低资源语言环境下。现有模型在处理孟加拉语时表现不佳,导致法律信息获取的准确性受到影响。

核心问题

小型语言模型在接收到法律条文后仍可能回答错误,尤其是在低资源语言如孟加拉语的环境中。如何提高模型对法律上下文的利用能力是一个关键问题。

核心创新

本文提出的上下文注入微调方法,通过在训练中注入法律文本,提高了模型在推理时对上下文的利用能力。这种方法在小型模型上实现了显著的性能提升。

方法详解

  • �� 使用Qwen3.5模型在0.8B、2B和4B参数下进行实验。
  • �� 在训练过程中将相关法律文本注入到问答对中。
  • �� 评估使用2022和2023年孟加拉国律师协会考试题目。

实验设计

实验使用了从六部孟加拉国法律和三个附表中收集的2165个双语问答记录。评估使用了2022和2023年孟加拉国律师协会考试题目。

结果分析

在0.8B参数下,微调后模型在2022年英语FAISS检索条件下从2分提升至34分。微调还显著减少了从孟加拉语漂移到英语的回答比例。

应用场景

该方法可用于提高法律问答系统在低资源语言环境下的性能,帮助更多人获取准确的法律信息。

局限与展望

4B参数模型在英语条件下未显示出显著提升,可能由于模型复杂性导致。未来工作可以探索更大规模的数据集和更复杂的模型结构。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你有一个食谱(法律文本),但有时你会忘记它的细节。上下文注入微调就像是在你的食谱旁边放了一张便条,上面写着关键步骤。这样,即使你忘记了某些细节,你也可以通过查看便条来确保你做得正确。这种方法帮助模型更好地利用法律文本,就像便条帮助你更好地做饭一样。

简单解释 像给14岁少年讲一样

想象一下你在玩一个需要回答问题的游戏。你有一张提示卡,上面写着一些重要的信息。上下文注入微调就像是让你在游戏中使用这张提示卡,帮助你更好地回答问题。这样,即使问题很难,你也可以通过提示卡找到正确答案。这种方法让模型在回答法律问题时更聪明,就像你在游戏中更有优势一样!

术语表

上下文注入 (Context Injection)

在训练过程中将相关信息注入到模型中,以提高模型在推理时对上下文的利用能力。

在法律问答中,通过注入法律文本提高模型性能。

微调 (Fine-Tuning)

在预训练模型的基础上进行特定任务的训练,以提高模型在该任务上的表现。

对Qwen3.5模型进行微调以提高法律问答性能。

Qwen3.5

一种小型语言模型,具有不同参数规模(0.8B、2B、4B)。

用于孟加拉国法律问答的实验。

FAISS

一种用于高效相似性搜索的库,常用于信息检索。

在实验中用于检索相关法律文本。

BM25

一种常用的信息检索算法,用于计算文档与查询的相关性。

在实验中用于检索相关法律文本。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模的数据集上验证上下文注入微调的有效性?
  • 2 是否可以在其他低资源语言环境中应用该方法?

应用场景

近期应用

法律咨询

帮助法律从业者在低资源语言环境下快速获取准确的法律信息。

远期愿景

全球法律问答系统

开发一个多语言法律问答系统,帮助全球用户获取法律信息。

原文摘要

A small language model can receive the governing statutory provision and still answer incorrectly. We test whether fine-tuning on examples containing relevant law improves later use of retrieved law. We curate 2{,}165 bilingual QA records from six Bangladeshi acts and three schedules, then fine-tune Qwen3.5 at 0.8B, 2B, and 4B. Evaluation uses the 2022 and 2023 Bangladesh Bar Council exams in Bangla and machine-translated English, with no retrieval, BM25, or FAISS, scored by strict consistency over three seeded runs. At 0.8B, fine-tuning raises the 2022 English FAISS score from 2 to 34 of 100. Gains at 0.8B and 2B survive paired testing, but the 4B model has no detectable net gain: Bangla improves while several English conditions regress. Fine-tuning also reduces answers that drift from Bangla into mostly English from 44.0--53.2\% to 0.2--0.7\%, with adjusted $p<.001$ at every scale. Retrieval quality is therefore not the only bottleneck. Small bilingual legal models also differ in how they use supplied law and whether they answer in the requested language. The dataset is publicly available at https://huggingface.co/datasets/momahadi/bangladesh-legal-qa-dataset.

cs.CL cs.AI