Improving Argument Saliency Coverage in Small LLMs for Long Legal Opinion Summarization via Sequence-Level Distillation

TL;DR

Qwen3-14B序列级蒸馏以ARCscore显著提升小模型法律论证覆盖率。

cs.CL 🟡 进阶级 2026-08-31 20 次浏览
Mohamed Elaraby Ahmed Elhady Diane Litman
序列级蒸馏 长文摘要 法律NLP 论证覆盖率 小型LLM

核心发现

方法论

论文采用Kim与Rush提出的sequence-level knowledge distillation,将长上下文教师模型生成的摘要或推理轨迹作为SFT目标。给定法律意见L与提示P,教师生成(τ,S),学生按交叉熵损失−(1/|G|)Σlog Pm(gt|g<t,P,L)训练;比较summary-only、reasoning-only及reasoning+summary三种目标。

关键结果

  • 在CANLII的1,049篇专家标注测试意见上,Qwen3-14B教师的摘要蒸馏ARCscore为0.621、0.717、0.744、0.781,分别对应0.6B、1.7B、4B、8B学生,均显著优于零样本基线0.408、0.522、0.631、0.658。
  • 教师选择影响明显:GPT-5-mini教师对应学生得分为0.553、0.652、0.712、0.741;尽管两教师独立ARCscore近似(0.742±0.166与0.738±0.172),Qwen教师更适配Qwen学生。
  • 主要改善来自减少遗漏错误:0.6B学生的ME由55.87%降至31.31%,但FE由10.20%升至12.22%;8B模型ME由30.01%降至17.40%,FE亦由11.86%降至9.05%。

研究意义

研究回应了长法律意见中“重要论点稀疏且分散”的核心难题。它表明,少量无标注领域文本加上强教师即可迁移论证选择能力,降低昂贵专家摘要标注的需求。对法律检索、案件理解和辅助研究而言,覆盖率提升比单纯流畅度更接近实际价值;但系统仍不能替代律师判断。

技术贡献

技术上,论文把序列级蒸馏从新闻摘要扩展到长法律意见,并以ARCscore及其FE/ME诊断直接测量论证覆盖。实验统一使用Qwen3学生族,比较教师摘要、原生推理轨迹和二者联合监督;结果显示摘要序列已包含主要选择信号。约10篇训练文档即可获得大部分增益,体现出强数据效率。

新颖性

新颖性不在于重新提出SFT或蒸馏,而在于将其针对性用于法律论证显著性覆盖,并系统考察教师类型、学生规模、推理监督和样本规模。相较TriSum等结构化理由方法,本文发现额外推理链在已有摘要监督后收益仅为+0.001至+0.011。

局限性

  • 结论仅来自CANLII、ARCscore和Qwen3学生,未验证其他法域、法律子领域、模型族或评价指标。
  • 实验依赖无标注的同领域法律意见、LoRA而非全参数微调;教师偏差可能被继承,且ARCscore将原子事实视为同等重要。

未来方向

作者建议探索对比学习、偏好优化和更强训练目标;将ARCscore中的人工原子事实改为LLM抽取;进行跨数据集与跨模型验证,并采用先蒸馏教师分布、再适配专家数据的课程学习策略。

AI 总览摘要

长法律意见往往包含数千词,真正决定案件理解的Issues、Reasons和Conclusions却分散其中。小型LLM容易生成流畅摘要,却遗漏关键论证。传统专家摘要微调成本高,Chain-of-Arguments提示也未必能稳定解决选择问题。

作者在CANLII数据集上采用sequence-level knowledge distillation。GPT-5-mini或Qwen3-14B先为1,000篇无标注意见生成约250词摘要;随后以这些序列训练0.6B至8B的Qwen3学生。ARCscore显示,Qwen教师蒸馏将四种学生的得分提升至0.621、0.717、0.744和0.781,超过零样本的0.408、0.522、0.631和0.658,也超过专家摘要调优与CoA基线。

提升主要来自减少遗漏:0.6B模型ME从55.87%降至31.31%,8B模型从30.01%降至17.40%。约10篇训练文档已带来显著收益,100篇后趋于饱和。推理链单独蒸馏与摘要蒸馏相当,联合训练仅边际增益。研究说明,教师摘要本身已压缩了最有价值的论证选择信息;不过结论仍受单一数据集、指标和模型族限制,系统也不应被用于自主法律决策。

深度分析

研究背景

法律摘要研究已从通用流畅度转向faithfulness与argument coverage。ArgLegalSumm、论证感知重排序和ARCscore分别处理论证识别、生成选择与评估;但长意见中的重要内容跨越数千token,小模型尤其容易遗漏。新闻领域的CNN/DailyMail、XSum及结构化规划方法不能直接代表高风险法律场景。

核心问题

目标不是简单缩短文本,而是覆盖专家标注的Issue、Reason、Conclusion等关键论证,同时避免矛盾。难点包括长上下文中的稀疏信息选择、专家标注昂贵、模型规模受部署成本约束,以及“覆盖提升”与“事实错误”可能相互牵制。

核心创新

  • �� 将sequence-level distillation用于长法律意见的论证显著性覆盖。
  • �� 以Qwen3-14B和GPT-5-mini生成监督,比较教师质量与学生分布匹配。
  • �� 分离摘要、推理轨迹及联合监督,验证推理链是否必要。
  • �� 系统测试10、100、1,000篇样本,展示教师监督的数据效率。

方法详解

  • �� 输入:提示P、法律意见L,截断训练输入至4,096 token。
  • �� 教师:温度0.7、nucleus sampling p=0.95,生成约250词摘要;Qwen3-14B额外提供原生思考轨迹τ。
  • �� 目标:SFT对目标G计算交叉熵;G分别为S、τ或τ⊕S。
  • �� 学生:Qwen3-0.6B、1.7B、4B、8B,采用LoRA微调,并测试thinking与no-thinking推理。
  • �� 评估:ARCscore用LLM原子验证器测量被摘要支持的专家论证比例,并区分FE与ME。

实验设计

数据来自CANLII:约28,000篇意见—摘要对,其中1,049篇有句子级IRC标注并作为测试集;另采样1,000篇无标注意见训练。比较零样本B、专家摘要调优E、Chain-of-Arguments以及三种蒸馏设置。教师独立ARCscore为GPT-5-mini 0.742±0.166、Qwen3-14B 0.738±0.172。

结果分析

Qwen教师摘要蒸馏在0.6B至8B上达到0.621至0.781,稳定超过B、E和CoA。GPT教师也有效,但最高为0.741。ME是主要瓶颈,且在所有规模下降;FE仅在4B以上明显下降。10篇样本即可显著改善,100篇后收益递减,第二随机种子差异不超过0.031 ARCscore。

应用场景

可用于法律研究平台的案件预览、判决要点提取、律师检索辅助和内部知识库构建。部署前需进行法域适配、事实核验和人工复审;教师生成数据不需要逐篇专家摘要,但仍应审计偏差、隐私与错误传播。

局限与展望

研究只覆盖CANLII、ARCscore和Qwen3,不能保证跨法域泛化。LoRA和标准SFT可能低估更强优化目标的潜力;推理链可能包含冗余或不可迁移过程。ARCscore将原子事实等权处理,也未全面评估流畅度、事实性和真实法律使用风险。

通俗解读 非专业人士也能看懂

把一份长法律意见想成一座堆满文件的仓库。读者真正需要的不是把每张纸都搬出来,而是找到“问题是什么、为什么这样判断、最后决定是什么”三类关键箱子。小模型像经验不足的仓库管理员,常常拿出看似整齐的箱子,却漏掉最重要的那几个。

论文让一位强大的教师先示范如何挑箱子,再让小模型模仿最终挑选结果,而不是要求专家逐篇手把手标记。这个过程叫序列级蒸馏:教师直接交付一份约250词的成品摘要,学生学习“哪些内容值得留下”。结果显示,Qwen3-14B教师尤其适合训练Qwen小模型;只看约10份示范,就能明显进步。

最重要的变化是少漏信息。0.6B模型的遗漏错误从55.87%降到31.31%,但小模型仍可能把内容说错。因此,这像是训练出更会找重点的助理,而不是制造一位可以独立签署法律意见的律师。

简单解释 像给14岁少年讲一样

想象你要把一部超长侦探小说讲给朋友听。故事里有很多细节,但朋友最想知道:案件问题是什么?侦探为什么这样推理?最后结论是什么?小型语言模型有时很会写句子,却像只记住了配角的衣服,忘了真正的线索。

这篇论文的方法很像“学霸示范”。先让更强的模型读完法律意见,写出大约250词的重点摘要;再让小模型读同样的原文和示范答案,练习复制这种取舍。研究者没有额外请专家重新标记每篇文章,所以省钱又省时间。

在CANLII测试中,Qwen3-14B教师让0.6B学生的ARCscore从0.408提高到0.621,8B学生从0.658提高到0.781。更酷的是,大约10篇训练材料就能看到大部分效果!研究还发现,单独学习最终摘要已经够用,学习老师的思考过程并没有带来很多额外提升。

不过,这不是“法律自动驾驶”。模型可能漏掉重要事实,也可能说出不准确的话。就像游戏里的优秀提示器,它能帮你快速找到线索,却不能替你作出最终决定。

术语表

Sequence-level knowledge distillation(序列级知识蒸馏)

让小模型直接学习大模型生成的完整文本序列,而非仅模仿逐词概率。它把教师的内容选择和表达行为压缩到学生中。

本文用教师摘要或推理轨迹作为SFT目标。

ARCscore(论证表示与覆盖评分)

利用LLM原子验证器判断摘要支持了多少专家论证。它同时区分遗漏错误ME与事实错误FE。

论文的主要评价指标。

IRC scheme(论证角色体系)

将法律论证标为Issues、Reasons和Conclusions。该体系帮助评估摘要是否覆盖案件问题、理由和结论。

CANLII测试集的句子级标注。

Missing Error(遗漏错误)

摘要没有包含应覆盖的重要论证。它不同于与原文矛盾的Factual Error。

蒸馏收益主要体现在ME下降。

LoRA

一种参数高效微调方法,只训练低秩增量参数而冻结基础模型。它降低显存与训练成本。

所有学生实验均采用LoRA。

开放问题 这项研究留下的未解疑问

  • 1 方法能否迁移到美国最高法院意见、其他法域或非法律长文,论文尚未回答;需要跨数据集、跨模型和跨指标复现实验。
  • 2 ARCscore把所有原子事实等权处理,无法表达不同论点的重要性;未来需要专家反馈学习显著性权重。
  • 3 教师分布匹配可能比教师独立质量更重要,但其因果机制仍不清楚,需要控制模型架构、提示和数据分布。

应用场景

近期应用

法律案件预览

法律信息平台可用无标注本地判决生成教师摘要,再训练小型Qwen模型进行快速案件概览。上线前需人工抽查论证覆盖、事实错误和法域适配。

律师检索辅助

事务所可将内部意见蒸馏为低成本摘要器,用于定位Issues、Reasons和Conclusions。系统应保留原文引用,并把模型输出定位为检索入口而非法律建议。

远期愿景

可审计的法律摘要基础设施

未来可结合论证图、事实验证和专家显著性权重,构建能显示“摘要覆盖了哪些论点、遗漏了什么”的审计系统,服务大规模司法知识管理。

原文摘要

We show that sequence-level distillation from a capable long-context teacher model is a simple, annotation-free, and data-efficient strategy for improving argument saliency coverage in long legal opinion summarization, where small LLMs often struggle to retain the most salient argumentative content. Across student model sizes, distillation consistently surpasses tuning on expert-written summaries in our legal-opinion setting. We further demonstrate that most gains are achieved with as few as ~10 training summaries, highlighting the strong data efficiency of teacher-generated supervision. Finally, we find that summary distillation is sufficient for improvements: reasoning-chain distillation remains competitive with summary-only distillation, but provides marginal benefit when combined with summary supervision.

cs.CL