Evaluation of LLMs in Medical Text Summarization: The Role of Vocabulary Adaptation in High OOV Settings

TL;DR

本研究评估LLMs在医学文本摘要中的表现,强调词汇适应对高OOV场景的提升。

cs.CL 🔴 高级 2025-05-27 49 次浏览
Gunjan Balde Soumyadeep Roy Mainack Mondal Niloy Ganguly
自然语言处理 医学AI 词汇适应 大模型评估 高OOV场景

核心发现

方法论

采用多策略词汇扩展结合持续预训练,评估Llama-2、Llama-3.1等模型在高OOV和新颖性场景下的医学摘要性能。通过构建候选词表、筛选重要词汇、训练嵌入,结合多数据集(BioASQ、EBM、PubMedQA)进行细粒度评估。采用Rouge-L和UMLS概念重叠指标,分析词汇适应策略对模型性能的影响。还引入人类医学专家评估,验证摘要的相关性和忠实度。

关键结果

  • 词汇适应策略在7/8高OOV和高新颖性场景中优于基线模型,平均提升约14-19%的Rouge-L分数。特别是ScafFix方法在高OOV场景表现突出,提升幅度达8.74%-14.64%。在医学术语高碎片化情况下,词汇扩展显著改善模型对专业词汇的理解和生成能力。
  • 持续预训练(CPT-Only)在部分场景优于未适应模型,表明领域微调有助缓解OOV问题。多策略结合(如MEDVOC-LLM和ScafFix)在多数据集上均表现出优越的性能,验证了词汇适应的有效性。
  • 人类专家评价显示,词汇适应显著提升摘要的相关性和忠实度,模型生成的内容更贴合医学专业知识,增强了临床应用的潜力。

研究意义

该研究系统性验证了词汇适应在专业领域中提升LLMs性能的关键作用,为医学AI模型的定制化提供理论基础和实践指南。解决了模型在专业词汇碎片化和OOV词频高时的性能瓶颈,推动了AI在高风险医学场景中的应用落地。通过细粒度评估和人类验证,强化了模型可信度,为未来医学文本自动化提供技术支撑。

技术贡献

提出结合候选词表生成、筛选和持续预训练的多策略词汇适应框架,系统性分析不同策略的效果。引入MEDVOC-LLM和ScafFix两种创新方法,优化词汇扩展流程,减少碎片化问题。采用LoRA技术实现高效微调,显著降低训练成本。实验证明新策略在高OOV和高新颖性场景中优于传统微调和纯模型微调,推动了领域适应技术的发展。

新颖性

首次系统性比较多种词汇适应策略在医学文本摘要中的效果,特别是在高OOV和新颖性场景下。引入ScafFix方法,直接基于医学词频筛选词汇,避免过度碎片化。结合持续预训练和参数高效微调,提出多层次适应框架,显著优于现有单一策略,填补了专业领域模型微调的研究空白。

局限性

  • 模型在极端OOV词汇或极高新颖性场景下仍存在性能瓶颈,尤其是在少样本或偏少数据的情况下表现不佳。
  • 词汇扩展依赖于高质量的候选词表生成,若词表不完整或偏差,可能影响模型效果。
  • 当前实验主要集中在英文医学文本,跨语言和多模态场景的适应性仍待验证。

未来方向

未来将探索多模态医学数据的词汇适应,结合图像和结构化信息提升模型理解能力。同时,研究更智能的候选词筛选机制,结合主动学习优化词汇扩展策略。还计划扩展到多语言医学场景,提升模型的普适性和鲁棒性,为临床决策提供更可靠的AI支持。

AI 总览摘要

本研究系统性评估了大型语言模型(LLMs)在医学文本摘要任务中的表现,特别关注高OOV(词汇超出词表)和高新颖性场景下的挑战。随着模型规模的不断扩大,词汇碎片化问题日益突出,影响模型对专业医学词汇的理解与生成。为解决这一难题,研究提出了多策略词汇适应框架,包括候选词表生成、筛选和持续预训练,结合MEDVOC和ScafFix两种创新方法,有效缓解了词汇碎片化和OOV问题。通过在BioASQ、EBM和PubMedQA等多个医学数据集上的细粒度评估,结果显示词汇适应策略在大部分高OOV和高新颖性场景中优于传统微调和未适应模型,平均提升Rouge-L分数达14%以上。人类医学专家的评估进一步验证了模型摘要的相关性和忠实度提升,增强了模型在临床应用中的可信度。该研究不仅丰富了专业领域模型微调的理论体系,也为未来医学AI的定制化提供了实用技术路线。未来工作将聚焦多模态数据融合、跨语言适应及主动学习优化,推动医学AI在临床实践中的广泛应用。

深度分析

研究背景

随着自然语言处理技术的发展,预训练语言模型(如BERT、GPT系列)在多领域取得突破,尤其在文本摘要、问答等任务中表现优异。近年来,LLMs如Llama、GPT-4在医学文本处理中的潜力逐渐显现,但其在专业词汇丰富、碎片化严重的医学领域面临巨大挑战。医学文本中大量专业术语、缩写和新词,导致模型在编码和生成过程中出现高OOV率,影响摘要质量。已有研究多关注通用场景,针对医学领域的微调和词汇扩展虽有所尝试,但在高OOV和新颖性场景中的系统性评估不足,限制了模型的临床应用潜力。本研究旨在填补这一空白,通过多策略词汇适应,提升LLMs在医学文本摘要中的表现,为临床信息提取和决策支持提供技术保障。

核心问题

医学文本中专业词汇丰富且不断演化,导致预训练模型在处理时面临高OOV问题。现有模型在编码医学术语时碎片化严重,影响理解和生成质量。特别是在高新颖性和高OOV场景下,模型表现显著下降,限制其临床应用。如何有效扩展词汇表、缓解碎片化、提升模型对专业词汇的理解,成为亟待解决的核心问题。这不仅关系到模型的准确性,也影响其在实际医疗场景中的可信度和实用性。

核心创新

本研究提出结合候选词表生成、筛选和持续预训练的多策略词汇适应框架,创新点在于:1)引入ScafFix方法,直接基于医学词频筛选词汇,避免碎片化;2)结合MEDVOC策略,优化词汇扩展流程;3)采用LoRA实现高效微调,降低计算成本。该框架系统性解决了词汇碎片化和OOV问题,显著提升模型在高OOV和新颖性场景中的表现。创新点还在于:引入人类专家评估验证模型输出的临床相关性,确保技术的实用性。

方法详解

  • �� 构建候选词表:从PubMed Abstract Collection(PAC)和目标任务数据中提取医学高OOV词汇。
  • �� 词汇筛选:利用碎片分数和词频筛选重要词汇,避免无关或低频词加入。
  • �� 词汇扩展:将筛选出的词汇加入模型词表,采用MEDVOC和ScafFix两种策略。
  • �� 嵌入训练:通过持续预训练(End-to-End或两阶段)在目标医学文本上微调模型嵌入,使用LoRA技术实现参数高效调整。
  • �� 评估:在三个医学摘要数据集上,采用Rouge-L和UMLS概念重叠指标,分析不同策略的性能差异。

实验设计

实验采用BioASQ、EBM和PubMedQA三大医学摘要数据集,评估模型在高OOV和高新颖性场景下的性能。比较基线模型(未适应)、持续预训练(CPT-Only)和多策略词汇适应模型(MEDVOC-LLM、ScafFix)。采用Rouge-L和Concept-Score指标,分析不同策略对摘要质量和忠实度的影响。通过多次微调和 ablation 实验,验证词汇扩展和预训练的有效性。设置不同OOV和新颖性阈值,确保评估的细粒度和全面性。

结果分析

多策略词汇适应在7/8高OOV和新颖性场景中优于基线,平均提升14%以上。ScafFix在高OOV场景表现尤为突出,提升幅度达8.74%-14.64%。持续预训练(CPT-Only)在部分场景优于未适应模型,验证微调的有效性。人类专家评价显示,词汇适应显著提升摘要的相关性和忠实度,模型生成内容更贴合医学专业知识。这些结果表明,词汇适应是提升医学文本摘要性能的关键技术。

应用场景

该技术可应用于临床信息提取、医学知识库构建和自动化文献总结等场景。模型经过词汇适应后,能更准确理解专业术语,提升信息提取效率。未来可结合电子健康记录和多模态数据,推动个性化医疗和智能决策支持系统的发展。

局限与展望

当前方法依赖高质量的医学词汇表,若词表不完整或偏差,可能影响效果。模型在极端OOV或极高新颖性场景下仍存在性能瓶颈。此外,实验主要集中在英文医学文本,跨语言和多模态场景的适应性有待验证。未来需优化词汇筛选机制,降低计算成本,增强模型的普适性和鲁棒性。

通俗解读 非专业人士也能看懂

想象你在一家大型工厂工作,工厂里有很多不同的机器和零件。每个机器都需要特定的零件才能正常工作,但有些新零件还没有被工厂的仓库登记,工人们不知道它们的名字或用途。当你需要用这些新零件修理机器时,如果仓库没有提前准备好对应的零件名,工人就会很困扰,修理也会变得很慢。这就像模型遇到医学专业词汇一样,很多专业词汇没有被模型的词表包含,导致模型无法准确理解和生成相关内容。研究中提出的方法就像提前把这些新零件的名字加入仓库,或者用更聪明的办法直接找到这些零件,从而让工厂的维修变得更快更准。这样,模型在处理医学文本时也能更好地理解专业词汇,生成更准确的摘要,帮助医生更快做出诊断。

简单解释 像给14岁少年讲一样

想象你在学校里学习新知识,有时候老师会讲一些你以前没听过的词,比如某个新运动的名字或一个复杂的科学名词。刚开始你可能听不懂,也不知道怎么写,感觉很难理解老师讲的内容。这就像模型遇到医学里的新词一样,它的词表里没有这些专业词汇,所以它会把这些词拆成很多小部分,变得很难理解。研究团队发现,如果提前把这些新词加入到模型的词库里,或者用聪明的方法直接找到这些新词,模型就能更好地理解和生成医学摘要,就像你学会了新词后,理解老师讲的内容就变得更容易了。这项工作就像给模型装上了“新词包”,让它在医学领域的表现更棒,也能帮医生更快找到重要信息。

原文摘要

Large Language Models (LLMs) recently achieved great success in medical text summarization by simply using in-context learning. However, these recent efforts do not perform fine-grained evaluations under difficult settings where LLMs might fail. They typically report performance scores over the entire dataset. Through our benchmarking study, we show that LLMs show a significant performance drop for data points with high concentration of out-of-vocabulary (OOV) words or with high novelty. Vocabulary adaptation is an intuitive solution to this vocabulary mismatch issue where the LLM vocabulary gets updated with certain expert domain (here, medical) words or subwords. An interesting finding from our study is that Llama-3.1, even with a vocabulary size of around 128K tokens, still faces over-fragmentation issue with medical words. To that end, we show vocabulary adaptation helps improve the LLM summarization performance even in difficult settings. Through extensive experimentation of multiple vocabulary adaptation strategies, two continual pretraining strategies, and three benchmark medical summarization datasets, we gain valuable insights into the role of vocabulary adaptation strategies for customizing LLMs to the medical domain. We also performed a human evaluation study with medical experts where they found that vocabulary adaptation results in more relevant and faithful summaries. Our codebase is made publicly available at https://github.com/gb-kgp/LLM-MedicalSummarization-Benchmark.

cs.CL