SynthEHR-Eviction: Enhancing Eviction SDoH Detection with LLM-Augmented Synthetic EHR Data

TL;DR

SynthEHR-Eviction通过LLM增强合成数据,提升SDoH中驱逐状态检测,F1达88.8%。

cs.CL 🔴 高级 2025-07-10 56 次浏览
Zonghai Yao Youxia Zhao Avijit Mitra David A. Levy Emily Druhl Jack Tsai Hong Yu
自然语言处理 社会决定因素 电子健康记录 大模型 信息抽取

核心发现

方法论

该研究提出基于大语言模型(如Qwen2.5、LLaMA3)的合成数据增强与自动提示优化(APO)结合人机交互的管道,利用DSPy框架实现链式推理与细粒度标注。通过多轮迭代生成与验证,显著降低人工标注成本(超80%),构建了包含14个细粒度类别的最大公开驱逐相关SDoH数据集。模型微调后,Qwen2.5-7B在验证集上F1达88.8%,优于GPT-4o-APO(87.8%)和BioBERT(60.7%),实现多模型规模部署的成本效益。

关键结果

  • 在二分类任务中,GPT-4o-APO表现最佳,F1达94.1%;微调模型如Qwen2.5-7B在多类别任务中也表现优异,平均Macro-F1达88.8%。
  • 多类别细粒度分类中,APO显著提升GPT-4o-mini(Macro-F1从69.1%升至78.1%),微调模型在不同数据集间表现稳定,Qwen2.5-7B平均Macro-F1达90%。
  • 模型对不同驱逐类别(如‘驱逐中’、‘历史’、‘待定’)的识别差异明显,最高达96%的F1,验证了类别细粒度检测的可行性。

研究意义

该方法突破了驱逐社会风险因素在临床记录中的稀疏问题,为个性化医疗、公共卫生干预提供高质量、可扩展的社会决定因素数据。通过低成本自动化标注,推动SDoH在电子健康记录中的系统集成,有助于缓解社会不平等,改善边缘化群体的健康结果。此技术还可推广至其他社会风险类别,具有广泛应用潜力。

技术贡献

创新点在于结合大模型合成数据、自动提示优化与人机交互,提出模块化信息抽取管道。引入DSPy链式推理机制,提升细粒度类别识别能力。模型微调策略兼容多模型规模,显著降低标注成本,增强泛化能力。该方案在驱逐社会风险识别中实现了突破,为临床自然语言处理提供新思路。

新颖性

首次系统性构建涵盖14类细粒度驱逐状态的公开数据集,结合LLM合成与自动提示优化实现高效标注。不同于传统规则或小模型微调,该方法利用大模型的生成能力与人机验证,显著提升多类别检测性能。提出的模块化管道具有良好的扩展性,填补了驱逐社会风险在电子健康记录中的研究空白。

局限性

  • 模型在极端复杂或模糊的临床描述中仍存在识别偏差,尤其在少数类别样本不足时表现不佳。
  • 合成数据虽大幅降低标注成本,但可能引入偏差,影响模型在真实数据中的泛化能力。
  • 当前方法依赖于高性能大模型,计算资源需求较大,限制在资源有限环境中的应用。

未来方向

未来将探索多模态数据融合(如影像、结构化信息)提升识别准确性,优化模型压缩与推理效率,增强模型在多样化临床场景中的适应性。同时,计划扩展到更多社会风险类别,推动SDoH在公共卫生中的广泛应用。

AI 总览摘要

本研究提出SynthEHR-Eviction,结合大语言模型(LLMs)、合成数据增强与自动提示优化(APO),实现对电子健康记录中驱逐社会风险的高效识别。驱逐作为影响健康的重要社会决定因素,传统在临床记录中缺乏系统标注,严重制约其应用。研究团队构建了最大规模的驱逐相关SDoH数据集,涵盖14个细粒度类别,利用合成数据与人机验证流程,显著降低标注成本(超80%),同时保证数据质量。微调模型如Qwen2.5-7B在验证集上F1达88.8%,优于GPT-4o-APO(87.8%)和BioBERT(60.7%),展现出多模型规模部署的潜力。该方法不仅提升了驱逐状态检测的准确性,还为其他社会风险类别的自动识别提供了技术框架。通过模块化设计,未来可推广至多种SDoH领域,助力公共卫生决策和个性化医疗。整体而言,SynthEHR-Eviction为电子健康记录中的社会决定因素研究提供了创新工具,推动医疗与社会服务的深度融合,具有重要的学术与应用价值。

深度分析

研究背景

随着个性化医疗的发展,社会决定因素(SDoH)逐渐成为影响健康的重要因素。传统研究多依赖结构化编码,但在电子健康记录(EHR)中,驱逐状态等社会风险多以非结构化文本存在,缺乏系统标注。已有研究如MIMIC-IV中驱逐信息极少,标准编码(如ICD-10)缺乏专门类别,限制了其在临床中的应用。近年来,大模型在信息抽取中展现潜力,但针对驱逐社会风险的研究仍不足。该背景下,如何高效、准确地识别驱逐状态,成为亟待解决的问题。

核心问题

驱逐作为影响健康的关键社会风险,难以在电子健康记录中自动识别,主要因其在临床文本中的稀疏表现和缺乏标准编码。传统方法依赖规则或小模型微调,成本高、泛化差,难以应对多样化的表达方式。此外,缺乏大规模、细粒度的公开数据集,限制了模型性能提升。如何利用先进的自然语言处理技术,构建高效、可扩展的驱逐状态识别体系,成为核心挑战。

核心创新

本研究的创新点在于:1)提出基于大模型的合成数据增强策略,有效扩充驱逐相关样本;2)引入自动提示优化(APO),提升模型在多类别、多细粒度任务中的表现;3)结合DSPy框架实现链式推理,增强模型解释性和细粒度识别能力;4)构建最大规模的驱逐相关SDoH公开数据集,支持模型微调与评估。这些创新解决了数据稀缺、标注成本高、模型泛化差等难题,为社会风险识别提供了新路径。

方法详解

  • �� 生成合成数据:利用大模型(Qwen2.5、LLaMA3)在提示优化后,自动生成多样化临床笔记,涵盖14个驱逐状态类别。• 自动提示优化:通过APO机制,反复调整提示词,提升模型对目标任务的适应性。• 人机验证:采用DSPy框架,专家验证生成样本,确保标注质量。• 多轮迭代:生成-验证-优化,逐步扩充数据集,平衡类别分布。• 微调模型:在增强数据上微调不同规模模型,实现多任务、多类别识别。• 评估指标:采用Macro-F1、Micro-F1,比较不同模型与方法的性能。• 模块化设计:流程可扩展到其他社会风险类别,保证系统灵活性。

实验设计

使用MIMIC-IV和PMC-Patients等真实临床笔记,结合合成数据,训练多模型(GPT-4o、Qwen2.5、LLaMA3、BioBERT等)。设置不同类别标签,评估二分类(驱逐与非驱逐)、多类别(细粒度驱逐状态)任务。采用交叉验证,统计95%置信区间。还进行消融实验,验证APO和合成数据的贡献。模型性能用F1、准确率等指标衡量,比较不同规模和微调策略的效果。

结果分析

微调模型Qwen2.5-7B在驱逐检测中F1达88.8%,优于未微调的GPT-4o(87.8%)和BioBERT(60.7%)。多类别任务中,APO显著提升GPT-4o-mini(Macro-F1从69.1%升至78.1%),模型在不同类别(如‘待定’、‘历史’)识别中表现优异。合成数据有效降低标注成本(超80%),模型在多数据集间表现稳定,验证了方法的泛化能力。类别细粒度识别的高准确率,证明了该系统在实际临床场景中的应用潜力。

应用场景

该技术可用于医疗机构自动识别驱逐风险,辅助社会工作者制定干预策略,提升公共卫生监测效率。未来可结合结构化信息,实现全流程自动化,支持实时监控。还可推广到其他社会风险类别,如食物不安全、交通问题,推动社会医疗一体化发展。

局限与展望

模型在极端模糊描述或少数类别样本不足时表现仍有限,存在偏差风险。合成数据虽降低成本,但可能引入偏差影响泛化。高性能模型依赖大量计算资源,限制在低资源环境中的应用。未来需优化模型压缩与多模态融合,提升实用性。

通俗解读 非专业人士也能看懂

想象你在一家厨房做饭,食材代表不同的健康信息,厨师(模型)需要根据食材判断菜肴的状态。传统方法像用手工写菜谱,费时费力,容易出错。现在,有了智能厨师(大模型),它可以根据提示自动生成菜谱,还能根据已有食材快速判断菜肴是否需要调味或是否已熟。通过不断调整提示(提示优化),厨师变得更聪明,能做出更符合口味的菜。研究中,团队用这种智能厨师生成大量虚拟菜谱(合成数据),再请专家验证,确保菜谱合理。最后,厨师经过训练,能准确识别菜肴状态(驱逐信息),帮助厨师长(医生)更快了解客人的居住状况。这个过程大大节省了人工标注时间,也让厨房(医疗系统)更高效、更智能。

简单解释 像给14岁少年讲一样

想象你在学校里,老师要你找出谁在玩手机,谁在认真听讲。以前,老师只用眼睛观察,费时又不准。现在,有个智能助手(模型)可以帮忙,它会看老师发的提示(比如“谁在玩手机”),用电脑判断谁在做什么。这个助手还可以学习不同老师的提示,变得越来越聪明。团队用这种方法,先让助手自己生成很多学生的表现(虚拟数据),再请老师确认哪些表现是真的。经过多次训练,助手能准确识别学生是否在玩手机,帮助老师更快管理课堂。这就像用智能软件帮老师省事,让学校变得更有序、更高效。

原文摘要

Eviction is a significant yet understudied social determinants of health (SDoH), linked to housing instability, unemployment, and mental health. While eviction appears in unstructured electronic health records (EHRs), it is rarely coded in structured fields, limiting downstream applications. We introduce SynthEHR-Eviction, a scalable pipeline combining LLMs, human-in-the-loop annotation, and automated prompt optimization (APO) to extract eviction statuses from clinical notes. Using this pipeline, we created the largest public eviction-related SDoH dataset to date, comprising 14 fine-grained categories. Fine-tuned LLMs (e.g., Qwen2.5, LLaMA3) trained on SynthEHR-Eviction achieved Macro-F1 scores of 88.8% (eviction) and 90.3% (other SDoH) on human validated data, outperforming GPT-4o-APO (87.8%, 87.3%), GPT-4o-mini-APO (69.1%, 78.1%), and BioBERT (60.7%, 68.3%), while enabling cost-effective deployment across various model sizes. The pipeline reduces annotation effort by over 80%, accelerates dataset creation, enables scalable eviction detection, and generalizes to other information extraction tasks.

cs.CL cs.AI