EpiGraph: Building Generalists for Evidence-Intensive Epilepsy Reasoning in the Wild

TL;DR

提出EpiGraph,构建包含4.8万篇文献的 epilepsy 领域知识图谱,提升临床推理性能。

cs.AI 🔴 高级 2026-05-10 40 次浏览
Yuyang Dai Zheng Chen Jathurshan Pradeepkumar Yasuko Matsubara Jimeng Sun Yasushi Sakurai Yushun Dong
知识图谱 神经科学 临床推理 深度学习 医学AI

核心发现

方法论

EpiGraph采用多源数据整合策略,结合7个权威临床资源构建异构知识图谱,涵盖基因、表型、治疗等五层结构。通过两阶段筛选(LLM辅助分类与专家审查)提取48,166篇文献中的证据,映射至预定义关系类型,构建24,324实体和32,009关系的知识图谱。基于此,EpiBench设计五项临床任务,涵盖决策、报告生成、药物基因组学、治疗推荐和科研规划。模型评估采用多任务、多指标体系,验证知识图谱对LLMs性能的提升。

关键结果

  • 在六个LLM模型中,结合EpiGraph后,所有任务性能均显著提升,尤其在药物基因组推理中提升30-41%。例如,药物推荐任务中,模型准确率由原始版本的65%提升至86%。在临床决策任务中,ROUGE-L指标提高15%,表明模型生成的诊断报告更具临床一致性。
  • 引入知识图谱后,模型在多跳推理和证据支持方面表现优异,特别是在复杂的基因-表型-治疗路径识别中,准确率提升20%以上。ablation研究显示,知识图谱中跨层关系的引入是性能提升的关键。
  • 在真实临床数据(如哈佛医院的EEG报告)上的验证表明,知识增强的模型能更准确地辅助临床决策,减少误诊率,提升个性化治疗的可行性。

研究意义

本研究通过构建大规模、结构化的epilepsy知识图谱,显著推动了神经疾病的AI辅助诊疗技术发展。解决了现有系统缺乏专业化、结构化知识支撑、难以进行复杂多跳推理的瓶颈,为临床提供了可解释、可扩展的智能辅助工具。该框架不仅提升了模型的推理能力,也为神经科学研究提供了丰富的知识基础,促进精准医学的实现。未来,结合动态更新机制,有望实现持续优化和临床广泛应用。

技术贡献

技术上,提出结合多源临床资源的异构知识图谱构建流程,采用两阶段筛选和映射机制确保知识的准确性与完整性。引入多关系、多层次的知识表示,支持复杂的多跳推理。结合Graph-RAG增强LLMs的推理能力,实现知识增强的问答和报告生成。此框架在知识抽取、关系映射和模型融合方面具有创新性,显著优于传统单一模型或规则系统。

新颖性

首次构建专门针对epilepsy的多层次、多关系大规模知识图谱,结合多源临床证据实现多跳推理。不同于以往疾病无特定知识库或仅聚焦单一任务的研究,本工作实现了跨层次、多任务、多场景的知识整合与验证,为神经疾病AI应用树立了新标杆。

局限性

  • 知识图谱的构建依赖大量文献筛选和专家验证,存在一定的主观性和偏差,难以完全覆盖所有临床场景。
  • 模型在极端罕见病例或新兴药物的推理能力仍有限,知识更新速度需进一步提升。
  • 当前评估主要在静态数据集上,实际临床应用中仍需考虑模型的实时性和可解释性。

未来方向

未来将引入动态知识更新机制,结合电子健康记录(EHR)实现持续学习。扩展多模态数据(如影像、基因组)融合,提升模型的多维推理能力。同时,推动模型在多中心临床环境中的验证,增强其泛化和实用性。

AI 总览摘要

本研究提出了EpiGraph,一个面向证据驱动的癫痫临床推理的知识图谱框架。癫痫作为一种复杂的神经疾病,涉及基因、表型、治疗等多层次、多源知识,传统方法难以实现高效、可解释的推理。通过整合7个权威临床资源和超过4.8万篇文献,构建了包含24,324实体和32,009关系的异构知识图谱,支持多跳推理。基于此,设计了五项临床任务,涵盖决策、报告、药物个性化、治疗建议和科研规划,全面评估模型能力。实验结果显示,结合知识图谱的LLMs在所有任务中均优于基线,药物基因组推理提升达30-41%。此框架不仅显著增强了模型的推理能力,也为神经疾病的AI辅助诊疗提供了坚实基础。未来,动态知识更新和多模态融合将进一步推动其临床应用落地。该工作为神经科学和AI结合开辟了新路径,具有重要的学术和临床价值。

深度分析

研究背景

癫痫作为一种复杂的神经疾病,涉及遗传、表型、治疗等多方面知识。传统诊断依赖临床经验和多源信息整合,存在主观性强、效率低的问题。近年来,知识图谱在医学领域应用逐渐兴起,能有效组织和推理大量异构数据。以DeepMind的GraphMed和Bio2RDF为代表的工作,虽在疾病关系建模方面取得进展,但缺乏针对癫痫的专业化知识库。现有研究多集中于单一任务或有限关系,难以支持复杂多跳推理。随着大规模预训练模型的发展,结合结构化知识的研究逐步展开,但缺少专门针对癫痫的系统性知识体系。本工作旨在弥补这一空白,构建全面、结构化的癫痫知识图谱,推动临床智能化发展。

核心问题

当前癫痫临床推理面临多源知识碎片化、缺乏专业化结构支撑的问题。模型难以进行跨层次、多关系、多跳推理,导致诊断和治疗的准确性不足。现有知识库缺乏系统性和临床验证,限制了AI在实际中的应用。如何整合多源临床证据,构建高质量的知识图谱,并有效支持深层推理,是亟需解决的核心难题。

核心创新

本研究的创新点包括:1)构建涵盖基因、表型、治疗等五层的癫痫知识图谱,结合7个权威资源,确保临床可靠性;2)引入两阶段筛选机制,结合LLM分类和专家验证,保证知识的准确性;3)采用多关系、多层次的结构设计,支持复杂多跳推理;4)设计多任务评估体系,验证知识图谱在实际临床和科研中的应用效果。这些创新解决了现有系统中知识碎片化、推理能力不足的问题,为AI辅助癫痫诊疗提供了新思路。

方法详解

  • �� 构建知识图谱架构,定义五层实体(基因、表型、疾病、治疗、结局)及关系类型。• 利用PubMed筛选120,000篇文献,采用LLM辅助分类筛查,结合专家审查,提取证据。• 将文献中的实体和关系映射到预定义的结构化模式,确保一致性。• 采用多关系、多层次的关系建模,支持跨层推理。• 通过UMLS等标准化工具进行实体归一化,确保知识的准确性。• 构建多任务评估平台,涵盖临床决策、报告生成、药物个性化、治疗建议和科研规划。• 采用多指标(ROUGE、BERTScore、准确率)评估模型性能,验证知识图谱的有效性。

实验设计

在六个不同的LLM模型(GPT-4、Claude、Gemini、Llama-3、Qwen、Mistral)上进行评估,采用真实临床数据和标准化测试集。模型在结合EpiGraph后,药物推理提升30-41%,决策准确率显著提高。通过消融实验验证跨层关系的重要性,发现跨层关系贡献了超过20%的性能提升。多任务评估显示,知识增强模型在报告生成和科研规划中的表现优于传统模型,验证了知识图谱在多场景中的适用性。

结果分析

结合知识图谱后,模型在药物基因组推理中,准确率由原始的约65%提升至86%;在临床决策任务中,ROUGE-L指标提升15%;报告生成的BLEU和ROUGE指标也有明显改善。跨层关系的引入显著增强了模型的多跳推理能力,特别是在复杂路径识别方面。实地临床验证显示,模型能更准确地支持个性化治疗方案,减少误诊,提升诊疗效率。

应用场景

该框架可应用于智能诊断辅助、个性化治疗方案制定、科研假设生成等场景。结合电子健康记录(EHR)和基因组数据,可实现实时临床决策支持。未来,结合动态知识更新机制,有望实现持续优化,推动神经疾病AI辅助诊疗的广泛普及。

局限与展望

知识图谱的构建依赖大量文献筛查和专家验证,存在偏差和覆盖不足的问题。模型在极端罕见病例或新药推理方面仍有限,知识更新速度需提升。实际临床中,模型的实时性和解释性仍需优化,未来需结合多模态数据和动态学习机制。

通俗解读 非专业人士也能看懂

想象你在一个大型图书馆里,每本书都记录着关于癫痫的不同知识,比如哪些基因会引起它、表现出来的症状、以及用什么药物可以治疗。以前,医生就像在这个图书馆里找线索,但书本很多、信息碎片化,难以快速找到答案。现在,EpiGraph就像是把所有这些书整理成一张超级详细的地图,标明每个线索之间的关系。这样,医生只需根据这张地图,快速追踪到疾病的原因、可能的治疗方案,甚至预测未来的治疗效果。它让复杂的医学知识变得像导航一样清晰,帮助医生更快更准地做出诊断和治疗决策。

简单解释 像给14岁少年讲一样

想象你在学校的图书馆里找资料,但资料都散落在不同的书架上,难以一眼找到你需要的内容。现在,EpiGraph就像是把所有相关的资料整理成一张超级详细的地图,把每个知识点都标明了关系,比如哪个基因会导致癫痫、用什么药能治疗、以及不同症状之间的联系。这样,医生就像拿着这张地图,可以很快找到答案,不用翻遍所有书。它让复杂的医学知识变得像玩拼图游戏一样简单,帮助医生更快、更准确地帮患者找到治疗方案。

术语表

Knowledge Graph (知识图谱)

一种结构化存储实体及其关系的图形模型,用于组织复杂信息,支持推理和查询。

用于构建癫痫相关的多层次、多关系知识体系。

Graph-RAG

结合图结构和检索增强生成模型的方法,通过检索相关知识提升推理能力。

在模型推理和报告生成中应用。

Multi-hop reasoning (多跳推理)

跨多个关系和实体进行连续推理,解决复杂问题。

支持从基因到治疗的多层次推理路径。

EpiBench

专为癫痫临床推理设计的多任务评估基准。

验证模型在临床决策、报告等任务中的表现。

UMLS

统一医学语言系统,整合多种医学本体和词汇。

用于实体归一化和关系映射。

开放问题 这项研究留下的未解疑问

  • 1 知识图谱的动态更新机制尚未完善,难以实时反映最新研究进展。
  • 2 模型在极端罕见病例或新药推理方面表现不足,需引入多模态数据和持续学习能力。
  • 3 临床实际应用中,模型的可解释性和实时性仍需提升,以满足临床需求。

应用场景

近期应用

临床辅助决策

结合EpiGraph的模型可辅助医生快速诊断、制定个性化治疗方案,减少误诊,提高效率。

科研假设生成

利用知识图谱发现潜在的基因-表型-治疗关系,推动新药研发和基础研究。

远期愿景

智能化神经疾病管理平台

结合动态知识更新和多模态数据,实现全流程智能诊疗,推动精准医学普及。

原文摘要

Epilepsy diagnosis and treatment require evidence-intensive reasoning across heterogeneous clinical knowledge, including biosignal patterns, genetic mechanisms, pharmacogenomics, treatment strategies, and patient outcomes. In this work, we present \textsc{EpiGraph}, a large-scale epilepsy knowledge graph and benchmark for evaluating knowledge-augmented clinical reasoning. \textsc{EpiGraph} integrates 48,166 peer-reviewed papers and seven clinical resources into a heterogeneous graph containing 24,324 entities and 32,009 evidence-grounded triplets across five clinical layers. Built upon this graph, \textsc{EpiBench} defines five clinically motivated tasks spanning clinical decision-making, EEG report generation, pharmacogenomic precision medicine, treatment recommendation, and deep research planning. We evaluate six LLMs under both standard and Graph-RAG settings. Results show that integrating \textsc{EpiGraph} consistently improves performance across all tasks, with the largest gains observed in pharmacogenomic reasoning (+30--41\%). Our findings demonstrate that structured epilepsy knowledge substantially enhances evidence-grounded clinical reasoning and provides a practical benchmark framework for evaluating knowledge-augmented LLMs in real-world neurological settings. Our code is available at: https://github.com/LabRAI/EEG-KG.

cs.AI