FHIR-AgentBench: Benchmarking LLM Agents for Realistic Interoperable EHR Question Answering

TL;DR

FHIR-AgentBench评估LLM在HL7 FHIR标准下的EHR问答性能,揭示数据检索和推理挑战。

cs.CL 🔴 高级 2025-09-12 3 次浏览
Gyubok Lee Elea Bach Eric Yang Tom Pollard Alistair Johnson Edward Choi Yugang jia Jong Ha Lee
EHR FHIR LLM 数据检索 临床问答

核心发现

方法论

该研究提出了FHIR-AgentBench基准,评估LLM在HL7 FHIR标准下的临床问答能力。通过比较不同的数据检索策略(直接FHIR API调用与专用工具)、交互模式(单轮与多轮)和推理策略(自然语言与代码生成),揭示了数据检索和推理的实际挑战。

关键结果

  • 多轮交互显著提高检索召回率,从单轮的58%提升至71%。
  • 代码生成显著提升答案正确率,多轮代码生成的答案正确率达到50%。
  • 检索精度普遍较低,导致噪声增加,影响推理能力。

研究意义

该研究为临床AI提供了一个现实的评估框架,促进了LLM在复杂FHIR资源上的应用。通过公开数据集和评估套件,推动了可重复的研究和可靠的临床应用开发。

技术贡献

该研究首次将真实临床问题与FHIR资源结合,提供了一个全面的评估框架。通过系统比较不同的代理框架,揭示了检索精度与答案正确率之间的关键关系。

新颖性

FHIR-AgentBench首次将真实临床问题与FHIR资源结合,提供了一个全面的评估框架,填补了现有基准在互操作性评估上的空白。

局限性

  • 检索精度低导致噪声增加,影响推理能力。
  • 单轮代理无法处理多资源类型的问题。

未来方向

未来研究可探索提高检索精度的方法,并开发更复杂的代理架构以改善推理能力。

AI 总览摘要

FHIR-AgentBench是一个新的基准,用于评估大型语言模型(LLM)在HL7 FHIR标准下的电子健康记录(EHR)问答能力。现有的基准未能充分反映FHIR标准的复杂性,导致在评估LLM时缺乏现实性。

该研究通过比较不同的数据检索策略、交互模式和推理策略,揭示了数据检索和推理的实际挑战。实验结果表明,多轮交互显著提高了检索召回率,而代码生成显著提升了答案正确率。

FHIR-AgentBench的公开发布促进了可重复的研究和可靠的临床应用开发,为临床AI提供了一个现实的评估框架。未来研究可探索提高检索精度的方法,并开发更复杂的代理架构以改善推理能力。

深度分析

研究背景

随着HL7 FHIR标准的普及,临床AI面临新的挑战。传统的结构化数据检索方法已不再适用,亟需新的评估框架来反映FHIR标准的复杂性。

核心问题

现有的EHR问答基准未能充分反映FHIR标准的复杂性,导致在评估LLM时缺乏现实性。需要一个新的基准来评估LLM在复杂FHIR资源上的问答能力。

核心创新

FHIR-AgentBench结合真实临床问题与FHIR资源,提供了一个全面的评估框架。通过系统比较不同的代理框架,揭示了检索精度与答案正确率之间的关键关系。

方法详解

  • �� 比较不同的数据检索策略:直接FHIR API调用与专用工具。
  • �� 比较不同的交互模式:单轮与多轮。
  • �� 比较不同的推理策略:自然语言与代码生成。

实验设计

使用MIMIC-IV-FHIR数据集,评估不同代理框架在检索精度、召回率和答案正确率上的表现。通过多轮交互和代码生成提高答案正确率。

结果分析

多轮交互显著提高检索召回率,而代码生成显著提升答案正确率。检索精度普遍较低,导致噪声增加,影响推理能力。

应用场景

该基准可用于评估LLM在临床问答中的性能,促进临床AI的开发和应用。

局限与展望

检索精度低导致噪声增加,影响推理能力。单轮代理无法处理多资源类型的问题。未来研究可探索提高检索精度的方法。

通俗解读 非专业人士也能看懂

想象一个图书馆,书架上有各种书籍。你需要找到一本特定的书,回答一个问题。传统方法就像在书架上找书,而FHIR-AgentBench则像是一个智能助手,帮助你快速找到正确的书,并给出答案。这个助手不仅能找到书,还能理解书的内容,给出准确的答案。

简单解释 像给14岁少年讲一样

想象你在玩一个复杂的游戏,需要找到隐藏的宝藏。这个游戏有很多关卡,每个关卡都有不同的线索。FHIR-AgentBench就像是一个超级助手,帮助你找到线索,解开谜题,最终找到宝藏。它不仅能找到线索,还能帮你理解线索,给出正确的答案。

术语表

FHIR (快速医疗互操作资源)

一种标准化的电子健康数据交换格式,旨在提高数据互操作性。

用于组织和查询电子健康数据。

LLM (大型语言模型)

一种基于深度学习的自然语言处理模型,能够理解和生成人类语言。

用于处理复杂的临床问答任务。

检索精度

衡量检索结果的准确性,即检索到的相关资源占所有检索资源的比例。

用于评估代理的检索性能。

代码生成

通过生成代码来实现复杂的推理和计算任务。

用于解析复杂的FHIR数据结构。

召回率

衡量检索结果的完整性,即检索到的相关资源占所有相关资源的比例。

用于评估代理的检索性能。

开放问题 这项研究留下的未解疑问

  • 1 如何提高检索精度以减少噪声对推理的影响?
  • 2 如何设计更复杂的代理架构以改善推理能力?

应用场景

近期应用

临床问答系统

帮助医生快速获取患者信息,提高诊断效率。需要高精度的检索能力。

远期愿景

智能医疗助手

通过整合多种数据源,提供全面的患者健康分析。需要复杂的推理能力。

原文摘要

The recent shift toward the Health Level Seven Fast Healthcare Interoperability Resources (HL7 FHIR) standard opens a new frontier for clinical AI, demanding LLM agents to navigate complex, resource-based data models instead of conventional structured health data. However, existing benchmarks have lagged behind this transition, lacking the realism needed to evaluate recent LLMs on interoperable clinical data. To bridge this gap, we introduce FHIR-AgentBench, a benchmark that grounds 2,931 real-world clinical questions in the HL7 FHIR standard. Using this benchmark, we systematically evaluate agentic frameworks, comparing different data retrieval strategies (direct FHIR API calls vs. specialized tools), interaction patterns (single-turn vs. multi-turn), and reasoning strategies (natural language vs. code generation). Our experiments highlight the practical challenges of retrieving data from intricate FHIR resources and the difficulty of reasoning over them, both of which critically affect question answering performance. We publicly release the FHIR-AgentBench dataset and evaluation suite (https://github.com/glee4810/FHIR-AgentBench) to promote reproducible research and the development of robust, reliable LLM agents for clinical applications.

cs.CL cs.AI