MedRoundsQA: A Persona and Difficulty Aware Evaluation for Multi-Turn Medical Consultations

TL;DR

MedRoundsQA通过多轮对话评估医疗诊断,诊断准确率下降13-39分。

cs.AI 🔴 高级 2026-09-11 3 次浏览
Youssef Mohamed Ahmed Heakl Qinrong Cui Junhong Liang Rafiq Ali Bdour Babillie Nazira Dunbayeva Lang Gao Omar Hussein Ahmed Nada Ahmed Mohamed Magdy Mohamed Jinghui Liu Salman Khan Imran Razzak Yuxia Wang Xiuying Chen
医疗对话 多轮诊断 患者角色 诊断准确性 公平性

核心发现

方法论

MedRoundsQA从1,387个考试案例中提取24个槽位的临床记录,生成多轮医生-患者对话。采用模型不确定性进行难度分类,评估15个LLM医生代理的表现。通过对比单轮和多轮诊断,分析患者角色对诊断准确性的影响。

关键结果

  • 多轮诊断准确率下降13-39分,说明多轮对话增加了诊断难度。
  • 增加对话轮次提高了问题相关性,但诊断准确性在6-12轮后趋于平稳。
  • 患者角色差异导致诊断准确性变化7-8分,揭示了单轮评估无法发现的公平性风险。

研究意义

该研究通过引入多轮对话评估,揭示了现有单轮诊断基准的局限性,强调了在真实医疗场景中考虑患者沟通风格的重要性。通过对不同患者角色的分析,提供了对诊断公平性的新视角,具有重要的学术和实际应用价值。

技术贡献

MedRoundsQA提供了一个新的评估框架,结合了标准化临床记录、患者角色变化和难度分类,支持对诊断模型的更全面评估。与现有方法相比,它实现了同一病例在不同患者角色下的对比分析,揭示了沟通风格对诊断性能的影响。

新颖性

这是首个结合标准化临床记录和患者角色变化的多轮诊断评估框架,能够在保持临床内容不变的情况下,分析沟通风格对诊断性能的影响。

局限性

  • 模型在多轮对话中信息收集效率低,导致诊断准确性下降。
  • 患者角色的变化可能导致模型性能不稳定。
  • 对话轮次的增加并未显著提高诊断准确性。

未来方向

未来研究可以探索更复杂的患者角色和情感变化对诊断的影响,以及如何提高模型在多轮对话中的信息收集能力。

AI 总览摘要

现有的医疗诊断基准通常基于单轮、多选问题,无法真实反映临床对话的复杂性。MedRoundsQA通过多轮对话评估,揭示了单轮诊断的局限性。研究显示,增加对话轮次提高了问题相关性,但诊断准确性在6-12轮后趋于平稳。此外,患者角色的差异导致诊断准确性变化7-8分,揭示了单轮评估无法发现的公平性风险。该研究强调了在真实医疗场景中考虑患者沟通风格的重要性,并为诊断模型的评估提供了新的视角。未来研究可以探索更复杂的患者角色和情感变化对诊断的影响,以及如何提高模型在多轮对话中的信息收集能力。

深度分析

研究背景

医疗诊断通常是一个交互过程,医生通过逐步询问收集信息。然而,现有的诊断基准大多基于单轮、多选问题,无法真实反映临床对话的复杂性。近年来,随着大规模语言模型的兴起,如何在多轮对话中评估诊断模型的性能成为一个重要课题。

核心问题

现有的单轮诊断基准无法真实反映临床对话的复杂性,忽视了患者沟通风格对诊断的影响。这导致模型在实际应用中可能表现不佳,尤其是在信息逐步到达或患者沟通不精确的情况下。

核心创新

MedRoundsQA通过将1,387个考试案例转换为24槽位的临床记录,生成多轮医生-患者对话。引入患者角色变化和模型不确定性进行难度分类,支持对诊断模型的更全面评估。

方法详解

  • �� 从考试案例中提取24槽位的临床记录
  • �� 生成多轮医生-患者对话
  • �� 引入患者角色变化
  • �� 使用模型不确定性进行难度分类
  • �� 评估15个LLM医生代理的表现

实验设计

实验使用1,387个案例,评估15个LLM医生代理的表现。通过对比单轮和多轮诊断,分析患者角色对诊断准确性的影响。使用模型不确定性进行难度分类。

结果分析

多轮诊断准确率下降13-39分,增加对话轮次提高了问题相关性,但诊断准确性在6-12轮后趋于平稳。患者角色差异导致诊断准确性变化7-8分。

应用场景

该研究可用于评估和改进医疗诊断模型,尤其是在多轮对话和患者沟通风格变化的场景中。对医疗AI的公平性和鲁棒性评估具有重要意义。

局限与展望

模型在多轮对话中信息收集效率低,导致诊断准确性下降。患者角色的变化可能导致模型性能不稳定。对话轮次的增加并未显著提高诊断准确性。

通俗解读 非专业人士也能看懂

想象你在和医生聊天,医生需要通过问问题来了解你的病情。这个过程就像是医生在拼一幅拼图,每个问题都是一块拼图。现有的诊断方法就像是医生只看一张完整的图片,而不是逐步拼图。MedRoundsQA让医生通过多轮对话来拼图,这样可以更真实地反映医生的诊断过程。通过这种方法,我们可以看到不同的患者角色如何影响医生的诊断,就像不同的拼图块可能会改变最终的图案。

简单解释 像给14岁少年讲一样

想象你在玩一个侦探游戏,医生是侦探,你是线索提供者。医生需要通过问问题来收集线索,找出问题的根源。现有的诊断方法就像是侦探直接得到所有线索,而不是逐步收集。MedRoundsQA让医生通过多轮对话来收集线索,这样可以更真实地反映侦探的工作过程。通过这种方法,我们可以看到不同的角色如何影响侦探的判断,就像不同的线索可能会改变最终的结论。

术语表

多轮对话 (Multi-turn Dialogue)

指在多次交互中逐步收集信息的对话形式。

用于模拟医生与患者之间的真实对话。

患者角色 (Patient Persona)

不同的患者沟通风格和背景设定。

用于分析沟通风格对诊断的影响。

诊断准确性 (Diagnostic Accuracy)

模型在诊断任务中给出正确答案的能力。

用于评估模型在多轮对话中的表现。

模型不确定性 (Model Uncertainty)

模型对其预测结果的不确定程度。

用于难度分类和评估模型的鲁棒性。

公平性 (Equity)

模型在不同患者角色下表现一致的能力。

用于评估模型在多样化患者背景下的表现。

开放问题 这项研究留下的未解疑问

  • 1 如何提高模型在多轮对话中的信息收集能力?
  • 2 不同患者角色的变化如何影响诊断公平性?
  • 3 如何在多轮对话中提高诊断准确性?

应用场景

近期应用

医疗AI评估

用于评估和改进医疗诊断模型的多轮对话能力。

远期愿景

公平性增强

通过分析患者角色差异,提升医疗AI的公平性和鲁棒性。

原文摘要

Medical benchmarks are dominated by single-turn, multiple-choice clinical cases that poorly reflect real consultations. Practically, clinicians elicit evidence interactively and patient communication varies widely. We introduce MedRoundsQA, a multi-turn diagnostic benchmark derived from 1,387 board-exam cases across 17 specialties. Each case is converted into a structured 24-slot clinical record, and then instantiated as controlled doctor-patient dual-agent dialogues under varying patient personas, with the underlying clinical content held fixed. We further classify cases by difficulty using model-based uncertainty to enable easy-to-hard analysis. Evaluations of fifteen LLM doctor agents show that (i) moving from a single-turn diagnosis on the standardized records to multi-turn consultations causes large degradations of roughly 13-39 points; (ii) more turns reliably improves question relevance, but diagnostic accuracy exhibits diminishing returns and typically plateaus after 6-12 turns; and (iii) patient persona differences can shift diagnosis accuracy by about 7-8 points (lowest to highest education), highlighting equity risks that single-turn benchmarks miss.

cs.AI