IMCBench: A benchmark for multimodal LLMs in Image-grounded Medical Conversations

TL;DR

IMCBench通过图像支持的多轮对话评估多模态LLM,Claude Opus 4.6得分最高3.61。

cs.AI 🔴 高级 2026-06-27 3 次浏览
Maria Xenochristou Ashutosh Joshi Korosh Vatanparvar Mohammad Abuzar Hashemi Prasad Kasu Deepak Bansal Anchal Nema Nivedita Wadhwa Prashams S Jain Rebecca Abraham Will Kimbrough Dilek Hakkani-Tur Wilko Schulz-Mahlendorf
多模态 医学对话 大语言模型 安全性 准确性

核心发现

方法论

IMCBench结合真实皮肤病图像和合成患者档案,评估多模态LLM在医学对话中的表现。使用LLM-as-Jury评分系统,基于临床专家注释校准,涵盖安全性、准确性和不确定性处理三方面。

关键结果

  • Claude Opus 4.6在安全性和准确性上得分最高,但在处理不确定性方面排名第二。
  • 视觉输入和EHR背景对安全性有显著贡献,移除任一导致安全性下降0.18和0.23。
  • 无单一模型在所有维度上表现最佳,尤其在恶性和罕见病情上安全性下降0.27。

研究意义

IMCBench填补了现有医学AI基准的空白,提供了一个多维度评估框架,强调准确的临床描述并不等同于安全的患者指导。这一研究为医学AI的多模态对话系统提供了新的评估标准,推动了更安全和更准确的临床应用。

技术贡献

IMCBench首次结合图像和EHR进行多轮对话评估,提出了LLM-as-Jury评分系统,提供了一个自我优化的评分框架,显著提高了与临床专家的一致性。

新颖性

IMCBench是首个在多轮对话中结合图像和EHR的基准,提供了一个全面的评估框架,解决了现有基准中多模态对话评估的缺失。

局限性

  • 模型在处理恶性和罕见病情时安全性下降显著。
  • 现有模型在所有评估维度上均无明显优势。

未来方向

未来研究可以探索更复杂的多模态输入组合,优化模型在处理不确定性方面的表现,并扩展到其他医学领域。

AI 总览摘要

IMCBench是一个针对多模态大语言模型的基准,专注于图像支持的医学对话。现有医学AI基准往往只支持单一模态,无法有效评估多模态对话的安全性和准确性。IMCBench通过结合真实皮肤病图像和合成患者档案,模拟真实的患者-医生互动,提供了一个全面的评估框架。

在实验中,IMCBench评估了八个前沿多模态模型,发现Claude Opus 4.6在安全性和准确性上表现最佳,但在处理不确定性方面略逊一筹。研究表明,视觉输入和EHR背景对模型的安全性有显著贡献,移除任一导致安全性下降。

IMCBench的研究意义在于填补了现有基准的空白,为医学AI的多模态对话系统提供了新的评估标准,推动了更安全和更准确的临床应用。未来研究可以探索更复杂的多模态输入组合,优化模型在处理不确定性方面的表现。

深度分析

研究背景

近年来,大语言模型和视觉语言模型在医疗领域的应用潜力不断增加。然而,现有的医学AI基准往往只支持单一模态,无法有效评估多模态对话的安全性和准确性。IMCBench旨在填补这一空白,通过结合真实皮肤病图像和合成患者档案,提供一个全面的评估框架。

核心问题

现有的医学AI基准在多模态对话评估方面存在明显不足,尤其是在安全性和准确性方面。单一模态的基准无法有效模拟真实的患者-医生互动,导致评估结果的局限性。

核心创新

IMCBench的核心创新在于首次结合图像和EHR进行多轮对话评估。通过LLM-as-Jury评分系统,提供了一个自我优化的评分框架,显著提高了与临床专家的一致性。

方法详解

  • �� IMCBench结合真实皮肤病图像和合成患者档案,模拟真实的患者-医生互动。
  • �� 使用LLM-as-Jury评分系统,基于临床专家注释校准,涵盖安全性、准确性和不确定性处理三方面。
  • �� 通过消融研究,评估视觉输入和EHR背景对模型安全性的贡献。

实验设计

IMCBench评估了八个前沿多模态模型,包括Claude、GPT、Nova和Llama系列。每个模型在1-5分制上进行评分,使用LLM-as-Jury评分系统,基于临床专家注释校准。

结果分析

Claude Opus 4.6在安全性和准确性上表现最佳,但在处理不确定性方面略逊一筹。视觉输入和EHR背景对模型的安全性有显著贡献,移除任一导致安全性下降。

应用场景

IMCBench可用于评估医学AI系统在多模态对话中的表现,尤其是在安全性和准确性方面。其评估框架可应用于其他医学领域,推动更安全和更准确的临床应用。

局限与展望

现有模型在处理恶性和罕见病情时安全性下降显著。未来研究可以探索更复杂的多模态输入组合,优化模型在处理不确定性方面的表现。

通俗解读 非专业人士也能看懂

想象你在医院,医生需要通过对话和图像来判断你的健康状况。IMCBench就像一个训练医生的模拟器,它结合了真实的皮肤病图像和虚构的患者信息,帮助AI医生更好地理解和处理病情。通过这种方式,AI医生可以在不确定的情况下,提供更安全和准确的建议。

简单解释 像给14岁少年讲一样

嘿,小伙伴!想象一下你在玩一个超级复杂的游戏,医生是NPC,他们需要通过看图片和聊天来判断你的健康问题。IMCBench就是一个训练这些NPC的工具,它用真实的图片和虚构的故事,让AI医生更聪明、更安全地给出建议。这样,当你有健康问题时,他们就能更好地帮助你啦!

术语表

IMCBench

一个用于评估多模态大语言模型在医学对话中的基准。

用于测试模型在图像支持的多轮医学对话中的表现。

LLM-as-Jury

一种评分系统,使用大语言模型作为评审,基于临床专家注释校准。

用于IMCBench中对模型安全性和准确性的评分。

EHR

电子健康记录,包含患者的健康信息。

在IMCBench中用于提供患者背景信息。

消融研究

通过移除某些组件来研究其对整体系统的影响。

用于评估视觉输入和EHR背景对模型安全性的贡献。

多模态

结合多种数据类型(如文本和图像)的技术。

IMCBench评估的模型需要处理多模态输入。

开放问题 这项研究留下的未解疑问

  • 1 如何提高模型在处理恶性和罕见病情时的安全性?
  • 2 如何优化模型在不确定性处理方面的表现?

应用场景

近期应用

医学AI系统评估

IMCBench可用于评估医学AI系统在多模态对话中的表现,尤其是在安全性和准确性方面。

远期愿景

跨领域应用

IMCBench的评估框架可应用于其他医学领域,推动更安全和更准确的临床应用。

原文摘要

Recent advances in large language models and vision-language models have enabled reasoning over multimodal data, offering opportunities for clinical applications such as decision support and triaging. However, existing medical AI benchmarks are fragmented: some support multi-turn dialogues but lack images, while others provide multimodal inputs but focus on single-turn QA tasks. To address this gap, we introduce IMCBench, an image-grounded, multi-turn medical conversation benchmark that pairs real, publicly available clinical images with synthetic patient profiles to simulate realistic patient-clinician interactions. Each conversation is evaluated across three clinical dimensions: safety, accuracy, and appropriate use of uncertainty in diagnosis. We benchmark eight multimodal frontier models across four model families (Claude, GPT, Nova, and Llama), scoring each on a 1-5 scale using LLM-as-Jury scoring calibrated against expert clinician annotations. Our results show that Claude Opus 4.6 achieves the highest overall score (3.61), followed by Claude Sonnet 4.6 (3.30) and GPT-5.2 (3.29), though no model dominates all dimensions and safety degrades for both malignant and rare conditions ($Δ$ = -0.27 each). Ablation studies further reveal that both visual input and EHR context contribute to safe guidance (safety drops of 0.18 and 0.23 on average when each is removed), with stronger models leveraging visual features more effectively. Together, these findings demonstrate that accurate clinical description does not guarantee safe patient guidance, motivating the need for multi-dimensional evaluation frameworks in medical AI.

cs.AI