MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation

TL;DR

MedRealMM通过MCCP框架评估多模态医疗咨询,包含5620个真实案例。

cs.AI 🔴 高级 2026-07-10 2 次浏览
Runhan Shi Quan Zhou Yuqian Xu Shuai Yang Xin Wu Zitong Zhou Hui Liu Bin Zha Zheming Wang Liya Li Wei Wei Jinru Ding Wenrao Pang Mouxiao Bian Haoyuan Hu Jun Xu Jie Xu
多模态 医疗咨询 大语言模型 数据集 安全性

核心发现

方法论

MedRealMM采用多模态临床挑战点(MCCP)提取框架,从JD Health收集的真实患者-医生互动中识别出临床关键时刻,并将其转换为标准化的下一步响应生成任务。每个实例都配有医生精炼的特定案例评分标准,奖励临床上可取的行为,惩罚不安全、不支持或矛盾的反应。

关键结果

  • 图像信息对可靠的临床表现至关重要,当前的前沿模型在安全敏感的错误避免方面仍是一个主要瓶颈。
  • 一些前沿模型满足或超过了医生的正面临床标准,但也触发了更多负面标准。
  • MedRealMM提供了一个现实且可重复的基准,用于评估真实世界在线咨询中的多模态医学推理。

研究意义

MedRealMM填补了现有基准与真实临床实践之间的差距,提供了一个更贴近实际的评估框架。它不仅促进了多模态医学推理的研究,还为未来的AI医疗应用提供了重要的参考标准。

技术贡献

该研究通过MCCP框架实现了从真实多轮多模态咨询中提取单轮评估实例,并引入了医生参与的迭代评分标准精炼协议,结合了LLM初始化标准和医生修订,提供了基于真实临床判断的特定案例评估。

新颖性

MedRealMM是第一个从真实在线医疗咨询中提取多模态挑战点的基准,区别于以往依赖合成对话或患者模拟器的研究。

局限性

  • 当前模型在安全敏感的错误避免方面表现不佳,可能导致不安全的医疗建议。
  • 数据集的多样性可能不足以涵盖所有可能的临床场景。
  • 评分标准的构建依赖于医生的反馈,可能存在主观性。

未来方向

未来工作可以包括扩展数据集的多样性,改进模型的安全性和鲁棒性,以及开发更自动化的评分标准生成方法。

AI 总览摘要

MedRealMM是一个针对中国在线医疗咨询的真实世界多模态基准,旨在解决现有基准与实际临床实践不符的问题。通过从全国性互联网医院收集的去识别化患者-医生互动数据,MedRealMM使用多模态临床挑战点(MCCP)提取框架,识别出临床关键时刻并转换为标准化的下一步响应生成任务。每个实例都配有医生精炼的特定案例评分标准,奖励临床上可取的行为,惩罚不安全、不支持或矛盾的反应。

当前版本包含5620个真实世界多模态案例,涵盖64个临床科室。研究评估了19个通用和医学专业的大语言模型,包括仅文本和多模态系统。结果表明,图像信息对可靠的临床表现至关重要,当前的前沿模型在安全敏感的错误避免方面仍是一个主要瓶颈。

尽管一些前沿模型满足或超过了医生的正面临床标准,但也触发了更多负面标准,表明安全敏感的错误避免仍是一个主要瓶颈。MedRealMM提供了一个现实且可重复的基准,用于评估真实世界在线咨询中的多模态医学推理。数据集将在Hugging Face上公开发布。

深度分析

研究背景

近年来,大语言模型(LLMs)在在线医疗咨询中的应用越来越广泛。然而,现有的评估基准往往依赖于合成对话或患者模拟器,缺乏对患者上传的医学图像的考虑,或使用选择题或词汇重叠指标来评估开放式临床响应,这些都不能很好地反映临床质量。

核心问题

现有基准与实际临床实践不符,许多基准依赖于合成对话或患者模拟器,忽略了患者上传的医学图像,或使用选择题或词汇重叠指标来评估开放式临床响应,这些都不能很好地反映临床质量。

核心创新

MedRealMM通过多模态临床挑战点(MCCP)提取框架,从真实患者-医生互动中识别出临床关键时刻,并将其转换为标准化的下一步响应生成任务。每个实例都配有医生精炼的特定案例评分标准,奖励临床上可取的行为,惩罚不安全、不支持或矛盾的反应。

方法详解

  • �� 使用MCCP框架识别临床关键时刻
  • �� 将每个时刻转换为标准化的下一步响应生成任务
  • �� 配备医生精炼的特定案例评分标准
  • �� 奖励临床上可取的行为,惩罚不安全、不支持或矛盾的反应

实验设计

研究评估了19个通用和医学专业的大语言模型,包括仅文本和多模态系统。结果表明,图像信息对可靠的临床表现至关重要,当前的前沿模型在安全敏感的错误避免方面仍是一个主要瓶颈。

结果分析

图像信息对可靠的临床表现至关重要,当前的前沿模型在安全敏感的错误避免方面仍是一个主要瓶颈。尽管一些前沿模型满足或超过了医生的正面临床标准,但也触发了更多负面标准。

应用场景

MedRealMM提供了一个现实且可重复的基准,用于评估真实世界在线咨询中的多模态医学推理。数据集将在Hugging Face上公开发布。

局限与展望

当前模型在安全敏感的错误避免方面表现不佳,可能导致不安全的医疗建议。数据集的多样性可能不足以涵盖所有可能的临床场景。评分标准的构建依赖于医生的反馈,可能存在主观性。

通俗解读 非专业人士也能看懂

想象你在看医生,医生不仅要听你说,还要看你的检查报告和照片。MedRealMM就像一个聪明的助手,帮助医生更好地理解这些信息。它从真实的医生和病人对话中学习,找出关键时刻,帮助医生做出更好的决策。就像一个经验丰富的导游,知道什么时候该提醒游客注意什么,什么时候该解释背景故事。

简单解释 像给14岁少年讲一样

嘿,想象一下你在玩一个超级复杂的游戏,医生是玩家,他们需要根据病人的描述和照片来做出决定。MedRealMM就像是一个游戏助手,帮助医生在关键时刻做出正确的选择。它从真实的医生和病人对话中学习,就像从高手的游戏录像中学习一样,帮助医生更快更好地完成任务。

术语表

多模态 (Multimodal)

涉及多种信息形式,如文本和图像。

在论文中用于描述患者上传的文本和图像信息。

大语言模型 (Large Language Model)

一种能够理解和生成自然语言的AI模型。

用于评估在线医疗咨询的模型。

临床挑战点 (Clinical Challenge Point)

在咨询过程中需要医生进行重要决策的时刻。

用于识别需要重点评估的时刻。

评分标准 (Rubric)

用于评估模型表现的标准。

由医生精炼,用于评估模型生成的响应。

去识别化 (De-identification)

移除个人身份信息的过程。

用于保护患者隐私。

开放问题 这项研究留下的未解疑问

  • 1 如何提高模型在安全敏感错误避免方面的表现?
  • 2 如何扩展数据集以涵盖更多临床场景?

应用场景

近期应用

在线医疗咨询

帮助医生在在线咨询中更好地理解患者信息,提高诊断准确性。

远期愿景

智能医疗助手

发展为全面的智能医疗助手,提供更广泛的医疗支持。

原文摘要

Large language models (LLMs) are increasingly deployed in online medical consultation, yet existing benchmarks remain poorly aligned with real clinical practice. Many rely on synthetic conversations or patient simulators, omit patient-uploaded medical images, or evaluate open-ended clinical responses using multiple-choice or lexical-overlap metrics that poorly reflect clinical quality. We introduce \textbf{MedRealMM}, a large-scale benchmark for multimodal online medical consultation built from de-identified patient-doctor interactions collected from a nationwide Chinese internet hospital. MedRealMM uses a Multimodal Clinical Challenge Point (MCCP) extraction framework to identify clinically demanding moments in authentic consultation trajectories and converts each into a standardized next-response generation task while preserving the preceding text-image context. Each instance is paired with a case-specific rubric refined by physicians that rewards clinically desirable behaviors and penalizes unsafe, unsupported, or contradictory responses. The current release contains 5,620 real-world multimodal cases spanning 64 clinical departments. We evaluate 19 general-purpose and medical-specialized LLMs, including text-only and multimodal systems. Our results show that image information is critical for reliable clinical performance and that current frontier models remain below the online physician response. Although some frontier models satisfy as many or more positive clinical criteria than physicians, they trigger more negative criteria, indicating that safety-sensitive error avoidance remains a central bottleneck. MedRealMM offers a realistic and reproducible benchmark for evaluating multimodal medical reasoning in real-world online consultation. The dataset will be publicly available on Hugging Face at https://huggingface.co/datasets/jdh-algo/MedRealMM.

cs.AI cs.CL cs.CV