Benchmarking Large Language Models on CMExam -- A Comprehensive Chinese Medical Exam Dataset
CMExam是首个提供全面医学标注的中文医学考试数据集,GPT-4在该数据集上达到61.6%的准确率。
核心发现
方法论
CMExam数据集来自中国国家医学执业考试,包含60K+选择题及其解释。邀请医学专家标注五个维度:疾病组、临床科室、医学学科、能力领域、难度等级。使用GPT-4进行初步标注,后由专家审核。
关键结果
- GPT-4在CMExam上取得61.6%的准确率和0.617的加权F1分数,明显低于人类的71.6%。
- GPT-3.5和GPT-4在解释任务上生成合理答案,但BLEU和ROUGE分数较低。
- 轻量级模型如ChatGLM在微调后接近GPT-3.5的表现,参数量仅为其3%。
研究意义
CMExam填补了中文医学领域标准化数据集的空白,为LLM在医学问答系统中的应用提供了重要的评估基准。研究揭示了LLM在医学领域的挑战和潜在解决方案。
技术贡献
引入了首个全面医学标注的中文数据集,提供了LLM在医学领域的性能基准。通过GPT-4辅助标注策略,显著降低了大规模数据集标注的时间和人力成本。
新颖性
CMExam是首个提供全面医学标注的中文医学考试数据集,涵盖多维度标注,支持LLM在医学领域的全面评估。
局限性
- LLM在解释任务上的表现仍不理想,生成的解释较短且不够详细。
- 现有医学领域LLM的覆盖范围有限,零样本性能较差。
未来方向
未来研究可探索更多医学知识的整合,提升LLM在医学应用中的表现,特别是在解释任务上的能力。
AI 总览摘要
近年来,大语言模型(LLMs)在自然语言处理领域取得了显著进展。然而,在医学领域,LLMs的评估面临挑战,主要由于缺乏标准化和全面的数据集。为解决这一问题,研究者们引入了CMExam,一个基于中国国家医学执业考试的数据集,包含超过60K道选择题及其解释。该数据集提供了五个维度的标注,包括疾病组、临床科室、医学学科、能力领域和难度等级。
在实验中,GPT-4在CMExam上取得了61.6%的准确率和0.617的加权F1分数,尽管与人类的71.6%准确率相比仍有差距,但展示了其在医学问答任务中的潜力。此外,研究发现,通过微调,轻量级模型如ChatGLM能够接近GPT-3.5的表现,尽管其参数量仅为GPT-3.5的3%。
CMExam的引入为中文医学领域的LLM评估提供了重要的基准,揭示了LLM在医学领域的挑战和潜在解决方案。未来研究可进一步探索如何整合更多的医学知识,以提升LLM在医学应用中的表现,特别是在解释任务上的能力。
深度分析
研究背景
大语言模型(LLMs)如T5和GPT-4在自然语言处理领域引发了革命。然而,医学领域的LLM评估面临挑战,主要由于缺乏标准化和全面的数据集。现有的医学数据集多源于在线论坛和消费者反馈,可能存在偏差和错误,尤其在中文领域,语言资源的不平等更为突出。
核心问题
医学领域的LLM评估缺乏标准化数据集,现有数据集规模和多样性不足,无法全面评估LLM能力。此外,多数数据集主要关注文本生成任务,缺乏明确的选择题评估,阻碍了LLM性能的客观量化。
核心创新
CMExam是首个全面医学标注的中文数据集,提供了多维度标注,支持LLM在医学领域的全面评估。通过GPT-4辅助标注策略,显著降低了大规模数据集标注的时间和人力成本。
方法详解
- �� 数据集来源于中国国家医学执业考试,包含60K+选择题。
- �� 提供五个维度的标注:疾病组、临床科室、医学学科、能力领域、难度等级。
- �� 使用GPT-4进行初步标注,由两位医学专家审核。
实验设计
实验使用CMExam数据集评估LLM在选择题预测和解释任务上的表现。基线模型包括GPT-3.5、GPT-4、ChatGLM等。评估指标为准确率和加权F1分数,解释任务使用BLEU和ROUGE分数。
结果分析
GPT-4在选择题预测任务中表现最佳,准确率为61.6%。轻量级模型如ChatGLM在微调后接近GPT-3.5的表现。解释任务中,GPT模型生成的解释较短,BLEU分数较低。
应用场景
CMExam为中文医学领域的LLM评估提供了重要的基准,适用于开发和评估医学问答系统。研究揭示了LLM在医学领域的挑战和潜在解决方案。
局限与展望
LLM在解释任务上的表现仍不理想,生成的解释较短且不够详细。现有医学领域LLM的覆盖范围有限,零样本性能较差。未来研究可探索更多医学知识的整合,提升LLM在医学应用中的表现。
通俗解读 非专业人士也能看懂
想象你在参加一个医学考试,试题是选择题。CMExam就是这样一个考试题库,帮助AI模型像GPT-4这样的“大脑”来回答这些问题。就像我们在学校里学习不同的科目,这个数据集也有不同的标注,比如疾病组、临床科室等。研究人员用GPT-4来初步标注这些题目,然后由医学专家来审核,确保准确性。通过这样的方式,AI模型可以更好地理解和回答医学问题,就像一个聪明的学生在考试中表现优异。
简单解释 像给14岁少年讲一样
想象你在玩一个医学问答游戏,CMExam就是这个游戏的题库。它有很多选择题,帮助AI模型像GPT-4这样的“超级大脑”来回答问题。研究人员用GPT-4来标注这些题目,然后由医生来检查,确保它们是对的。这样,AI模型就能像一个聪明的学生一样,在医学考试中取得好成绩!未来,AI可能会在医院里帮医生更快地找到病因,真是太酷了!
术语表
GPT-4 (生成式预训练变换器4)
一种先进的大语言模型,能够理解和生成自然语言文本。
在CMExam数据集上进行评估,表现出色。
CMExam (中文医学考试数据集)
一个包含60K+选择题的中文医学考试数据集,用于评估LLM的表现。
用于评估GPT-4等模型在医学领域的表现。
BLEU (双语评估替代)
一种用于评估机器翻译质量的指标,衡量生成文本与参考文本的相似度。
用于评估LLM在解释任务上的表现。
ROUGE (召回导向的理解评估)
一种用于评估文本摘要质量的指标,衡量生成文本与参考文本的重合度。
用于评估LLM在解释任务上的表现。
ICD-11 (国际疾病分类第11版)
一种全球公认的健康状况分类系统,用于标注CMExam中的疾病组。
用于对CMExam中的问题进行疾病组标注。
开放问题 这项研究留下的未解疑问
- 1 如何提高LLM在医学解释任务中的表现?现有方法生成的解释较短且不够详细,需要更深入的研究。
- 2 现有医学领域LLM的覆盖范围有限,如何扩展其知识库以提高零样本性能?
应用场景
近期应用
医学问答系统
CMExam可用于开发更智能的医学问答系统,帮助医生快速获取信息。
远期愿景
医学教育
CMExam可用于医学教育,帮助学生更好地准备考试,提高学习效率。
原文摘要
Recent advancements in large language models (LLMs) have transformed the field of question answering (QA). However, evaluating LLMs in the medical field is challenging due to the lack of standardized and comprehensive datasets. To address this gap, we introduce CMExam, sourced from the Chinese National Medical Licensing Examination. CMExam consists of 60K+ multiple-choice questions for standardized and objective evaluations, as well as solution explanations for model reasoning evaluation in an open-ended manner. For in-depth analyses of LLMs, we invited medical professionals to label five additional question-wise annotations, including disease groups, clinical departments, medical disciplines, areas of competency, and question difficulty levels. Alongside the dataset, we further conducted thorough experiments with representative LLMs and QA algorithms on CMExam. The results show that GPT-4 had the best accuracy of 61.6% and a weighted F1 score of 0.617. These results highlight a great disparity when compared to human accuracy, which stood at 71.6%. For explanation tasks, while LLMs could generate relevant reasoning and demonstrate improved performance after finetuning, they fall short of a desired standard, indicating ample room for improvement. To the best of our knowledge, CMExam is the first Chinese medical exam dataset to provide comprehensive medical annotations. The experiments and findings of LLM evaluation also provide valuable insights into the challenges and potential solutions in developing Chinese medical QA systems and LLM evaluation pipelines. The dataset and relevant code are available at https://github.com/williamliujl/CMExam.