InfiMed: Low-Resource Medical MLLMs with Advancing Understanding and Reasoning

TL;DR

InfiMed采用反思增强的SFT和RLVR,提升低资源医学多模态模型性能,达7项基准SOTA。

cs.CL 🔴 高级 2025-05-29 47 次浏览
Zeyu Liu Zhitian Hou Guanghao Zhu Zhijie Sang Congkai Xie Hongxia Yang
多模态大模型 医学AI 低资源学习 反思链条推理 强化学习

核心发现

方法论

本文提出结合高质量文本推理数据与多模态医学数据的监督微调(SFT),引入反思模式注入的链式思考(CoT)以缓解数据稀疏问题。利用反思样式的生成策略,通过拒绝采样筛选高质量响应,结合基于规则的奖励函数(如Jaccard相似度)进行强化学习(RLVR),优化模型探索能力。具体算法包括Qwen2.5-VL-72B作为生成器,GRPO策略优化,结合格式与准确度奖励,训练InfiMed系列模型。

关键结果

  • InfiMed-RL-3B在七项医学多模态基准上平均准确率达59.2%,超越InternVL3-8B(57.3%)和MedGemma-4B-IT(54.8%),在参数规模相当的情况下表现优异。
  • 模型在188K SFT样本和36K RLVR样本训练后,展现出较强的推理、理解和反思能力,显著改善稀疏信息数据集的推理深度。
  • 引入反思模式的CoT显著提升模型在复杂推理任务中的表现,验证了反思机制在医学场景中的有效性。

研究意义

该研究突破了医学多模态模型在低资源环境下的性能瓶颈,提出结合反思机制的训练策略,有助于推动医学AI的可解释性与可靠性。模型在实际临床辅助、医学报告生成等场景中具有广泛应用潜力,尤其适合数据有限的医疗机构。其创新的训练框架为未来低资源医学AI模型提供了新思路,推动了AI在专业领域的深度融合。

技术贡献

本文创新性地融合反思模式注入的链式推理(CoT)与基于规则的强化学习(RLVR),实现低资源条件下模型推理能力的显著提升。提出的反思样式生成与筛选机制增强模型的自我校正能力,突破了传统微调依赖大量数据的局限。模型在参数规模有限的情况下,达到多项医学基准SOTA,展示了高效的训练策略和算法设计。此方法为医学AI模型提供了新的理论基础和工程实现路径。

新颖性

首次将反思模式注入链式推理用于低资源医学多模态模型训练,结合拒绝采样与规则奖励,有效缓解数据稀疏问题。不同于传统微调仅依赖大规模数据,本研究通过反思机制增强模型的推理深度与自我校正能力,实现参数有限条件下的性能突破。这一创新为医学AI模型的可解释性和鲁棒性提供了新范式。

局限性

  • 模型在极端稀疏或噪声较多的医学数据集上仍存在推理不准确的问题,反思机制的泛化能力有待验证。
  • 训练过程中对反思样式生成的依赖可能引入偏差,影响模型的稳定性与泛化。
  • 当前方法对硬件资源要求较高,未来需优化训练效率以适应更广泛的应用场景。

未来方向

未来将探索多模态反思机制的自适应调节,提升模型在不同医学任务中的泛化能力。计划结合更丰富的临床数据和多任务学习框架,增强模型的解释性和鲁棒性。此外,将研究模型在实际临床环境中的部署效果,推动AI辅助诊断的落地应用。

AI 总览摘要

近年来,随着多模态大模型(MLLMs)的快速发展,人工智能在视觉理解和数学推理等领域取得了突破性进展。然而,医学领域的应用仍面临重大挑战,主要源于高质量、多模态医学数据的稀缺与信息稀疏问题。传统微调方法依赖大量数据,难以充分挖掘有限资源中的推理潜能。为此,本文提出InfiMed系列模型,通过引入反思模式注入的链式思考(CoT)和基于规则的强化学习(RLVR),有效提升模型在低资源条件下的医学推理能力。

在训练策略上,作者结合高质量文本推理数据与多模态医学数据进行监督微调(SFT),同时利用反思样式生成机制,增强模型的自我校正能力。随后,通过拒绝采样筛选响应,并用规则奖励函数指导强化学习,模型探索更丰富的推理路径。实验结果显示,InfiMed-RL-3B在七项医学多模态基准中平均准确率达59.2%,超越参数规模相似的模型,展现出优异的性能。

该研究的核心创新在于反思机制的引入,显著改善了稀疏信息数据集中的推理深度,为低资源医学AI模型提供了新思路。模型不仅在推理准确性上取得突破,还增强了模型的可解释性和鲁棒性,为未来医学AI的临床应用奠定基础。尽管如此,模型在极端稀疏或噪声较多的场景中仍需优化,未来将关注多模态反思机制的自适应调节和实际部署效果。整体而言,本文为低资源医学多模态模型的研究提供了创新范式,推动了AI在专业医疗领域的深度融合与应用落地。

深度分析

研究背景

医学AI的发展经历了从规则基础到深度学习的演变,早期依赖专家知识与规则系统,逐步引入深度神经网络以提升诊断准确率。近年来,代表性工作如HuatuoGPT、Med-PaLM系列在医学问答和报告生成中表现出色,但多模态融合仍受限于数据稀缺。大模型如GPT-4、GPT-5在通用任务中表现优异,但在医学场景中受限于数据资源和推理深度。现有研究多依赖大规模训练,难以在低资源环境下实现高性能,且模型缺乏良好的可解释性。多模态医学数据集如PMC-15M、VQA-RAD、SLAKE等虽逐步丰富,但仍存在信息稀疏、标注不足的问题,制约模型推理能力的提升。整体来看,医学AI的核心挑战在于数据稀缺、推理深度不足与模型可解释性差,亟需创新训练策略和模型架构以突破瓶颈。

核心问题

当前医学多模态模型普遍面临数据稀疏和信息不足的问题,导致推理深度有限,难以满足临床复杂场景的需求。传统微调方法依赖大量标注数据,成本高昂且难以扩展。强化学习虽能提升探索能力,但在医学领域应用有限,缺乏有效的奖励机制和反思能力,限制模型的推理深度和可靠性。如何在有限资源下,增强模型的推理、理解和自我校正能力,成为亟待解决的核心难题。特别是在稀疏信息场景中,模型容易陷入浅层记忆,难以进行深层推理,影响临床决策的准确性和可信度。

核心创新

本研究提出反思增强的链式思考(CoT)与规则奖励的结合,创新性地缓解数据稀疏带来的推理不足。首先,利用高质量文本推理数据与多模态医学数据进行监督微调,恢复模型基础推理能力。其次,设计反思样式的CoT,注入不同推理轨迹,提升模型的自我校正和错误检测能力。再次,通过拒绝采样筛选响应,结合基于规则的奖励(如Jaccard相似度)进行强化学习(RLVR),引导模型探索更深层次的推理路径。最后,提出InfiMed系列模型,在参数规模有限的情况下,达到多项医学基准SOTA,验证了该方法的有效性。这一框架突破了传统微调对大规模数据的依赖,为低资源医学AI提供了新思路。

方法详解

  • �� 结合高质量文本推理数据与多模态医学数据进行监督微调(SFT),强化模型的基础推理能力。• 引入反思样式的链式思考(CoT),通过生成多样推理轨迹,提升模型的自我校正能力。• 利用拒绝采样筛选响应,将高质量响应与错误响应结合,增强训练样本多样性。• 设计基于规则的奖励函数(如Jaccard相似度)评估响应的准确性和格式,指导强化学习(RLVR)。• 采用GRPO策略优化,最大化优势函数,稳定训练过程。• 在训练中结合格式与准确度奖励,确保模型输出合理、准确,逐步提升推理深度与鲁棒性。

实验设计

采用7项医学多模态基准(如MMMU-H&M、VQA-RAD、SLAKE等),对比InfiMed系列与其他模型(如GPT-4、MedGemma等)。训练数据包括188K SFT样本与36K RLVR样本,参数规模为3B。指标主要为准确率,模型在不同任务中表现优异。通过消融实验验证反思机制和奖励设计的贡献,分析模型在稀疏信息场景中的表现差异。实验还包括模型推理深度、可解释性和鲁棒性评估,确保模型在实际应用中的可靠性。

结果分析

InfiMed-RL-3B在七项基准中平均准确率达59.2%,优于同规模模型InternVL3-8B(57.3%)和MedGemma-4B-IT(54.8%)。引入反思样式的CoT显著提升复杂推理任务的表现,验证了反思机制的有效性。模型在稀疏信息数据集中的推理深度明显增强,展示出良好的泛化能力。实验证明,结合反思与强化学习的训练策略在低资源条件下实现了性能突破,为医学AI提供了新范式。

应用场景

模型可应用于临床辅助诊断、医学报告自动生成、医学影像分析等场景,尤其适合数据有限的医疗机构。通过提升模型推理深度和解释性,有助于医生做出更准确的决策。未来还可结合电子健康记录、多模态影像等多源数据,拓展模型的应用范围,推动智慧医疗的发展。

局限与展望

模型在极端稀疏或噪声较多的医学数据中仍存在推理不准确的问题,反思机制的泛化能力有限。训练过程对硬件资源要求较高,模型的稳定性和可扩展性有待改进。未来需优化反思样式生成策略,提升模型在不同场景中的适应性和鲁棒性。

通俗解读 非专业人士也能看懂

想象你在一个工厂里工作,工厂里有很多不同的机器和流程。每台机器都需要按照一定的步骤操作,才能生产出合格的产品。现在,如果机器出现问题,工人需要自己判断哪里出错,然后修理它。这个工厂的目标是让机器能自己检查和修正错误,保证生产顺利。类似地,医学AI模型也是这样工作:它们需要理解各种医学图像和文本信息,自己判断是否合理,然后不断学习改进。引入反思机制就像让机器在出错时自己反思,找到问题所在,逐步变得更聪明、更可靠。这样,即使数据不多,它们也能像经验丰富的工人一样,做出准确的判断,帮助医生更好地诊断疾病。

简单解释 像给14岁少年讲一样

想象你在学校里学习,老师布置了很多作业。有时候题目很难,你会遇到不会的地方。为了弄懂,你会反复想,甚至试着用不同的方法解决问题。有时候你会发现自己之前的方法不对,然后反思改正。医学AI模型也是一样:它们要理解医学图像和文字,回答复杂的问题。有时候信息不完整或模糊,模型需要像你一样反思,找到问题所在,改正答案。作者设计了一种让模型自己反思的办法,就像你在学习中不断总结经验。这样,模型就能变得更聪明、更可靠,帮助医生做出更准确的判断。这个方法让AI在有限数据下,也能学会像专家一样推理和反思,变得更有用。

原文摘要

Multimodal Large Language Models (MLLMs) have achieved remarkable progress in domains such as visual understanding and mathematical reasoning. However, their application in the medical domain is constrained by two key challenges: (1) multimodal medical datasets are scarce and often contain sparse information, limiting reasoning depth; and (2) Reinforcement Learning with Verifiable Rewards (RLVR), though effective in general domains, cannot reliably improve model performance in the medical domain. To overcome these challenges, during the supervised fine-tuning (SFT) stage, we incorporate high-quality textual reasoning data and general multimodal data alongside multimodal medical data to efficiently enhance foundational medical capabilities and restore the base model's reasoning ability. Moreover, considering that there are some multimodal medical datasets with sparse information, we further synthesize reflective-pattern-injected chain-of-thought (CoT) in addition to general CoT samples, equipping the model with initial reflective reasoning capabilities that provide a structured foundation for subsequent RLVR training. Finally, we introduce our InfiMed-Series models, InfiMed-SFT-3B and InfiMed-RL-3B, both of which deliver state-of-the-art performance across seven multimodal medical benchmarks. Notably, InfiMed-RL-3B achieves an average accuracy of 59.2%, outperforming even larger models like InternVL3-8B, which achieves 57.3%. Specifically, during the SFT phase, we utilized 188K samples, while the RLVR phase incorporated 36K samples, demonstrating the efficacy of both training strategies in achieving superior performance. We also conducted a series of extensive experiments, which provide valuable insights that contribute to advancing the performance of MLLMs in medical scenarios.

cs.CL cs.AI