When Adaptation Hurts: Connecting Representational Drift to OOD Failures in MedSAM Fine-Tuning

TL;DR

本研究系统分析MedSAM微调策略对OOD泛化的影响,发现编码器LoRA增强鲁棒性,代表漂移与解码器层变化相关。

cs.CV 🔴 高级 2026-08-22 66 次浏览
Marko Haralović Sounic Akkaraju Carlo Baretta Vasil Zapryanov Alexia Briassouli
医学影像 模型微调 泛化能力 表示漂移 鲁棒性

核心发现

方法论

采用六种微调策略(全模型、编码器LoRA、浅深VPT、解码器微调、全微调)在ISIC 2018训练,评估在IN、close-OOD(PH2)及far-OOD(BUSI、CBIS-DDSM)数据集上的性能。引入噪声ROI提示(0-100像素抖动)测试鲁棒性。利用Centered Kernel Alignment(CKA)分析模型内部表示漂移,关联解码器层的表征变化与OOD性能下降。

关键结果

  • 全微调在IN和close-OOD表现最佳,far-OOD性能受损明显。编码器LoRA在远OOD环境中优于标准LoRA和VPT,保持较高鲁棒性(平均远OOD性能下降约0.043),优于其他微调策略。引入ROI提示抖动(0-100像素)显著提升模型鲁棒性,尤其在极端噪声条件下。CKA分析显示,远OOD性能下降与解码器层的表征漂移高度相关(相关系数达0.75以上),而编码器层相似性不足以解释鲁棒性差异。
  • 结果表明,限制LoRA只在编码器上微调,有助于保持解码器稳定,从而增强模型对分布漂移的适应能力。全微调虽性能优异,但计算成本高,编码器LoRA提供了较优的性能-效率折中方案。

研究意义

该研究揭示了在医学图像分割中,微调策略对模型泛化能力的深远影响,特别是在面对不同模态和域迁移时。通过分析内部表示漂移,提出了以解码器稳定性为核心的鲁棒性提升路径,为未来临床应用中的模型迁移和少样本微调提供理论基础。研究强调,模型在实际部署中应兼顾性能优化与分布保持,避免因过度微调引发的泛化退化。

技术贡献

提出结合CKA分析的微调策略评估框架,明确不同微调方式对模型内部表示的影响。引入编码器LoRA作为参数高效的鲁棒增强方案,系统验证其在远OOD场景中的优越性。实现多层次的提示噪声模拟,揭示提示鲁棒性与模型内部表征的关系,为模型微调提供新的理论指导。该工作首次系统关联表示漂移与模型泛化性能,为医学影像基础模型的稳健性设计提供新思路。

新颖性

首次在医学图像分割中系统比较六种微调策略在不同域迁移条件下的性能差异,结合CKA分析揭示解码器层的表征漂移与远OOD性能退化的关系。提出编码器LoRA在保持模型性能同时增强鲁棒性的创新方法,优于传统微调和其他参数高效策略。该研究填补了微调策略、提示鲁棒性和表示漂移之间关系的空白,为模型迁移提供理论基础。

局限性

  • 研究仅在皮肤和乳腺超声等有限模态上验证,泛化到其他模态(如CT、MRI)仍需验证。模型微调策略对不同任务和数据分布的适应性尚未全面评估,可能存在特定场景下的性能瓶颈。引入ROI提示噪声虽增强鲁棒性,但在实际临床中提示的噪声类型和程度可能更复杂,模型的鲁棒性提升有限。计算成本方面,虽然LoRA参数少,但在大规模部署时仍需考虑硬件资源和训练时间。

未来方向

未来将扩展多模态、多任务场景下的微调策略比较,结合自监督和对比学习进一步提升模型鲁棒性。探索更复杂的提示扰动和噪声模拟,模拟真实临床环境中的提示不确定性。结合模型压缩与加速技术,实现高效、稳健的临床部署。还将深入分析不同层级的表示漂移机制,优化微调方案以最大限度保持模型泛化能力。

AI 总览摘要

医学影像基础模型如MedSAM在多模态、多任务场景中展现出强大潜力,但其在实际临床应用中仍面临域迁移和提示噪声带来的挑战。本文系统比较了六种微调策略(全模型、编码器LoRA、浅深VPT、解码器微调、全微调)在IN、close-OOD和far-OOD数据上的表现,揭示了不同策略对模型鲁棒性的影响。研究发现,虽然全微调在目标域表现优异,但在远域迁移中性能显著下降,编码器LoRA则通过稳定解码器表征增强了鲁棒性,特别是在引入ROI提示噪声时表现出更强的适应能力。利用Centered Kernel Alignment(CKA)分析模型内部表示,结果显示远OOD性能退化与解码器层的表征漂移高度相关,而编码器层相似性不足以解释鲁棒性差异。这一发现强调了保持解码器稳定性的重要性,为未来模型设计提供新思路。通过引入ROI提示的随机抖动,模型在极端噪声环境下表现更优,验证了提示扰动在提升鲁棒性中的作用。总体而言,编码器LoRA在性能和效率之间提供了良好折中,适合临床实际部署。未来工作将拓展多模态、多任务场景,结合自监督学习优化模型鲁棒性,推动基础模型在临床中的广泛应用。

深度分析

研究背景

随着深度学习在医学影像中的广泛应用,基础模型如SAM及其变体在多模态、多任务场景中展现出强大能力。然而,临床环境中的域迁移、提示噪声和有限标注数据仍限制其应用。近年来,微调策略如LoRA、VPT被提出以降低成本、提升适应性,但在实际中表现出对提示质量和域变化的敏感性。已有研究关注模型在特定目标域的微调效果,缺乏系统分析不同微调策略对模型内部表示和泛化能力的影响。本研究旨在填补这一空白,系统比较六种微调策略在不同域迁移条件下的表现,结合表示相似性分析,揭示模型鲁棒性背后的机制。

核心问题

医学影像模型在实际应用中面临两个核心问题:一是提示噪声导致的ROI定位不准,影响模型性能;二是不同模态和医院间的域迁移,导致模型在新环境中性能下降。传统微调虽能提升目标域表现,但计算成本高且可能损失泛化能力。此外,提示的鲁棒性不足限制了模型在临床中的推广。如何在保证性能的同时增强模型对提示噪声和域变化的适应性,成为亟待解决的难题。

核心创新

本研究提出结合CKA分析的微调策略评估框架,首次系统比较六种微调方法在不同域迁移条件下的表现。引入编码器LoRA作为参数高效的鲁棒性增强方案,显著优于标准LoRA和VPT,特别是在远域迁移中。通过模拟ROI提示的随机抖动,提升模型在噪声环境下的稳定性。分析发现,保持解码器层的表征稳定性是提升远OOD性能的关键,提出限制LoRA只在编码器微调,避免解码器漂移,从而实现鲁棒性与性能兼顾的创新路径。

方法详解

  • �� 采用六种微调策略(全模型、编码器LoRA、浅深VPT、解码器微调、全微调)在ISIC 2018数据上训练。
  • �� 设计ROI提示噪声扰动(0-100像素抖动),在训练和测试中引入多级噪声。
  • �� 使用不同数据集(PH2、BUSI、CBIS-DDSM)评估模型在IN、close-OOD和far-OOD上的性能。
  • �� 利用CKA分析模型不同层的表示相似性,关联解码器漂移与性能变化。
  • �� 比较不同微调策略的参数量、训练时间和鲁棒性表现,验证编码器LoRA的优势。

实验设计

在8块GPU上训练,使用AdamW优化器,训练5轮,批次大小不同(全微调1,参数高效策略4),学习率从10^-5到10^-4调整。引入ROI提示抖动(0-200像素)模拟噪声,测试模型在不同噪声水平的鲁棒性。评估指标为Dice系数,比较不同微调策略在IN、close-OOD和far-OOD数据集上的性能变化。还进行CKA分析,统计表示漂移与性能的相关性,验证模型内部表征的稳定性对泛化的影响。

结果分析

全微调在IN和close-OOD表现优异(平均Dice提升约0.02),但在far-OOD中性能下降明显(平均下降0.05)。编码器LoRA在远域迁移中表现出更强鲁棒性(平均下降0.043),优于标准LoRA(0.176)和VPT。引入ROI提示抖动后,模型整体鲁棒性提升,尤其在极端噪声条件下效果明显。CKA分析显示,解码器层的表示漂移(相关系数超过0.75)与远OOD性能退化高度相关,编码器层相似性不足以解释鲁棒性差异。这表明保持解码器稳定性是提升泛化的关键。

应用场景

该研究为医学影像模型的临床部署提供指导,特别是在提示不精确或模态迁移场景中。通过选择参数高效的微调策略(如编码器LoRA),可以在保证性能的同时降低训练成本,增强模型的适应能力。未来可结合自监督学习,进一步提升模型在多模态、多任务环境中的鲁棒性,推动基础模型在实际临床中的广泛应用。

局限与展望

本研究主要在皮肤和乳腺超声数据上验证,泛化到其他模态(如MRI、CT)仍需验证。提示噪声模拟较为简单,未充分反映临床中复杂的提示不确定性。模型微调策略在不同任务和数据分布下的表现差异尚未全面评估,可能存在局限。计算成本虽低于全微调,但在大规模部署时仍需考虑硬件资源。未来需探索更复杂的提示扰动和多模态适应方案。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,食材代表模型的知识,厨具代表模型结构。平时用的厨具(模型)已经很熟练,但如果换了新厨具或食材(不同数据域),可能会做不好菜。微调就像调整厨具的使用方式,让它更适合新食材。不同的微调方法就像用不同的调料或烹饪技巧,有的只调整调料(编码器LoRA),有的则换掉厨具(全微调)。提示噪声就像厨房里的噪音或不准的量匙,影响菜的味道。研究发现,保持厨具(模型)中关键部分的稳定,能让菜在不同厨房环境下都好吃。这就像在厨房里找到最稳妥的调味方法,确保每次做出来的菜都不错。

简单解释 像给14岁少年讲一样

想象你在学校里参加比赛,老师给你一个任务,比如画一幅画。你平时画得很好,但如果老师给的题目不清楚或者你用的画笔有点坏(提示噪声),你可能画不好。这个研究就像在找最稳妥的方法,让你在题目不完美或者用的工具不好的情况下也能画出漂亮的画。科学家们试了很多办法,比如只调整画笔(编码器LoRA),或者用新的颜料(全微调),看看哪种方法能让你在各种情况下都表现得不错。结果发现,调整画笔(编码器)而不是换掉整幅画(全微调),能让你在题目不清楚或者工具不好的时候也能画得漂亮。这就像找到了一种既省力又稳妥的方法,能帮你在不同的比赛中都表现出色。

原文摘要

Foundation models for medical image segmentation, like prompt-based MedSAM, generalize well across domains and modalities, often in zero or few-shot setups. However, their performance depends on the quality of prompts and the adaptation of the models to custom datasets. This work systematically examines how MedSAM generalizes across diverse medical imaging benchmarks, with six adaptation strategies: full-model and encoder-only LoRA, shallow and deep visual prompt tuning (VPT), and decoder-only and full fine-tuning. Models are trained on the International Skin Imaging Collaboration Challenge (ISIC 2018) dataset and evaluated under clean and increasingly noisy prompts on IN and Out-of-Distribution (OOD) datasets: close-OOD PH2 (dermoscopy), far-OOD BUSI (Breast Ultrasound Images Dataset) and CBIS-DDSM (Curated Breast Imaging Subset of the Digital Database for Screening Mammography). We show that adaptation improves performance on IN and close-OOD data but often reduces performance on far-OOD data. Full fine-tuning provides the best tradeoff, while encoder-only LoRA is the strongest parameter-efficient alternative, outperforming standard LoRA and VPT under far-OOD shifts. Using Centered Kernel Alignment (CKA), we show that far-OOD degradation is strongly associated with drift in decoder representations, whereas encoder similarity alone does not explain robustness. This suggests encoder-only LoRA provides stronger robustness than standard LoRA by adapting the encoder to distribution shift in visual features, while preserving the decoder pathway. We further show that random 0-100 pixel jitter on prompts produces more robust and better performing models. We thus conclude that robust MedSAM adaptation requires the combined consideration of prompt noise exposure, domain shift, and representation preservation. We release our code: https://github.com/ImSounic/medsam-vpt

cs.CV