Seeing Through Multiple Views: Parameter-Efficient Fine-Tuning via Selective Neurons for Consistent Radiology Report Generation

TL;DR

提出View-PNDF,通过选择性神经元实现多视角胸片报告一致性,显著提升生成质量。

cs.CV 🔴 高级 2026-06-30 19 次浏览
Yucheng Chen Jinjing Zhu Yang Yu Yufei Shi Hane Naghshbandi Jinhua Liu Angela S. Koh Fang Fen Kian Eng Ong Si Yong Yeo
医学影像 自然语言生成 多视角一致性 参数高效微调 神经网络

核心发现

方法论

本文提出View-PNDF框架,结合神经元级分析,识别并微调视角特异性神经元。包括:•视角神经元检测模块(VND),利用激活值和归因分数筛选出对特定视角响应的神经元;•神经元验证(VNV),通过扰动评估神经元对报告生成的影响,确认其视角特异性;•选择性微调(VNF),仅优化识别出的神经元,增强视角一致性。模型在Transformer解码器的线性和自注意力层中进行分析,利用特定数据集(如IU-XRay和MIMIC-CXR)验证效果。

关键结果

  • 在IU-XRay和MIMIC-CXR两个基准上,View-PNDF显著优于传统融合方法,BLEU-1提升至0.510(Hulu模型),ROUGE-L达0.396,临床评估指标(F1)提升至0.414,表现出优异的多视角一致性和诊断准确性。
  • 微调仅涉及少于5%的神经元,极大减少计算成本,同时保持模型的通用能力。神经元扰动验证显示,视角神经元的去激活导致报告质量明显下降(如MIMIC-CXR lateral视角得分从2.9降至0.3),确认其关键作用。
  • 利用LLMs(如GPT-4o)对视角特异性报告进行语义评估,超越传统指标,体现临床相关性。 Ablation研究表明,VND和VNV模块的引入显著改善多视角报告一致性。

研究意义

该研究突破了多视角胸片自动报告生成中的神经元层面理解,提出参数高效的微调策略,有效解决视角差异引起的诊断不一致问题。对于临床实践,提升报告的可靠性和准确性具有重要意义,特别是在缺少某一视角或多视角信息不一致时。该方法兼具模型解释性和实用性,为未来多模态医学AI提供理论基础和技术路径,推动智能诊断向更高精度、更高效率发展。

技术贡献

技术创新在于:•提出视角特异性神经元检测机制,结合归因分析和激活排序,精确识别关键神经元;•引入扰动验证策略,量化神经元对报告内容的影响,确保识别的有效性;•设计选择性微调方案,仅优化目标神经元,极大降低参数更新范围,提升训练效率。模型在Transformer架构中实现,结合大规模医学影像和文本数据,验证其在多视角一致性中的优势。

新颖性

本研究首次系统性分析Transformer模型中的视角特异性神经元,提出基于激活和归因的筛选方法,结合扰动验证,创新性地实现参数高效微调以增强多视角报告一致性。相较于传统多模态融合或全模型微调,方法更具解释性和效率,解决了视角差异带来的诊断不一致问题,填补了神经元层面理解的空白。

局限性

  • 当前方法依赖于预定义的视角标签,若视角识别不准确,可能影响神经元筛选效果;
  • 微调仅在特定模型架构(如Transformer)上验证,迁移到其他架构仍需验证;
  • 对极端视角变化或异常病例的适应性尚未充分评估,未来需加强鲁棒性研究。

未来方向

未来将探索多模态数据(如CT、MRI)中的神经元机制,拓展视角微调的适用范围。同时,结合强化学习优化神经元筛选策略,提升模型的自适应能力。还计划开发模型无关的微调方案,实现更广泛的临床应用,推动个性化诊断和决策支持系统的发展。

AI 总览摘要

近年来,医学影像自动报告生成(RRG)已取得显著进展,但多视角X光图像处理仍面临挑战。传统方法多采用特征融合,忽视不同视角间的潜在不一致性,导致诊断结果的可靠性不足。本文提出View-PNDF框架,从神经元层面出发,识别并微调视角特异性神经元,以实现多视角报告的一致性。该方法包括:视角神经元检测(VND),利用激活值和归因分析筛选关键神经元;神经元验证(VNV),通过扰动评估其对报告质量的影响;以及选择性微调(VNF),仅优化识别的神经元,显著减少参数更新量。实验证明,该方法在IU-XRay和MIMIC-CXR两个基准上,BLEU-1最高达0.510,ROUGE-L达0.396,临床F1指标提升至0.414,优于多种SOTA方法。通过LLM评估,视角特异性报告的语义一致性和临床相关性得到显著增强。该研究不仅提升了多视角胸片报告的质量,也为神经网络的可解释性和参数高效微调提供了新思路。未来,将扩展到多模态、多任务场景,推动医学AI的临床转化。

深度分析

研究背景

医学影像报告生成(RRG)经历了从基于规则到深度学习的演变。早期方法多依赖模板和规则,缺乏灵活性。近年来,Transformer架构和大规模预训练模型(如MedGemma、InternVL)推动了性能提升。多视角X光图像的临床价值已被广泛认可,尤其在肺部疾病诊断中,多个视角提供了更全面的解剖信息。现有多视角方法多采用特征融合策略,如多模态注意力机制,但未充分考虑视角间的内在差异,导致生成报告存在不一致和误诊风险。随着模型规模扩大和应用场景复杂化,如何实现视角间的协同一致成为亟待解决的问题。

核心问题

多视角X光图像在自动报告中的不一致性,主要源于模型未能有效捕捉视角特异性特征,导致不同视角生成内容矛盾。传统融合策略忽视了视角差异的内在机制,容易引发诊断误差,影响临床决策。如何在保证模型通用性的同时,增强视角特异性表达,成为核心难题。此外,现有方法缺乏对模型内部神经元层面机制的理解,难以实现高效参数微调和可解释性增强。

核心创新

创新点包括:1)提出视角特异性神经元检测机制,结合激活值和归因分析,精确识别关键神经元;2)引入扰动验证策略,量化神经元对报告内容的影响,确保识别的有效性;3)设计参数高效的选择性微调方案,仅优化目标神经元,减少训练成本。该方法在Transformer解码器中实现,结合大规模医学数据,显著提升多视角报告的一致性和临床准确性。不同于传统全模型微调或特征融合,该方案具有更强的解释性和效率,为多模态医学AI提供新思路。

方法详解

  • ��构建Transformer基础架构,分析线性和自注意力层中的神经元;•利用激活值和归因分数筛选视角响应神经元(VND);•通过扰动去激活神经元,验证其对报告质量的影响(VNV);•仅微调筛选出的神经元参数,优化视角特异性表达(VNF);•在IU-XRay和MIMIC-CXR数据集上进行训练,采用BLEU、ROUGE和LLM评估指标验证效果。

实验设计

采用IU-XRay和MIMIC-CXR两个公开数据集,分别进行70/10/20和平衡子集划分。对比多视角融合和单视角微调基线,评估指标包括BLEU、METEOR、ROUGE-L及LLM语义评分。模型超参数设定为学习率4×10^-6,训练1轮,批次为8。通过消融实验验证VND、VNV和VNF模块的贡献,分析神经元筛选的稳定性和微调效果。

结果分析

微调少于5%的神经元即可显著提升多视角报告质量,BLEU-1最高达0.510,ROUGE-L达0.396,F1临床指标提升至0.414。扰动验证显示,视角神经元的去激活导致报告质量大幅下降(如MIMIC-CXR lateral视角得分从2.9降至0.3),确认其关键作用。LLM评估显示,视角特异性报告语义一致性明显优于传统指标,验证了方法的有效性和临床相关性。

应用场景

该方法适用于多视角胸片自动报告、远程诊断和电子健康记录系统。只需提供视角标签和有限的微调样本,即可显著改善报告质量。未来可扩展到多模态影像(如CT、MRI)和多任务场景,推动智能诊断的标准化和个性化发展。

局限与展望

目前依赖于准确的视角识别,视角误差可能影响神经元筛选效果。模型微调仍需在特定架构上验证,迁移性有限。对极端病例和异常结构的适应性不足,未来需增强鲁棒性和泛化能力。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,菜谱上写着不同的菜肴,但每次做菜时,厨师会根据不同的食材和厨具调整做法。有些厨师特别擅长用某些工具或食材做特定菜肴。这个研究就像找出厨房里那些专门用来做特定菜的厨师(神经元),然后只训练他们,让整个厨房(模型)变得更擅长做多种菜肴(多视角报告)。这样一来,无论用哪个厨具或食材,厨师们都能合作得更好,做出一致又美味的菜肴(报告)。

简单解释 像给14岁少年讲一样

想象你在学校里,有很多不同的老师教不同的科目。有些老师特别擅长数学,有些老师擅长语文。每个老师都用不同的方法教课,但有时候他们会讲得不一样,让学生感到困惑。这篇文章就像是在找出那些专门教数学的老师(神经元),然后只帮他们多练习,让他们在讲数学题时更清楚、更一致。这样,不管哪个老师讲课,学生都能听得懂,也不会搞错。通过这样的方法,老师们变得更擅长自己教的科目,学生也学得更好啦!

原文摘要

Recent years have seen substantial advances in radiology report generation (RRG), yet existing approaches predominantly adopt direct feature fusion when handling multi-view X-ray images. Such approaches overlook the potential clinical inconsistencies and inaccuracies arising when a single model processes different views, adversely impacting performance and clinical reliability. To this end, we introduce View-PNDF (View-specific Pattern Neuron Detection and Fine-tuning), a parameter-efficient framework that fosters view-consistent report generation from a neuronal perspective. Specifically, View-PNDF comprises: (i) a view-specific neuron detection module identifying neurons responsive to particular views, (ii) a verification module quantifying the existence of these neurons, and (iii) a selective fine-tuning strategy strengthening detected neurons while preserving view-agnostic representations. By updating only view-specific neurons, View-PNDF achieves consistent diagnoses across different views with reduced computational costs. Subsequently, we employ Large Language Models (LLMs) to consolidate the view-specific reports into a complete radiology report. Furthermore, we use traditional Natural Language Generation (NLG) metrics-based assessment on integrated reports for baseline comparison and employ LLM-based assessment (e.g., GPT-4o) on view-specific reports to capture clinical significance. Extensive experiments on two medical RRG benchmarks demonstrate that View-PNDF substantially improves view-specific chest X-ray report generation quality while maintaining robust general-view performance.

cs.CV cs.AI