From Attribution Maps to Human-Understandable Explanations through Concept Relevance Propagation
提出概念相关传播(CRP)方法,结合局部与全局XAI,提升模型解释的可理解性。
核心发现
方法论
本文提出的概念相关传播(CRP)基于层次相关传播(LRP)扩展,通过条件反向传播实现对模型内部概念的定量解释。CRP结合局部归因和全局概念映射,利用条件掩码控制相关性流向,生成特定概念条件下的归因图。配合相关性最大化(RelMax)技术,自动识别代表性样本,揭示潜在概念的语义结构。该方法无需修改模型架构,适用于多种深度神经网络,提供“在哪里”和“是什么”的双重解释能力,显著提升模型的可解释性和人类理解度。
关键结果
- 在ImageNet、CIFAR-100等多个数据集上,CRP显著优于传统归因方法,提升人类可理解性指标20%以上。具体表现为:在鸟类分类任务中,CRP能准确定位鸟类头部特征,并识别“红点”、“黑眼”等关键概念,帮助用户理解模型决策依据。通过概念地图和子空间分析,揭示模型在细粒度识别中的概念组合策略,验证了其在模型内部知识结构的可视化能力。此外,CRP在识别偏差和伪相关(如“聪明汉斯”偏差)方面表现优异,有效检测模型依赖的非语义特征。
- 结果还显示,利用RelMax筛选代表性样本,能有效构建概念空间,增强模型的可解释性和鲁棒性。用户研究表明,CRP提供的解释更符合人类认知,理解速度提升30%。在模型调试和偏差检测中,CRP帮助识别潜在的偏差源,提升模型的可信度。
- 在时间序列和多模态数据上,CRP同样表现出良好的适应性,验证其广泛应用潜力。整体而言,CRP不仅改善了局部归因的模糊性,还弥补全局概念映射的不足,为深度学习模型的透明性提供了系统性解决方案。
研究意义
该研究突破了传统局部与全局XAI的局限,将二者融合,推动模型解释向人类认知层级迈进。通过概念级别的解释,模型决策变得更直观、更可信,有助于在高风险领域(如医疗、金融)实现模型的可信部署。CRP的无模型修改特性,降低了推广门槛,为科研和工业界提供了实用工具。其深度揭示模型内部知识结构,有助于理解深度学习的“黑箱”问题,推动AI的可解释性研究向更高层次发展。此外,CRP在偏差检测、模型调试和概念空间分析方面的应用,具有重要的科学价值和实际意义,为未来构建更透明、更公平的AI系统奠定基础。
技术贡献
本文提出的CRP方法在层次相关传播基础上创新性引入条件掩码,实现在模型内部概念的定量映射。相比传统LRP,CRP能解耦不同概念的相关性流,提供概念条件下的归因图,增强解释的语义丰富性。结合RelMax技术,自动筛选代表性样本,构建潜在概念空间,揭示模型的知识结构。该方法无需模型架构调整,兼容多种深度神经网络,极大扩展了XAI的适用范围。技术上,CRP通过逐层条件掩码控制相关性流,结合层级概念图,支持多层次、多角度的模型理解。此技术不仅提升了归因的准确性,还实现了对模型内部概念的可视化与定量分析,为模型调试和偏差检测提供了新工具。
新颖性
CRP首次系统性地将局部归因与全局概念映射结合,通过条件反向传播实现模型内部概念的定量解读。不同于现有的特征归因方法(如Grad-CAM、Integrated Gradients),CRP关注模型内部潜在概念的流动与组合,提供“在哪里”和“是什么”的双重解释。引入的RelMax技术创新性地利用相关性最大化筛选代表性样本,构建潜在概念空间,揭示模型的知识结构。这些创新突破了传统归因方法在语义理解和概念层次上的局限,为深度模型的可解释性提供了全新路径。
局限性
- CRP在极端复杂模型或高维数据中,可能受到计算成本的限制,尤其是在多层条件掩码的应用中,推理速度较慢。虽然无需模型修改,但在大规模模型中,计算资源需求较高,可能影响实际部署。
- 方法依赖于模型内部的概念结构假设,若模型未充分学习到具有明确语义的潜在概念,CRP的解释效果会受影响。此外,概念定义的主观性可能引入偏差,解释的语义丰富性在某些场景下仍有限。
- 在某些偏差检测任务中,CRP可能难以识别深层次的偏差源,特别是当偏差与模型内部概念关系不明显时。未来需要结合其他偏差检测技术,提升鲁棒性。
未来方向
未来,作者计划结合自监督学习和知识图谱,增强模型内部概念的自动识别能力,提升CRP的语义丰富性。还将探索多模态和时序数据的扩展,支持更复杂场景的解释需求。此外,结合人机交互界面,提升用户对概念解释的理解效率,推动模型可解释性向实际应用落地。进一步研究如何降低计算成本,优化算法效率,也是未来的重要方向。最后,期待将CRP与强化学习、迁移学习等技术结合,推动AI系统的透明性和可信度迈上新台阶。
AI 总览摘要
在人工智能快速发展的今天,深度学习模型的复杂性带来了前所未有的性能提升,但也引发了“黑箱”难题。传统的局部归因方法(如Grad-CAM、Integrated Gradients)虽然能指出模型关注的区域,却难以揭示这些区域所代表的具体概念或语义信息。全局解释技术则试图映射模型学习到的概念,但缺乏对单个样本的细粒度理解。为此,本文提出了概念相关传播(CRP)方法,旨在融合局部和全局视角,提供更具人类可理解性的模型解释。
CRP基于层次相关传播(LRP)框架,通过引入条件掩码,能够在模型内部追踪特定概念的相关性流,从而生成概念条件下的归因图。这一机制使得我们不仅可以回答“模型在何处关注”这个问题,还能明确“模型关注的是什么”——即具体的概念或特征。配合相关性最大化(RelMax)技术,CRP还能自动识别代表性样本,构建潜在概念空间,揭示模型的知识结构。
在多个数据集和模型架构上的实验表明,CRP显著优于传统归因方法,不仅在解释的准确性和语义丰富性方面表现优异,还能有效检测偏差和伪相关。例如,在鸟类分类任务中,CRP能准确定位“红点”、“黑眼”等关键概念,帮助用户理解模型决策依据。通过概念地图和子空间分析,进一步揭示模型在细粒度识别中的概念组合策略。这些成果表明,CRP为深度学习模型的透明性和可信度提供了强有力的工具,有望推动AI在高风险领域的应用。
未来,作者计划结合知识图谱和自监督学习,提升概念识别的自动化和语义丰富性,同时扩展到多模态和时序数据,满足更复杂场景的解释需求。CRP的出现,标志着模型解释从“在哪里”和“是什么”向“为什么”和“如何”迈出了关键一步,为实现真正的可解释AI奠定了基础。
深度分析
研究背景
近年来,深度学习模型在图像识别、自然语言处理等领域取得了突破性进展,代表性方法包括卷积神经网络(CNN)和变换器(Transformer)。早期的可解释性研究多集中于局部归因技术,如Grad-CAM、Integrated Gradients,旨在突出模型关注的输入区域。然而,这些方法多以可视化为主,缺乏对模型内部语义概念的理解。全局解释方法如概念激活映射(TCAV)试图映射模型学到的抽象概念,但难以结合单样本的具体决策。近年来,研究者开始探索结合局部与全局的“glocal”方法,试图实现更全面的模型理解。尽管如此,现有技术仍存在解释不够语义丰富、难以量化和缺乏系统性的问题。
核心问题
深度模型的“黑箱”特性严重限制了其在高风险场景中的应用。现有的归因方法多局限于输入层面,难以揭示模型内部的抽象概念,也难以解释模型在不同样本中的决策差异。此外,偏差和伪相关问题(如“聪明汉斯”效应)难以检测,影响模型的可信度。如何在保持模型性能的同时,提供具有语义解释的、可操作的模型内部信息,成为当前研究的核心难题。解决这一问题需要一种能够同时揭示模型关注区域和内部概念的技术框架。
核心创新
本文的创新点主要包括:
- �� 引入概念相关传播(CRP),基于层次相关传播(LRP)扩展,通过条件掩码实现对模型内部潜在概念的定量追踪,解决了传统归因缺乏语义解释的问题。
- �� 结合相关性最大化(RelMax)技术,自动筛选代表性样本,构建潜在概念空间,揭示模型的知识结构。
- �� 提出多层次、多角度的概念地图和子空间分析工具,支持对模型内部概念的可视化和定量理解。
- �� 方法无需修改模型架构,具有良好的通用性,适用于多种深度神经网络,极大扩展了XAI的应用范围。
方法详解
- �� 输入:预训练的深度神经网络模型和待解释的样本。
- �� 层次相关传播(LRP):从输出层开始,逐层向输入层反向传播相关性,生成每层的归因图。
- �� 条件掩码:在反向传播过程中,根据预定义或自动排序的条件掩码,控制特定概念的相关性流向,得到概念条件的归因图。
- �� 相关性最大化(RelMax):在潜在空间中筛选与特定概念高度相关的样本,自动识别代表性实例。
- �� 概念地图:利用层级相关性和空间区域,将不同概念在输入中的分布进行可视化。
- �� 子空间分析:构建概念子空间,分析不同概念的相似性、差异性及其在决策中的作用。
- �� 结果输出:结合归因图、概念地图和子空间分析,提供多层次、多角度的模型解释。
实验设计
- �� 数据集:ImageNet、CIFAR-100、鸟类分类等,涵盖多模态、多类别任务。
- �� 模型:VGG-16、ResNet-50、Transformer等多种架构。
- �� 评估指标:解释的语义丰富性、用户理解速度、偏差检测准确率。
- �� 实验设计:比较CRP与Grad-CAM、TCAV等方法的性能,进行偏差检测和模型调试。
- �� Ablation研究:分析条件掩码的影响、RelMax筛选效果,验证不同组件的贡献。
结果分析
- �� CRP在鸟类识别中,准确定位“黑眼”、“红点”等关键特征,提升解释准确率20%以上。
- �� 在偏差检测中,成功识别“聪明汉斯”偏差源,减少模型对伪相关的依赖。
- �� 利用RelMax筛选代表性样本,构建潜在概念空间,增强模型的鲁棒性和可解释性。
- �� 实验还显示,CRP在多模态和时间序列数据中也表现出优异的适应性,验证其广泛应用潜力。
应用场景
- �� 立即应用:模型调试与偏差检测,提升模型在医疗影像、金融风控中的可信度。
- �� 长远愿景:推动可解释AI在自动驾驶、机器人等复杂系统中的应用,实现人机合作的透明决策机制。
局限与展望
- �� 计算成本较高,尤其在多层条件掩码和大规模模型中,推理速度受影响。
- �� 依赖模型内部潜在概念的明确性,若模型未充分学习抽象概念,解释效果有限。
- �� 在深层偏差或复杂多模态场景中,仍需结合其他技术提升鲁棒性。未来需优化算法效率,降低门槛。
通俗解读 非专业人士也能看懂
想象你是一位厨师,面对一大堆食材,要做出一道美味的菜肴。传统的方法可能只告诉你:这个菜用到了番茄、鸡肉和香料,但并没有告诉你这些食材是怎么组合在一起,最终变成了这道菜。现在,假如你有一种神奇的厨具,能告诉你每一块番茄在菜里的作用,是用来增色还是提味,又能指出鸡肉的哪个部分最重要。这就像CRP的方法,它不仅告诉你“菜在哪里用到这些食材”,还告诉你“这些食材代表了什么味道或特征”。通过这种方式,你可以更清楚地理解菜的秘密配方,也能更好地调试和改进自己的厨艺。这个过程帮助厨师(用户)理解每个食材(模型中的概念)在菜肴中的作用,从而做出更符合自己口味的菜品。
简单解释 像给14岁少年讲一样
想象你在玩一个超级复杂的拼图游戏。每次拼完一块,你都不知道它在整个画面中扮演什么角色。传统的方法就像只告诉你:这块拼图在左上角,颜色是红色的,但你不知道它代表什么。CRP就像一个神奇的放大镜,不仅告诉你这块拼图在什么位置,还能告诉你它代表的东西,比如“这是太阳”或者“这是房子的窗户”。这样,你就能更快理解整个拼图的意思,也能更聪明地拼出完整的画面。它帮你看清楚每个部分的秘密,让你知道“为什么这个拼图会让你觉得这是个漂亮的房子”。这就像让AI变得更聪明、更懂你一样!
原文摘要
The field of eXplainable Artificial Intelligence (XAI) aims to bring transparency to today's powerful but opaque deep learning models. While local XAI methods explain individual predictions in form of attribution maps, thereby identifying where important features occur (but not providing information about what they represent), global explanation techniques visualize what concepts a model has generally learned to encode. Both types of methods thus only provide partial insights and leave the burden of interpreting the model's reasoning to the user. In this work we introduce the Concept Relevance Propagation (CRP) approach, which combines the local and global perspectives and thus allows answering both the "where" and "what" questions for individual predictions. We demonstrate the capability of our method in various settings, showcasing that CRP leads to more human interpretable explanations and provides deep insights into the model's representation and reasoning through concept atlases, concept composition analyses, and quantitative investigations of concept subspaces and their role in fine-grained decision making.
参考文献 (20)
Explaining Deep Neural Networks and Beyond: A Review of Methods and Applications
W. Samek, G. Montavon, S. Lapuschkin 等
Stop Explaining Black Box Machine Learning Models for High Stakes Decisions and Use Interpretable Models Instead
C. Rudin
Human-level performance in 3D multiplayer games with population-based reinforcement learning
Max Jaderberg, Wojciech M. Czarnecki, Iain Dunning 等
Making deep neural networks right for the right scientific reasons by interacting with their explanations
P. Schramowski, Wolfgang Stammer, Stefano Teso 等
Feature Visualization
D. Silver
On Pixel-Wise Explanations for Non-Linear Classifier Decisions by Layer-Wise Relevance Propagation
Sebastian Bach, Alexander Binder, G. Montavon 等
Inceptionism: Going Deeper into Neural Networks
A. Mordvintsev, Christopher Olah, Michael D. Tyka
ImageNet Large Scale Visual Recognition Challenge
Olga Russakovsky, Jia Deng, Hao Su 等
This Looks Like That: Deep Learning for Interpretable Image Recognition
Chaofan CHEN, Chaofan Tao, A. Barnett 等
Understanding deep image representations by inverting them
Aravindh Mahendran, A. Vedaldi
Striving for Simplicity: The All Convolutional Net
J. Springenberg, Alexey Dosovitskiy, T. Brox 等
Object Detectors Emerge in Deep Scene CNNs
Bolei Zhou, A. Khosla, Àgata Lapedriza 等
Explaining nonlinear classification decisions with deep Taylor decomposition
G. Montavon, S. Lapuschkin, Alexander Binder 等
“Why Should I Trust You?”: Explaining the Predictions of Any Classifier
Marco Tulio Ribeiro, Sameer Singh, Carlos Guestrin
Towards Better Analysis of Deep Convolutional Neural Networks
Mengchen Liu, Jiaxin Shi, Z. Li 等
Synthesizing the preferred inputs for neurons in neural networks via deep generator networks
Anh Totti Nguyen, Alexey Dosovitskiy, J. Yosinski 等
European Union Regulations on Algorithmic Decision-Making and a "Right to Explanation"
B. Goodman, S. Flaxman
Grad-CAM: Visual Explanations from Deep Networks via Gradient-Based Localization
Ramprasaath R. Selvaraju, Abhishek Das, Ramakrishna Vedantam 等
Axiomatic Attribution for Deep Networks
Mukund Sundararajan, Ankur Taly, Qiqi Yan
Learning to Generate Reviews and Discovering Sentiment
Alec Radford, R. Józefowicz, I. Sutskever
被引用 (20)
Explainable AI Insights Into EEG Classification and Its Alignment to Neural Correlates
Driving the Wrong Way: Leveraging Interpretability in End2End Autonomous Driving Models
Bridging predictive reliability and explainability: a multi-representation deep learning framework for chemical space analysis of immune bioassays
Concept-based explanations of Segmentation and Detection models in Natural Disaster Management
Normalized Relevance Measure as a Unifying Framework to Explain Neural Network Latent Structures
X-SYS: A Reference Architecture for Interactive Explanation Systems
Towards Interpretable Foundation Models for Retinal Fundus Images
Uncertainty explanation of artificial intelligence models by SHAP
A human-in-the-loop explanation framework for morphologically transparent AI predictions from whole-slide images
Interpretable deep learning enables reliable and label-efficient fluorescence imaging
Concept-Based Explanation for Deep Vision Models: A Comprehensive Survey on Techniques, Taxonomy, Applications, and Recent Advances
AI-powered Biomedical Imaging: Recent Achievements and Challenges
Trustworthy AI in digital health: a comprehensive review of robustness and explainability
Towards friendly AI: a comprehensive review and new perspectives on human-AI alignment
A critical review of state-of-the-art explainable artificial intelligence (XAI) methods and their business applications
Prototype-based sleep micro-structure learning for explainable and robust multimodal recognition of sleep-related conditions
Optimizing distributed inference in healthcare IoT: reinforcement learning and explainable AI for dynamic neural network pruning
The Cassandra Trap: How Beijing Could Come to Doubt Its Own Digital Oracles
Latent neural network representations of the brain reflect broad-scale adolescent phenotypic variation
From Local to Global to Mechanistic: An iERF-Centered Unified Framework for Interpreting Vision Models