Iterative Erasure Count Is Not an Affine-Invariant Concept Dimension

TL;DR

本研究揭示迭代消除次数非仿射不变的概念维度,区分模型定义与程序定义的量,强调测量过程对代表性几何的影响。

stat.ML 🔴 高级 2026-08-11 112 次浏览
Tingan Jin Shuhang Dong Haosong Li Chung-Hsien Chou
神经网络解释 线性探测 几何变换 概念维度 算法分析

核心发现

方法论

本文采用人口高斯模型构建,结合逆变换分析,探讨不同线性消除算法(如 Moore–Penrose 最小二乘和全 QR 方法)在不同参数变换下的表现。通过定义生成维度、充分线性维度和最小守护秩等模型内量,区分程序定义的停止次数和累积编辑秩等操作性指标。利用仿射变换(如剪切变换)验证这些指标的仿射等变性,发现即使在信息保持的变换下,累积欧几里得消除次数也会发生变化。实验还包括在有限样本的 Adam/QR 校准中观察到的停止次数变化,以及在冻结 V-JEPA2 特征上的控制性重参数化,验证了测量过程对几何的影响。整体方法结合理论推导与数值模拟,系统分析了代表性几何与测量程序的关系。

关键结果

  • 在高斯人口模型中,逆剪切变换保持预测任务和生成维度、充分线性维度、最小守护秩不变,但累积欧几里得消除次数从1变为2,证明操作指标依赖于参数化方式。
  • 在匹配视频分析的全 QR 两输出方案中,累积编辑秩从2变为4,即使在固定的充分维度和守护秩下,指标也不保持不变,揭示其程序依赖性。
  • 通过仿射变换的传输定理,证明完整的累积度量轨迹在正定度量、探针、正则化器和打破平衡的条件下保持仿射等变性,强调指标的程序依赖性而非固有语义。
  • 在有限样本的 Adam/QR 校准中,20次大样本实验中,身份混合在所有情况下只停止一次,而不同剪切变换(如0.5、0.75、1、1.25、2)都至少接受两次更新,验证了重参数化对操作路径的影响。
  • 对冻结的 V-JEPA2 特征进行受控重参数化,虽然保持零阶预测,但会改变后续欧几里得轨迹,说明测量指标受参数化影响,强调其程序性特征。

研究意义

本研究深刻揭示了代表性几何与操作指标之间的关系,挑战了将迭代消除次数作为固有概念维度的假设。通过理论证明和实验证明,操作指标高度依赖于测量程序和参数化方式,强调了在解释神经网络内部表征时应关注几何与过程的关系。这对于理解模型的分布式编码、设计更稳健的解释方法具有重要意义,也提醒研究者避免将操作指标误解为固有语义特征。研究成果推动了代表性几何的理论基础,为未来在模型解释、可解释性和神经符号系统中的应用提供了新的视角。

技术贡献

本文提出了关于迭代消除次数非不变性的严格理论分析,证明了在不同参数变换下,操作指标(如累积编辑秩)可以发生离散变化,即使在信息保持的条件下。引入了完整的仿射等变轨迹定理,明确了指标的程序依赖性,区别了模型定义的量(生成维度、充分线性维度、守护秩)与操作定义的量(停止次数、累积编辑秩)。此外,结合有限样本的 Adam/QR 校准和受控重参数化实验,验证了参数化对代表性几何的影响,强调了测量过程的几何敏感性。这些贡献丰富了神经网络内部表征的几何理解,为未来的模型解释和操作指标设计提供了理论基础。

新颖性

本研究首次系统性地证明了迭代消除次数作为概念维度的非不变性,揭示了操作指标的程序依赖性。通过引入逆变换分析和完整轨迹仿射等变定理,明确了指标的几何和程序关系,区别了模型定义的量与操作定义的量。这一发现挑战了传统将消除次数作为固有语义指标的观点,为理解神经表征的分布式编码提供了新的理论视角。与以往只关注线性探测或单一指标的研究不同,本文强调了测量过程和参数化方式对代表性几何的影响,具有重要的理论创新和实践意义。

局限性

  • 本文主要基于高斯人口模型和理想化的线性假设,实际神经网络中的非线性和复杂交互可能影响指标的表现和解释。
  • 实验多集中在有限样本和特定算法(如 Adam/QR),尚未充分验证在大规模深度模型和多样化任务中的普适性。
  • 指标的程序依赖性虽被理论证明,但在实际应用中,如何量化和控制这种依赖仍存在挑战,特别是在非线性和非高斯环境中。
  • 未来需要探索更复杂的几何变换和非线性操作对指标的影响,以及如何设计稳健的代表性测量方法。

未来方向

未来研究将聚焦于非线性变换和深度网络中的几何特性,扩展理论框架以涵盖非高斯分布和非线性激活。探索更鲁棒的指标设计,减少程序依赖性,提升解释的固有性。同时,结合大规模模型的实证分析,验证理论在实际场景中的适用性。还计划开发新的算法,能够在复杂环境中保持指标的稳定性,为神经网络的可解释性和符号化提供更坚实的基础。

AI 总览摘要

在神经网络的内部表征中,理解概念的维度和分布一直是核心难题之一。传统方法多依赖线性探测器,通过逐步消除探测方向,试图量化模型中编码某一概念的“维度”。然而,这些操作指标(如停止次数和累积编辑秩)是否真正反映了固有的语义维度,却一直存在争议。本文通过严密的理论分析和数值验证,揭示了这些指标的程序依赖性,特别是在参数化变换(如剪切变换)下的非不变性。研究首先构建了人口高斯模型,证明在信息保持的逆变换下,生成维度和守护秩保持不变,但操作指标(如累积欧几里得消除次数)会发生离散变化。随后,作者提出了完整的仿射等变轨迹定理,说明在特定条件下,指标的变化仅由测量程序引起,而非固有语义。这一发现对神经网络解释提出了深刻挑战,提醒研究者应关注代表性几何与测量过程的关系,而非单纯依赖操作指标作为固有维度的代理。实验部分,包括在有限样本的 Adam/QR 校准和冻结 V-JEPA2 特征上的重参数化,验证了参数化对操作路径和指标的影响,进一步强调了测量过程的几何敏感性。整体来看,本文不仅提供了理论基础,也为未来设计稳健的代表性测量工具提供了指导,推动了神经网络内部表征的深层理解。

深度分析

研究背景

近年来,神经网络内部表征的解释成为研究热点。线性探测器被广泛用于判断模型是否编码某一概念,早期工作如 probing 方法和 INLP(迭代空零空间投影)试图量化编码的维度。随着模型规模的扩大,研究逐渐关注分布式编码和几何结构,诸如特征空间的线性子空间、交叉协方差和守护秩成为重要指标。尽管如此,关于这些指标的固有性和操作性之间的关系仍存在争议。许多研究假设操作指标可以代表固有的语义维度,但缺乏严格的理论验证。近年来,学者们开始关注参数化变换(如仿射变换)对代表性几何的影响,强调模型内部的几何结构可能受到重参数化的影响,导致指标的非固有性。本文在此背景下,提出了系统的理论分析,试图澄清操作指标的本质属性,特别是在不同参数化方式下的表现差异。

核心问题

核心问题在于,迭代消除次数是否可以作为固有的概念维度指标。传统观点认为,逐步消除探测方向直到失败,停止次数反映了模型中编码该概念的维度。然而,这一假设忽视了操作过程的程序依赖性。不同的参数化变换(如剪切、旋转)可能改变操作指标的数值,即使代表的语义信息未发生变化。更具体地说,操作指标可能受到特征空间的几何变换、正则化策略和停止规则的影响,而非固有的语义属性。这使得将操作指标作为固有概念维度的依据变得不可靠,亟需理论验证和实证检验。

核心创新

本文的创新在于,首次系统性地证明了迭代消除次数在不同参数化变换下的非不变性。通过引入逆变换分析和完整的仿射等变轨迹定理,明确了操作指标的程序依赖性,区分了模型定义的量(生成维度、充分线性维度、守护秩)与操作定义的量(停止次数、累积编辑秩)。此外,结合高斯人口模型和有限样本的实验,验证了指标在不同变换下的离散变化,彰显其程序性特征。这一理论突破挑战了传统将消除次数作为固有语义指标的观点,为理解神经表征的分布式编码提供了新的视角。

方法详解

  • �� 构建人口高斯模型,定义潜在概念变量S和无关噪声N,生成标签Y和特征X,确保模型的生成和充分线性维度为1。• 通过逆变换(如剪切变换)分析不同参数化对指标的影响,验证生成维度和守护秩的保持。• 引入完整的仿射等变轨迹定理,证明在特定条件下,指标(如累积编辑秩)在参数变换下的仿射等变性。• 设计多种线性消除算法(如 Moore–Penrose 最小二乘和全 QR 方法),在不同参数化变换下测试停止次数和累积秩的变化。• 结合有限样本的 Adam/QR 校准实验,观察指标在实际训练中的变化,验证理论分析的实际意义。• 通过冻结 V-JEPA2 特征,进行受控重参数化,验证参数化对后续欧几里得轨迹的影响,强调测量过程的几何敏感性。

实验设计

实验采用高斯人口模型和实际神经网络特征(如V-JEPA2和DINOv2),验证指标的非不变性。模型中定义了潜在概念S和噪声N,通过不同的线性变换(剪切、旋转)生成多组特征X,测试在多种算法(如 Moore–Penrose 最小二乘和全 QR)下的停止次数和累积秩变化。实验证明,尽管生成维度和守护秩保持不变,操作指标在参数变换后发生离散跳跃。例如,逆剪切变换将累积欧几里得消除次数从1变为2,或将全 QR 的累积秩从2变为4。还在有限样本的 Adam/QR 校准中观察到类似变化,验证指标的程序依赖性。最后,冻结特征后进行受控重参数化,验证后续欧几里得轨迹的变化,强调测量过程的几何敏感性。

结果分析

实验证明,操作指标(如累积欧几里得消除次数)在参数变换(如剪切)后会发生离散变化,且变化不影响生成维度和守护秩。例如,逆剪切变换使累积次数从1变为2,QR累积秩从2变为4,显示指标依赖于参数化方式。有限样本的 Adam/QR 校准中,受控重参数化导致指标路径变化,验证了测量过程的几何敏感性。冻结特征后,参数化影响后续欧几里得轨迹,说明指标的程序性特征。理论和实验证明,指标的变化由测量程序引起,而非固有语义,强调了操作指标的程序依赖性。

应用场景

这些发现对模型解释和调试具有重要意义。研究者可以利用这些指标评估模型内部信息的分布,但需注意其程序依赖性。未来,设计更稳健的代表性测量工具,有助于提升模型的可解释性和鲁棒性。在实际应用中,理解指标的几何和程序关系,有助于改进模型调优策略,避免误判模型的语义编码能力。长远来看,这些理论基础能推动神经网络的符号化和可解释性研究,为构建更透明、更可信的AI系统提供支撑。

局限与展望

本文主要基于高斯人口模型和线性假设,实际神经网络中的非线性和复杂交互可能影响指标的表现。实验多集中在有限样本和特定算法(如 Adam/QR),尚未充分验证在大规模深度模型中的普适性。指标的程序依赖性虽被理论证明,但在实际应用中,如何量化和控制这种依赖仍存在挑战。未来需要扩展到非线性和非高斯环境,探索更鲁棒的指标设计和几何理解方法。

通俗解读 非专业人士也能看懂

想象你在一家工厂里工作,工厂里有许多不同的机器,每台机器都在做不同的事情。你想知道这些机器是否都在做同一件事,比如装配一个玩具。传统的方法是逐个检查每台机器,直到发现某台机器不再参与装配,然后停止。这个过程就像在神经网络中逐步消除探测方向,直到模型不能再编码某个概念。可是,你会发现,不同的工厂布局(参数化方式)可能让你需要检查的步骤数不同,即使它们都在做同样的事情。本文发现,这个检查的步骤数(停止次数)其实依赖于你怎么布置工厂(参数化),而不是机器真正的工作内容。这意味着,不能简单地用这个步骤数来衡量机器的工作量或概念的大小。研究用数学模型证明了这一点,并在实际的神经网络特征上验证了。最终,作者提醒我们,要理解神经网络的内部信息,不能只看操作步骤,还要考虑整个测量过程和几何关系。

简单解释 像给14岁少年讲一样

想象你在玩一个拼图游戏,你试图找到拼图中代表“苹果”的那一块。你开始一块一块地拿掉拼图上的碎片,直到只剩下“苹果”这个概念。这个过程就像在神经网络里逐步“消除”信息,看看剩下的部分还能告诉你“苹果”。但问题是,这个消除的步骤数可能会因为你用的工具或方法不同而变化,就像用不同的放大镜或手势去拆拼图一样。有时候,用一种方法你只需要拆两次就找到“苹果”,用另一种方法可能要拆四次。研究发现,这个步骤数其实不是“苹果”本身的固有特征,而是和你拆拼图的方法紧密相关。换句话说,不能只靠这个步骤数来判断“苹果”有多大、多重要。科学家用数学证明了这个道理,还在电脑模拟中验证了。这个发现告诉我们,要理解神经网络里的信息,就不能只看表面上的操作次数,还要考虑整个“拆拼图”的过程和工具。这样,我们才能更准确地知道模型到底学到了什么,避免误解它的“思考方式”。

原文摘要

How many directions does a neural representation use to encode a concept? A common answer repeatedly erases probe directions and reports the stopping count or cumulative removed rank. We show that both quantities can change under an information-preserving invertible reparameterization, so neither is intrinsically a concept dimension. We distinguish model-defined population quantities (generating dimension, sufficient linear dimension, and minimum guarding rank) from procedure-defined quantities such as stopping count and cumulative edit rank. In a population Gaussian construction, an invertible shear preserves the prediction problem and all three quantities, yet changes the cumulative Euclidean erasure count from one to two. The separation holds for Moore--Penrose ordinary least squares and every finite nonnegative ridge weight. For a two-output full-QR procedure matching our motivating video analysis, cumulative edit rank similarly changes from two to the ambient dimension four. Conversely, the complete cumulative metric-QR trajectory is affine-equivariant when its positive-definite metric, probe, regularizer, and tie-breaking are transported consistently; exact covariance is one corollary, not a canonical semantic metric. In a known-rank finite-sample Adam/QR calibration, identity mixing stops after one accepted update in all 20 large-sample runs, whereas each tested shear $a\in\{.5,.75,1,1.25,2\}$ accepts at least two updates in all 20 runs. Controlled reparameterizations of frozen V-JEPA2 features preserve rank-zero predictions yet alter later Euclidean trajectories under practical optimization. These visual contact experiments are stress tests, not estimates of contact dimension. Iterative erasure therefore returns a procedure-relative estimand jointly determined by representation geometry and the full measurement procedure, not a semantic dimension by itself.

stat.ML cs.CV cs.LG

参考文献 (20)

LEACE: Perfect linear concept erasure in closed form

Nora Belrose, David Schneider-Joseph, Shauli Ravfogel 等

2023 253 引用 ⭐ 高影响力 查看解读 →

Better Hit the Nail on the Head than Beat around the Bush: Removing Protected Attributes with a Single Projection

Pantea Haghighatkhah, Antske Fokkens, Pia Sommerauer 等

2022 20 引用 ⭐ 高影响力 查看解读 →

Gauge Freedom and Metric Dependence in Neural Representation Spaces

Jericho Cain

2026 1 引用 ⭐ 高影响力 查看解读 →

EgoPCA: A New Framework for Egocentric Hand-Object Interaction Understanding

Yue Xu, Yong-Lu Li, Zhemin Huang 等

2023 17 引用 查看解读 →

Information-Theoretic Probing for Linguistic Structure

Tiago Pimentel, Josef Valvoda, R. Maudslay 等

2020 285 引用 查看解读 →

Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture

Mahmoud Assran, Quentin Duval, Ishan Misra 等

2023 1100 引用 查看解读 →

Detecting Precise Hand Touch Moments in Egocentric Video

H. Nguyen, Feras Dayoub, Minh Hoai

2026 2 引用 查看解读 →

Null It Out: Guarding Protected Attributes by Iterative Nullspace Projection

Shauli Ravfogel, Yanai Elazar, Hila Gonen 等

2020 575 引用 查看解读 →

TACO: Benchmarking Generalizable Bimanual Tool-ACtion-Object Understanding

Yun Liu, Haolin Yang, Xu Si 等

2024 100 引用 查看解读 →

Improving Causal Interventions in Amnesic Probing with Mean Projection or LEACE

Alicja Dobrzeniecka, Antske Fokkens, Pia Sommerauer

2025 2 引用 查看解读 →

Understanding Human Hands in Contact at Internet Scale

Dandan Shan, Jiaqi Geng, Michelle Shu 等

2020 412 引用 查看解读 →

A well-conditioned estimator for large-dimensional covariance matrices

Olivier Ledoit, Michael Wolf

2004 2999 引用

StillFast: An End-to-End Approach for Short-Term Object Interaction Anticipation

Francesco Ragusa, G. Farinella, Antonino Furnari

2023 32 引用 查看解读 →

On Linear Identifiability of Learned Representations

Geoffrey Roeder, Luke Metz, Diederik P. Kingma

2020 119 引用 查看解读 →

Challenging Common Assumptions in the Unsupervised Learning of Disentangled Representations

Francesco Locatello, Stefan Bauer, M. Lučić 等

2018 1851 引用 查看解读 →

Interventional Probing in High Dimensions: An NLI Case Study

Julia Rozanova, Marco Valentino, Lucas C. Cordeiro 等

2023 10 引用 查看解读 →

Masked Feature Prediction for Self-Supervised Visual Pre-Training

Chen Wei, Haoqi Fan, Saining Xie 等

2021 877 引用 查看解读 →

Revisiting Feature Prediction for Learning Visual Representations from Video

Adrien Bardes, Q. Garrido, Jean Ponce 等

2024 431 引用 查看解读 →

Gold Doesn’t Always Glitter: Spectral Removal of Linear and Nonlinear Guarded Attribute Information

Shun Shao, Yftah Ziser, Shay B. Cohen

2022 41 引用 查看解读 →

Interpretability Beyond Feature Attribution: Quantitative Testing with Concept Activation Vectors (TCAV)

Been Kim, M. Wattenberg, J. Gilmer 等

2017 2443 引用 查看解读 →