RepTran: Search-Based Repair of Transformer Models

TL;DR

RepTran以神经元与双向评分定位ViT可疑权重,DE修复18组故障,平均修复率74.7%。

cs.SE 🔴 高级 2026-07-13 30 次浏览
Yuta Ishimoto Paolo Arcaini Fuyuki Ishikawa Masanari Kondo Naoyasu Ubayashi Yasutaka Kamei
Transformer修复 Vision Transformer 差分进化 深度神经网络 软件可靠性

核心发现

方法论

RepTran面向Transformer的FFN,先计算中间神经元的VDiff与MisAct,形成NeuronScore,再与Arachne的Forward Impact和Gradient Loss结合,得到Weight Suspiciousness。选取最高的Nw个权重后,使用Differential Evolution(DE)搜索新权重;适应度函数同时奖励保持正确样本分类并修复目标误分类。

关键结果

  • 在CIFAR-100和Tiny-ImageNet构造的18个故障基准上,RepTran平均修复率为74.7%,最佳达到95.2%,显著优于随机选择与Arachne。原始Arachne应用于ViT的FFN时平均仅17.1%,最高44.4%。
  • RepTran平均运行时间为476.19秒,快于Arachne的620.93秒。它在不同故障类型SRC-TGT、TGT-FP和TGT-FN及三个频率排名上均保持竞争力。
  • 与可控制权重数量的ArachneW比较时,效应量分析显示RepTran不论选择多少权重都具有更高修复率;ViT模型初始测试准确率为CIFAR-100的91.18%和Tiny-ImageNet的86.34%。

研究意义

研究回应了Transformer已进入自动驾驶、医学影像等高风险软件后,模型局部错误难以安全修补的问题。它把传统软件工程中的故障定位、补丁搜索思想带入ViT,并强调修复目标行为而非重新训练全部模型。结果说明,在数据和算力有限、又必须保护既有正确行为时,结构感知的局部修复具有实际价值。

技术贡献

核心技术是将FFN中间神经元的行为差异显式纳入权重定位。VDiff比较正确与错误样本的协方差结构,MisAct衡量错误样本上的平均激活;二者归一化相乘后调制Arachne的FI与GL。随后DE只优化少量FFN参数,并以正确率保持和错误率降低组成适应度,从而形成定位—搜索的完整流程。

新颖性

多数DNN修复方法面向CNN或普通前馈网络,Arachne虽能搜索权重,却没有利用Transformer FFN的知识存储性质。RepTran的创新不是改动Transformer整体结构,而是把神经元级行为统计与权重级双向影响结合,针对FFN语义集中区域进行搜索式修复。

局限性

  • 实验仅使用ViT图像分类、CIFAR-100和Tiny-ImageNet,并只修复第12个编码器块的FFN,尚不能证明对语言模型或多层联合故障同样有效。
  • 修复依赖预先定义的误分类类型与代表性样本;若故障分布复杂、样本稀少或需要跨任务泛化,NeuronScore和DE搜索可能失效。
  • 论文未系统评估大规模LLM、长期连续修复及安全认证成本。

未来方向

未来可扩展到多个Transformer层、LLM和非视觉任务,并研究自动故障类型发现、更多搜索算法及跨层协同修复。还需与PRoViT等保证型方法结合,评估修复的可证明性、鲁棒性、灾难性副作用和真实工业数据表现。

AI 总览摘要

Transformer已经成为大型语言模型、自动驾驶和医学影像系统的基础组件,但其错误通常不是简单的软件缺陷:模型可能只在某类输入上持续误判,全面再训练又昂贵且可能破坏原有能力。现有DNN修复方法多针对CNN,忽略了Transformer中多头自注意力与前馈网络(FFN)的特殊结构。

研究者提出RepTran,将修复集中在FFN的两层权重上。它先用VDiff和MisAct衡量中间神经元在正确、错误样本上的行为差异,再结合Arachne的Forward Impact与Gradient Loss定位可疑权重,最后用Differential Evolution搜索参数。适应度函数同时要求修复目标误分类并保持正确预测;实验只改变少量权重,而非重新训练整个模型。

在CIFAR-100和Tiny-ImageNet上的18组故障基准中,RepTran平均修复率达到74.7%,最高95.2%;Arachne平均17.1%,最高44.4%,平均运行时间也从620.93秒降至476.19秒。其优势在不同权重数量下仍超过ArachneW。不过,实验局限于ViT图像分类和最后一层FFN。RepTran因此更像一种有潜力的局部补丁框架,而不是已经覆盖所有Transformer故障的通用保证方案。

深度分析

研究背景

Transformer由多头自注意力和FFN堆叠而成,已从NLP扩展到视觉与安全关键系统。DNN修复方法如Arachne、CARE和PRDNN证明了局部修改的价值;ROME、MEND则面向事实知识编辑。可是这些方法很少利用FFN中间神经元的语义作用。本文使用ViT,强调最终FFN层可能集中保存可区分知识。

核心问题

目标不是提升总体准确率,而是减少一类已知误分类,同时不破坏其他正确预测。难点在于模型参数巨大、错误责任难定位、Transformer的FFN与注意力结构不同,且修复样本有限。直接微调可能引入回归,随机选权重则搜索空间过大。

核心创新

  • ��提出NeuronScore,将VDiff与MisAct结合,定位错误行为相关的中间神经元。

  • ��将NeuronScore调制Arachne的FI和GL,生成Weight Suspiciousness。

  • ��在选定FFN权重上使用DE搜索,以联合适应度平衡修复与保持。

  • ��通过18个故障基准验证结构感知定位优于通用权重选择。

方法详解

  • ��输入:已微调的ViT、正确集合Icor与目标误分类集合Imis。

  • ��结构:FFN(z)=Waftσ(Wbefz+bbef)+baft;实验中D=768、Dhidden=3072。

  • ��定位:计算VDiff,即正确/错误样本协方差矩阵各行绝对元素和之差;计算MisAct,即错误样本平均激活;NeuronScore=VDiffnorm×MisActnorm。

  • ��融合:对连接神经元的权重w,ModFI=FI×NeuronScore,ModGL=GL×NeuronScore;WeightSusp=pModFI+(1-p)ModGL。

  • ��搜索:选Top-Nw权重,由DE维护候选群体并迭代变异、选择;Fitness平均奖励正确预测,并以1/(1+L)软奖励错误样本改进。

实验设计

数据集为CIFAR-100(50,000训练、10,000测试)和Tiny-ImageNet(100,000训练、10,000验证、10,000测试)。按80:20划分训练/修复集,另设测试集;共18组基准,覆盖SRC-TGT、TGT-FP、TGT-FN及前三排名。比较随机选择、Arachne、ArachneW,并在RQ5比较PRoViT。Nw取11、236、472、944,p默认0.5;目标为第12个编码器块FFN。

结果分析

RepTran平均修复率74.7%、最高95.2%,明显超过Arachne的17.1%平均值和44.4%最高值;平均运行时间476.19秒,也优于620.93秒。ArachneW效应量分析显示,在不同选权重规模下RepTran仍更优。最终层神经元分数在CIFAR-100各故障类型和排名中持续更高,支持目标层选择。

应用场景

可用于模型上线后的定向补丁,例如降低自动驾驶视觉系统对某类物体的误报,或修复医学影像中的特定漏检。前提是拥有可标注的正确样本、目标误分类样本和可访问的模型权重;部署前仍需独立回归测试与安全审计。

局限与展望

研究范围限于ViT图像分类、两个数据集和单个最终FFN层,尚未覆盖LLM、多层故障、分布外输入或连续在线修复。DE仍需搜索时间和超参数调节,且适应度只提供经验性目标,不给出严格安全保证。未来应扩展模型与任务,并结合可证明修复、鲁棒性测试和真实工业故障。

通俗解读 非专业人士也能看懂

把模型想成一座大型工厂。工厂里有许多小工位,每个工位接收信息、加工后交给下一站;其中一组特别重要的工位负责把复杂原料重新组合成最终产品。如果某类产品总是做错,重新建整座工厂太贵,也可能弄坏原本做对的产品。

RepTran先观察正确订单和错误订单经过工位时的表现:哪些工位在错误订单上特别活跃,哪些工位的表现变化最大。它把这些工位连接到前后环节的少数螺丝标记出来,而不是检查所有零件。

接着,系统让许多“维修方案”同时尝试,每个方案只微调被标记的螺丝。方案必须满足两点:错误订单变少,同时原本正确的订单不能大量变错。不断保留更好的方案,就像维修团队进行许多小规模试产。

在两个图像数据集的18类故障上,这种方法平均修好74.7%的目标错误,最好达到95.2%,而另一种通用方法平均只有17.1%。但它仍需要足够的错误样本,也只在一种视觉模型上验证过。

简单解释 像给14岁少年讲一样

想象你在玩一个会认图片的游戏。游戏里的“机器人”通常很准,但它可能总把某种猫认成狐狸。把机器人从头训练一遍很麻烦,而且可能让它忘记原来会的东西。RepTran的想法是:不要重做整个机器人,只找出最可能造成这个错误的几个小零件。

它先比较“答对的图片”和“答错的图片”经过机器人内部时有什么不同。如果某些小部件在答错时特别兴奋,或者变化特别明显,就把它们列入嫌疑名单。然后它还会检查每个连接对最后答案有多大影响,综合决定先修哪些地方。

接下来,RepTran像一群玩家同时尝试改装方案。每个方案只改变少数数字,并用分数判断:有没有少认错目标图片?有没有把原本答对的图片弄错?经过很多轮筛选,留下最好的方案。

实验中它在CIFAR-100和Tiny-ImageNet的18类错误上平均修复74.7%,最好95.2%;Arachne平均17.1%。很酷,但别以为它无敌:实验只测了ViT视觉模型,未来还要看看它能不能修复聊天机器人,并证明维修不会带来隐藏问题。

术语表

Feed-Forward Network (前馈网络,FFN)

Transformer中对每个位置独立进行两次线性变换和非线性激活的模块。论文修复其Wbef与Waft权重。

RepTran的主要修复对象。

Vision Transformer (视觉Transformer,ViT)

将图像切分为视觉片段并用Transformer编码器分类的模型。论文使用12层、D=768、Dhidden=3072的ViT。

全部主要实验的目标模型。

Differential Evolution (差分进化,DE)

通过群体、变异和选择搜索数值参数的元启发式算法。它优化被选权重的候选值。

RepTran的搜索阶段。

NeuronScore(神经元评分)

由归一化VDiff与MisAct相乘得到的分数,反映神经元在错误行为中的变化与激活强度。

用于调制权重可疑度。

Forward Impact与Gradient Loss(前向影响与梯度损失)

前向影响衡量权重对输出的作用,梯度损失衡量其对损失的梯度贡献。二者来自Arachne。

与NeuronScore结合定位权重。

Repair Rate(修复率)

目标误分类中被修正为正确分类的比例。它衡量修复目标行为的有效性。

主要评价指标,RepTran平均为74.7%。

开放问题 这项研究留下的未解疑问

  • 1 RepTran是否能在LLM、多语言任务和跨层故障中保持优势尚未回答;需要大规模模型、更多故障类型及真实生产数据验证。
  • 2 如何在提高修复率的同时提供形式化安全保证仍不清楚;未来需结合PRoViT式可证明方法、鲁棒性测试和长期回归监控。

应用场景

近期应用

自动驾驶视觉补丁

工程团队可收集某类车辆或行人的误报样本,将RepTran用于ViT最终FFN的定向修复,再用独立道路场景测试集检查是否降低目标错误且不损害其他识别能力。

医学影像误分类修复

医院或设备厂商可针对某种病灶漏检建立修复集,在冻结大部分模型的情况下优化少量FFN权重。部署前必须进行医生复核、分布外测试和监管要求的安全评估。

远期愿景

可审计的模型维护系统

未来可将故障监控、自动定位、RepTran补丁搜索和回归验证连接成持续维护流水线,使AI模型像传统软件一样获得版本化补丁;关键障碍是可证明安全、隐私数据和跨模型泛化。

原文摘要

To ensure the overall quality of AI-enabled software, not only traditional software components but also AI components need to be tested and repaired. Among AI components, Transformer models are increasingly integrated into software systems, which makes their misbehaviors critical. Although prior work in the software engineering community has proposed deep neural network (DNN) repair methods, most overlook Transformer-specific structures. We propose RepTran, a search-based repair method for Transformer models. It targets their feed-forward networks (FFNs), which play a central role in the architecture. RepTran identifies suspicious weights by combining two types of scores: a variance-based neuron score and an existing bidirectional score. It then iteratively optimizes these weights using differential evolution. Our evaluation includes 18 fault benchmarks constructed from CIFAR-100 and Tiny-ImageNet. We compare RepTran against three baselines: random weight selection, Arachne (a state-of-the-art DNN repair method), and ArachneW, which enables Arachne to control the number of selected weights. RepTran achieved an average repair rate of 74.7%, statistically outperforming random selection and Arachne across all benchmarks. Effect size analysis revealed that RepTran achieved higher repair rates than ArachneW regardless of the number of selected weights. These results suggest that RepTran is effective for enhancing the reliability of AI-enabled software.

cs.SE cs.AI