Signed-Permutation Coordinate Transport for RMSNorm Transformers

TL;DR

提出一种用于RMSNorm变压器的符号置换坐标传输方法,恢复91.1%坐标。

cs.LG 🔴 高级 2026-07-01 25 次浏览
John Sweeney
RMSNorm 符号置换 坐标传输 深度学习 神经网络

核心发现

方法论

本文提出了一种符号边缘化的匈牙利匹配算法,用于解决RMSNorm模型中符号置换不完整的问题。通过保存检查点的局部Bd规范沿相同基准微调轨迹进行坐标保持传输,而不是功能级别合并。

关键结果

  • 在1500步的微调中,坐标保持传输恢复了91.1%的跨运行坐标,而终点匹配仅为60.3%。
  • TinyLlama SAE重建在Bd下的NMSE为0.004,而在Sd下为1.08。
  • Qwen情感引导在Bd下保留了95.8%的效果,而在Sd下仅为17.2%。

研究意义

该研究解决了RMSNorm模型中符号置换不完整的问题,显著提高了跨运行坐标的恢复率。这对学术界和工业界的模型迁移和参数共享具有重要意义。

技术贡献

技术贡献包括提出了符号边缘化的匈牙利匹配算法,并证明了在装饰坐标情况下的结构性置换准确性上限。还展示了如何通过局部Bd规范进行坐标保持传输。

新颖性

这是首次在RMSNorm模型中应用符号边缘化匹配方法,解决了符号置换不完整的问题,与现有的仅置换对齐方法相比具有显著创新。

局限性

  • 在独立训练的模型之间进行自然对齐时,探测预算需求较高。
  • 方法依赖于保存的检查点和局部Bd规范。

未来方向

未来工作可以探索如何在更大规模的模型和数据集上应用该方法,以及如何减少探测预算需求。

AI 总览摘要

现代大型语言模型(LLM)工作流中,坐标索引对象的移动在检查点之间变得越来越普遍。然而,现有方法在处理RMSNorm模型时存在符号置换不完整的问题,导致坐标恢复不准确。本文提出了一种符号边缘化的匈牙利匹配算法,通过保存检查点的局部Bd规范沿相同基准微调轨迹进行坐标保持传输,显著提高了坐标恢复的准确性。

实验结果表明,该方法在1500步的微调中恢复了91.1%的跨运行坐标,而传统的终点匹配仅为60.3%。此外,TinyLlama SAE重建在Bd下的NMSE为0.004,而在Sd下为1.08,Qwen情感引导在Bd下保留了95.8%的效果,而在Sd下仅为17.2%。

该研究不仅在学术界具有重要意义,还为工业界的模型迁移和参数共享提供了新的思路。未来的研究可以进一步探索该方法在更大规模模型和数据集上的应用,以及如何减少探测预算需求。

深度分析

研究背景

随着深度学习的发展,模型的规模和复杂性不断增加。RMSNorm作为一种常用的归一化技术,广泛应用于大型语言模型中。然而,现有的模型对齐方法在处理RMSNorm模型时存在符号置换不完整的问题,导致坐标恢复不准确。

核心问题

在RMSNorm模型中,符号置换不完整的问题导致坐标恢复不准确。这是因为RMSNorm模型允许每个坐标的独立符号翻转,而现有方法仅考虑置换对齐。

核心创新

本文提出了一种符号边缘化的匈牙利匹配算法,解决了RMSNorm模型中符号置换不完整的问题。通过保存检查点的局部Bd规范进行坐标保持传输,显著提高了坐标恢复的准确性。

方法详解

  • �� 提出符号边缘化的匈牙利匹配算法,用于解决符号置换不完整的问题。
  • �� 保存检查点的局部Bd规范,沿相同基准微调轨迹进行坐标保持传输。
  • �� 通过实验验证该方法在RMSNorm模型中的有效性。

实验设计

实验使用了Qwen2.5-1.5B模型进行微调,比较了符号边缘化匹配和传统终点匹配的效果。实验结果表明,符号边缘化匹配显著提高了坐标恢复的准确性。

结果分析

实验结果表明,符号边缘化匹配在1500步的微调中恢复了91.1%的跨运行坐标,而传统的终点匹配仅为60.3%。此外,TinyLlama SAE重建在Bd下的NMSE为0.004,而在Sd下为1.08。

应用场景

该方法可用于大型语言模型的迁移和参数共享,尤其是在需要高精度坐标恢复的场景中,如情感分析和语义理解。

局限与展望

方法依赖于保存的检查点和局部Bd规范,在独立训练的模型之间进行自然对齐时,探测预算需求较高。未来研究可以探索如何减少探测预算需求。

通俗解读 非专业人士也能看懂

想象你在一个图书馆里,书架上的书按特定顺序排列。每本书都有一个标签,告诉你它在书架上的位置。现在,你需要把这些书搬到另一个图书馆,并保持它们的顺序不变。问题是,新的图书馆允许你在搬运过程中翻转书的标签,这就像RMSNorm模型中的符号翻转。为了确保书的顺序不变,你需要一种方法来处理这些标签的翻转。本文提出的方法就像一个聪明的图书管理员,能够在搬运过程中自动调整标签,确保书的顺序和位置不变。

简单解释 像给14岁少年讲一样

想象一下,你在玩一个拼图游戏。每块拼图都有一个特殊的图案,你需要把它们放在正确的位置上。有时候,这些拼图块可以翻转,这就像RMSNorm模型中的符号翻转。为了确保拼图正确完成,你需要一种方法来处理这些翻转。本文提出的方法就像一个超级聪明的拼图大师,能够在拼图过程中自动调整每块拼图的位置和方向,确保最终的拼图图案完美无缺!

术语表

符号置换 (Signed Permutation)

在数学中,符号置换是指一个置换加上每个元素的符号翻转。

在RMSNorm模型中,符号置换用于描述坐标的翻转和重新排列。

匈牙利匹配 (Hungarian Matching)

一种用于解决分配问题的算法,能够在多项式时间内找到最优匹配。

本文使用匈牙利匹配算法来实现符号边缘化匹配。

RMSNorm

一种归一化技术,不进行均值中心化,仅对输入进行标准差归一化。

RMSNorm在大型语言模型中被广泛使用。

坐标保持传输 (Coordinate-preserving Transport)

一种方法,旨在保持坐标在不同模型检查点之间的一致性。

本文提出的符号边缘化匹配用于实现坐标保持传输。

局部Bd规范 (Local Bd Gauge)

一种用于描述RMSNorm模型中坐标翻转和置换的数学结构。

局部Bd规范用于实现坐标保持传输。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模的模型和数据集上应用符号边缘化匹配方法仍需探索。
  • 2 减少探测预算需求的有效策略尚未明确。

应用场景

近期应用

模型迁移

该方法可用于提高大型语言模型在不同任务间的迁移能力,尤其是在需要高精度坐标恢复的场景中。

远期愿景

跨模型参数共享

通过提高坐标恢复的准确性,该方法有望促进不同模型间的参数共享,推动深度学习的进一步发展。

原文摘要

Modern LLM workflows move coordinate-indexed objects across checkpoints: steering vectors, sparse autoencoders, top-$k$ neuron sets, attribution lists, and merge alignments. This is only well posed after fixing the model's residual-stream gauge, which we show is architecture-dependent: LayerNorm residual charts have permutation gauge $S_d$ (up to a global sign flip), while RMSNorm charts with generic per-channel gain have signed-permutation gauge $B_d = S_d \ltimes \{\pm 1\}^d$. Permutation-only alignment is therefore symmetry-incomplete for RMSNorm models. We introduce sign-marginalized Hungarian matching and prove a sharp failure mode: with decorrelated coordinates, raw signed-correlation matching has a structural permutation-accuracy ceiling at the positive-sign fraction of the true gauge, which sign-marginalization removes. We then make coordinate-preserving transport, not function-level merging, the primary object: composing saved-checkpoint local $B_d$ gauges along same-base fine-tuning trajectories recovers 91.1% of cross-run coordinates at 1500 steps versus 60.3% for endpoint matching, and the gain is not explained by merely routing through the base. The recovered gauge transfers tools that permutation-only alignment breaks: TinyLlama SAE reconstruction has NMSE 0.004 under $B_d$ versus 1.08 under $S_d$; Qwen sentiment steering preserves 95.8% of its effect versus 17.2%; refusal steering reverses sign under $S_d$; coordinate-preserving merges behave the same way. The same covariance governs stateful training: signed transport of AdamW state preserves the resumed trajectory, while permutation-only state follows a different one from a functionally identical checkpoint. Finally, gauge-sweep audits show index-level interpretability claims are reproducible only relative to an explicit gauge.

cs.LG cs.CL stat.ML