KronQ: LLM Quantization via Kronecker-Factored Hessian

TL;DR

KronQ利用Kronecker分解Hessian矩阵引入梯度协方差,显著提升LLM量化性能,2-bit在LLaMA-3-70B达7.93困惑度。

cs.LG 🔴 高级 2026-07-09 38 次浏览
Donghyun Lee Yuhang Li Ruokai Yin Priyadarshini Panda
深度学习 模型压缩 量化 Hessian矩阵 大规模语言模型

核心发现

方法论

KronQ基于Kronecker分解近似Hessian矩阵,将梯度协方差引入量化目标,结合双向非相干处理和敏感性指标,优化层间混合精度分配。具体算法包括扩展GPTQ的列向OBS,利用Hessian迹进行子层敏感性排序,并通过随机正交变换实现输入输出的非相干性。采用单次反向传播估算梯度协方差矩阵HG,结合HX实现二阶信息的联合利用,从而改善量化误差。该框架在LLaMA-2/3模型上验证,尤其在2-bit权重量化中表现优异。

关键结果

  • 在LLaMA-3-70B模型上,2-bit权重量化中,GPTQ和GPTAQ出现发散或退化(困惑度>2000),而KronQ实现困惑度7.93,显著优于基线。多模型、多任务实验显示,KronQ在WikiText-2、PiQA、ArcC等任务中均优于现有方法,提升困惑度和零-shot准确率。
  • 在不同模型规模(7B、13B、70B)和量化配置(W2/W3/W4)下,KronQ保持一致的性能优势,尤其在激活和权重联合量化中表现出更低的困惑度和更优的任务表现。
  • 引入梯度协方差的联合Hessian迹敏感性指标,有效区分层间敏感性,实现更合理的混合精度分配,显著提升压缩效率和模型性能。

研究意义

该研究突破了传统仅利用输入激活统计的量化方法的局限,通过引入梯度协方差,充分利用Hessian的输出端信息,极大改善大模型的低比特量化效果。其创新的双向非相干处理和敏感性指标,为模型压缩提供了理论基础和工程实践新路径,有望推动大规模模型在边缘设备上的部署,降低硬件成本,促进AI普及。

技术贡献

提出基于Kronecker分解的Hessian近似,结合梯度协方差,构建联合量化目标。引入双向非相干处理策略,显著减少权重幅值方差,优化量化误差。设计层间混合精度敏感性指标,依据梯度和激活Hessian迹实现自动化分配。算法保持高效,兼容现有GPTQ框架,显著提升低比特量化性能,特别在极低比特条件下表现优异。

新颖性

首次将梯度协方差引入Kronecker分解的Hessian近似中,系统性改善输出端信息的利用。提出双向非相干处理策略,有效降低量化误差,突破以往仅依赖输入统计的限制。结合Hessian迹指标实现层间混合精度,提供理论支撑和实证验证,显著优于现有的PTQ方法。

局限性

  • 方法依赖于单次反向传播估算梯度协方差,可能在极端模型或特殊任务中表现不佳,且对模型结构敏感。
  • 在某些极端场景(如极端稀疏或非线性激活)下,Kronecker近似可能失效,影响量化效果。
  • 算法在大规模模型上仍存在一定的计算开销,尤其在多层混合精度调度时需优化效率。

未来方向

未来将探索多次梯度估算以提升协方差估计的准确性,结合稀疏化技术降低计算成本。同时,扩展到非线性层和更复杂模型结构,增强方法的泛化能力。还计划结合硬件感知优化,推动实际部署应用,进一步提升模型压缩的实用性。

AI 总览摘要

大规模语言模型(LLMs)在自然语言处理领域取得了突破性进展,但其庞大的参数规模带来了极大的部署难题。传统的模型压缩技术如量化,虽能显著降低模型存储和计算成本,但在极低比特宽度下往往导致性能急剧下降。现有的二阶PTQ方法如GPTQ主要依赖输入激活的统计信息,忽略了输出端梯度信息,限制了低比特量化的效果。为解决这一瓶颈,本文提出了KronQ,一种基于Kronecker分解的Hessian近似框架,将梯度协方差引入量化目标,充分利用输出端的二阶信息。通过引入双向非相干处理策略,KronQ有效减少了权重幅值的方差,提升了量化的稳定性和精度。同时,提出基于Hessian迹的敏感性指标,实现层间混合精度的自动调度,优化模型压缩比。实验证明,在LLaMA-3-70B模型上,2-bit权重量化中,KronQ达到了困惑度7.93,远优于GPTQ的发散表现(困惑度>2000)。在多个模型和任务中均展现出优异的性能,验证了其广泛适用性。该方法不仅突破了传统PTQ的局限,也为大模型的高效部署提供了新思路。未来,将结合硬件感知优化,推动其在边缘设备上的实际应用,助力AI普及。

深度解读

原文摘要

Post-training quantization (PTQ) is a widely adopted technique for compressing large language models (LLMs) without retraining. Most existing second-order PTQ methods, including GPTQ, construct quantization objectives from input activation statistics, effectively assuming that all output channels contribute equally to the layer-wise reconstruction objective. We propose KronQ, a PTQ framework that challenges this assumption by introducing the gradient covariance into the quantization pipeline. Under the Kronecker-factored Hessian approximation, the quantization loss depends jointly on both the activation and gradient covariances, and KronQ exploits this at two complementary levels. (1) KronQ introduces bidirectional incoherence processing, extending the existing input-side random rotation to the output dimension using the gradient covariance, reducing weight magnitude variance across both input and output dimensions. (2) KronQ derives a new sensitivity metric for inter-layer mixed-precision allocation, driven by the gradient and activation Hessian traces. Notably, in the case of 2-bit weight-only quantization on LLaMA-3-70B, while GPTQ and GPTAQ diverge or produce degenerate quantizations (>2000 perplexity on WikiText-2), \KronQ{} achieves 7.93 perplexity.

cs.LG