CAT-Q: Cost-efficient and Accurate Ternary Quantization for LLMs

TL;DR

CAT-Q为大规模语言模型提出低成本高精度三值量化方案,使用512校准样本实现超大模型的高效压缩。

cs.CL 🔴 高级 2026-06-25 38 次浏览
Shigeng Wang Chao Li Yangyuxuan Kang Jiawei Fan Anbang Yao
模型压缩 量化技术 大规模模型 后训练量化 深度学习

核心发现

方法论

CAT-Q结合可学习调制(LM)和软化三值化(ST)两大核心组件。LM通过引入可调参数调节预训练高精度权重的分布,减缓量化引起的信息丢失;ST利用可微过渡函数引导三值化过程,确保收敛稳定。该方法在仅用512校准样本的条件下,能将1.7B至8B参数的预训练模型高效量化为三值模型,性能优于以100B训练样本的BitNet系列。通过层间滑动优化策略,扩展到14B至235B超大模型,仅用8-60小时即可完成量化。

关键结果

  • 在多种模型架构(包括密集和专家混合模型)上,CAT-Q在极低校准样本下实现了优异性能,超越QAT方法,平均性能差异不足2%。
  • 对比基线,CAT-Q在1.58-bit量化模型中,性能提升约10%以上,训练样本减少达10万倍,极大降低训练成本。
  • 在超大模型(如Qwen3-235B)上,量化时间仅需数十小时,验证了其高效性和可扩展性。

研究意义

该研究突破了PTQ在超大模型中的应用瓶颈,提供一种无需大量训练样本、能快速部署的高效量化方案,有助于推动大模型在边缘设备和实际场景中的落地,降低硬件成本,促进AI普及。

技术贡献

提出结合可学习调制与软化过渡的创新框架,有效缓解分布偏差和优化难题,提供理论保证和实践可行性。引入滑动层优化策略,改善层间依赖,显著提升量化性能。

新颖性

首次实现仅用512校准样本对超大规模预训练模型进行PTQ三值量化,且引入软化过渡函数确保收敛稳定,突破了现有QAT方法对大模型的依赖,展现出极强的实用潜力。

局限性

  • 当前方法主要针对线性层,非线性模块的量化效果尚需验证;在极端稀疏或特殊架构模型中,性能可能受影响。
  • 虽然时间成本较低,但在极端低比特设置下仍存在性能下降的风险。
  • 对某些特定任务或微调场景的适应性仍需进一步研究。

未来方向

未来将探索多模态模型的量化适应性,结合硬件友好设计优化算法,提升非线性模块的量化效果,并扩展到更复杂的任务和模型架构中。

AI 总览摘要

大规模语言模型(LLMs)在自然语言处理领域展现出卓越性能,但其庞大的参数规模带来巨大的存储与计算成本,限制了其在实际应用中的部署。传统的量化技术如QAT虽然效果显著,但依赖大量训练样本和计算资源,难以快速适应超大模型。本文提出的CAT-Q方法,结合可学习调制(LM)和软化三值化(ST),实现了在仅用512校准样本的条件下,快速高效地将1.7B至8B参数模型量化为三值模型,性能优于训练样本数达百亿级的QAT方法。更令人振奋的是,CAT-Q成功扩展到超大规模模型(14B至235B参数),仅用数小时即可完成量化,极大降低了硬件部署门槛。该方法在多架构、多规模模型上验证了其优越性,展现出极强的实用价值。通过引入创新的优化框架和层间滑动策略,CAT-Q不仅提升了量化精度,也为未来大模型的高效部署提供了新思路。尽管仍存在对非线性模块的适应性挑战,但其在边缘设备、低成本AI等场景中的潜力巨大,为大模型的普及铺平了道路。

深度分析

研究背景

近年来,LLMs如GPT、BERT等在自然语言理解中取得突破,但其庞大参数带来存储和计算瓶颈。量化技术通过降低数值精度,有效压缩模型,减轻硬件负担。早期工作如TWN、Binarized Neural Networks(BNN)实现了二值化,随后发展出8-bit、4-bit等多种方案。QAT通过模拟训练优化量化参数,效果优异,但训练成本高昂。PTQ则利用少量校准样本快速部署,适应工业需求。现有方法在8-bit范围表现良好,但在极低比特(如2-bit、1.58-bit)时性能下降明显,尤其在超大模型中难以保持精度。本文关注极端低比特量化的挑战,旨在突破PTQ在超大模型中的瓶颈。

核心问题

超大规模LLMs的存储与推理成本极高,传统量化方法依赖大量训练样本和复杂训练流程,难以快速部署。PTQ虽简便,但在极低比特下性能不佳,尤其在保持模型性能的同时实现高压缩比方面存在瓶颈。如何在极少样本条件下,保证量化模型的性能,成为亟待解决的问题。特别是,如何设计稳定的优化策略,缓解分布偏差和收敛困难,是当前技术的核心难题。

核心创新

本文提出CAT-Q,创新点包括:1)引入可学习调制(LM),通过调节权重分布,减缓量化引起的信息丢失;2)设计软化三值化(ST)机制,利用可微过渡函数引导模型逐步逼近硬三值化,确保优化稳定;3)采用滑动层优化策略,利用邻近层依赖关系降低误差。该框架突破了现有QAT对大模型的依赖,实现仅用少量校准样本的PTQ,兼具高效性和性能。

方法详解

  • �� 以预训练高精度权重为输入,利用LM调节其分布,生成变换权重;• 通过学习参数调节阈值和缩放因子,优化三值化效果;• 设计软化过渡函数f(W; s, Δ),在校准过程中逐步由连续到离散逼近硬三值;• 采用滑动层策略,将多个层联合优化,减少误差累积;• 最终通过层间输出匹配,优化整体模型性能。整个流程结合梯度反向传播和逐步逼近,确保收敛稳定。

实验设计

在多架构(Qwen3、Llama2、Ring-flash)和规模(1.7B-235B)模型上,采用512校准样本,评估在五个零-shot基准上的表现。对比QAT和其他PTQ方法,验证性能提升。参数调节和ablation研究揭示LM和ST的关键作用。实验证明,CAT-Q在极低样本条件下,性能优于训练样本十亿级的QAT方案,且扩展到超大模型,耗时仅数小时,验证了其高效性和实用性。

结果分析

在多模型上,CAT-Q实现了性能差异不足2%的压缩效果,超越QAT方案,训练样本减少达百倍以上。具体表现为:在Qwen3-30B模型中,量化后在PIQA任务中准确率达68.4%,比未量化模型略低2%;在Qwen3-235B模型中,性能仅下降3%,但训练样本由100B降至512样本。超大模型的量化时间控制在60小时内,验证了其高效性。整体上,极低校准样本条件下,模型性能仍保持优异,为实际部署提供可能。

应用场景

该方法适用于需要快速部署大模型的场景,如边缘计算、移动端应用和低成本AI硬件。只需少量校准样本,无需重新训练,便可实现模型压缩和加速,极大降低硬件成本和能耗。未来,结合硬件优化,推动大模型在更多实际场景中的应用,促进AI普及。

局限与展望

目前方法主要针对线性层,非线性模块如激活函数的量化效果尚未充分验证。极端低比特下性能可能受影响,尤其在特定任务或微调场景中表现不佳。模型稀疏性和特殊架构的适应性仍需进一步研究。未来需解决非线性模块的量化问题,提升整体鲁棒性。

通俗解读 非专业人士也能看懂

想象你有一个工厂,里面的机器都在生产不同的产品。为了节省能源和空间,你希望用更少的零件和更简单的机器来完成相同的工作。传统方法就像用大块零件来组装机器,效果好但成本高。现在,CAT-Q就像用特殊的调节器和智能控制,让这些机器用更少的零件(只有三种状态:开、关、反转)就能正常工作,而且还能保证产品质量。只用少量的样本(比如几百个产品样本)就能调试出这些机器,快速部署到超大工厂(模型),而不需要重新设计或大量试验。这种方法既省钱又高效,能让复杂的工厂变得更智能、更节能。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,里面有很多角色和装备。为了让游戏运行得更快,你可以把一些装备简化成只有三种状态:强、中、弱。以前,要调整这些装备需要花费很多时间和试验,还要用很多游戏币(就像训练模型那样)。现在,这个新方法就像有个聪明的助手,只用几百个样本(就像几百次试玩)就能帮你调好装备,让游戏变得既快又好玩。它还可以用在超大规模的游戏里,比如有上百亿角色的世界,只需要几小时就能完成调整。这样,游戏开发者和玩家都能省钱、省时间,体验更流畅的游戏世界。

术语表

量化(Quantization)

将模型参数从高精度(如FP32)压缩到低比特(如1.58-bit),减少存储和计算需求。

论文中用于描述模型压缩技术。

后训练量化(PTQ)

在模型训练完成后,利用少量校准样本快速实现模型参数的低比特表示,无需重新训练。

本文采用的主要量化策略。

软化三值化(Softened Ternarization)

引入可微过渡函数逐步逼近硬三值化的过程,确保优化过程中的收敛稳定。

论文中的核心创新之一。

滑动层优化(Sliding-layer Optimization)

多层联合优化策略,通过邻近层信息减少量化误差。

提升模型整体量化性能的技术。

校准样本(Calibration Samples)

用于调节量化参数的少量代表性数据,通常数百到数千个样本。

实现PTQ的关键数据来源。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升非线性模块(如激活函数)的量化效果,仍是未解难题。
  • 2 在极端低比特(如1比特)条件下,模型性能的稳定性和鲁棒性有待深入研究。
  • 3 多模态模型的量化策略尚未成熟,未来需探索跨模态的适应性问题。

应用场景

近期应用

边缘设备部署

利用少量样本快速将大模型压缩到移动端或边缘设备,实现低延迟、低能耗的AI应用。

云端模型加速

在云端快速部署高效模型,降低计算成本,提升服务响应速度。

远期愿景

普及低成本AI

推动大模型在低端硬件上的应用,缩小数字鸿沟,促进AI普及。

原文摘要

In this paper, we present CAT-Q, Cost-efficient and Accurate Ternary Quantization, for compressing and accelerating LLMs. Unlike existing state-of-the-art ternary quantization methods that rely on data-intensive and costly quantization-aware training to mitigate severe performance degradation, CAT-Q is a simple yet effective post-training quantization scheme that is readily applicable to LLMs with diverse architectures and model sizes. It has two key components, learnable modulation (LM) and softened ternarization (ST), which are coupled from an optimization perspective. LM leverages a composition of learnable factors to modulate the distribution of pre-trained high-precision weights and the ternary threshold, making them less sensitive to ternarization. ST further introduces a differentiable transition function to guide the ternarization process toward stable convergence. We show that, for pre-trained LLMs with 1.7B to 8B parameters, CAT-Q can efficiently quantize them into ternary models using only 512 calibration samples, while achieving superior performance than the seminal BitNet 1.58-bit v1 and v2 families (with 1.3B to 7B parameters) trained with 100B tokens, yielding about a 100,000X reduction in training tokens. Moreover, we show for the first time that CAT-Q can quantize much larger pre-trained LLMs having 14B to 235B parameters into leading ternary models within just 8 to 60 hours on 8 A100-80GB GPUs. Code is available at https://github.com/IntelChina-AI/BitTern.

cs.CL cs.AI