GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs

TL;DR

GEMQ通过全局线性规划和高效路由器微调,实现MoE LLMs的混合精度量化,减少内存占用。

cs.LG 🔴 高级 2026-05-22 13 次浏览
Jianing Deng Song Wang Dongwei Wang Zijie Liu Tianlong Chen Huanrui Yang Jingtong Hu
量化 MoE 大语言模型 内存优化 线性规划

核心发现

方法论

GEMQ通过全局线性规划模型分配专家的位宽,并通过路由器微调适应量化后的专家。该方法集成在一个渐进量化框架中,逐步优化重要性估计和分配。

关键结果

  • GEMQ在将Mixtral-8×7B模型量化到2.5位时,将模型大小从87GB减少到16GB,精度仅下降7%。
  • 与PMQ相比,GEMQ在5-shot MMLU上提高了约3%的准确率。
  • 在NVIDIA H100 GPU上,2.5位量化的Mixtral-8×7B模型解码速度达到82.5 tokens/s。

研究意义

GEMQ显著降低了MoE LLMs的内存需求和推理时间,推动了这些模型在实际应用中的可行性。通过解决现有方法在路由器动态变化上的不足,GEMQ在保持精度的同时实现了极低位量化。

技术贡献

GEMQ提出了一个全局线性规划模型,用于专家位宽分配,并通过路由器微调解决了量化引起的路由器动态变化问题。这种方法在极低位设置下仍能保持高性能。

新颖性

GEMQ首次将全局线性规划应用于MoE LLMs的混合精度量化,并通过渐进量化框架提高了专家重要性估计的准确性。

局限性

  • GEMQ在极端低位设置下的性能仍可能受到限制,尤其是在路由器动态变化剧烈的情况下。
  • 需要额外的校准数据集进行路由器微调。

未来方向

未来研究可探索在不同任务和模型架构下的GEMQ应用,进一步优化路由器微调策略,以及在硬件设计中集成GEMQ的可能性。

AI 总览摘要

GEMQ提出了一种全局专家级混合精度量化方法,专为混合专家大语言模型(MoE LLMs)设计。现有方法在量化过程中忽略了路由器动态变化,导致性能下降。GEMQ通过全局线性规划模型分配专家位宽,并通过路由器微调适应量化后的专家,显著降低了内存需求和推理时间。

在实验中,GEMQ将Mixtral-8×7B模型量化到2.5位,模型大小从87GB减少到16GB,精度仅下降7%。与现有的混合精度量化方法相比,GEMQ在多个基准测试中表现出色,尤其是在5-shot MMLU上提高了约3%的准确率。

GEMQ的创新在于其全局视角和渐进量化框架,使其在极低位设置下仍能保持高性能。这一方法不仅推动了MoE LLMs在实际应用中的可行性,也为未来的研究和应用提供了新的方向。

深度分析

研究背景

混合专家大语言模型(MoE LLMs)通过选择性激活部分专家网络来提高计算效率。然而,这种架构在推理时需要同时加载所有专家,导致内存开销巨大。现有的量化方法未能充分考虑MoE架构的特性,导致性能下降。

核心问题

MoE LLMs的主要问题在于其巨大的内存需求,尤其是在推理过程中。现有的量化方法未能有效解决路由器动态变化的问题,导致性能下降。

核心创新

GEMQ的核心创新在于其全局线性规划模型和渐进量化框架。全局线性规划用于专家位宽分配,而渐进量化框架则通过逐步优化专家重要性估计,提高了量化性能。

方法详解

  • �� 全局线性规划:根据量化误差分析分配专家位宽。
  • �� 路由器微调:通过微调路由器权重适应量化后的专家。
  • �� 渐进量化框架:逐步优化专家重要性估计。

实验设计

实验使用了Mixtral-8×7B等多个MoE LLMs模型,评估了GEMQ在不同量化位宽下的性能。使用WikiText2和C4数据集进行评估,并在多个推理任务上测试了模型的准确性。

结果分析

GEMQ在2.5位量化下将Mixtral-8×7B模型大小减少82%,仅下降7%精度。与PMQ相比,GEMQ在多个基准测试中表现更佳,尤其是在5-shot MMLU上提高了约3%的准确率。

应用场景

GEMQ适用于需要高效内存管理的大规模语言模型,尤其是在资源受限的环境中。其低位量化能力使得在单个GPU上运行大规模模型成为可能。

局限与展望

GEMQ在极低位设置下的性能仍可能受到限制,尤其是在路由器动态变化剧烈的情况下。需要额外的校准数据集进行路由器微调。

通俗解读 非专业人士也能看懂

想象你在一个大型工厂里,工厂有很多机器(专家),但每次只需要用到其中的一部分。为了节省电力和空间,你决定用不同的电压(位宽)来运行这些机器。GEMQ就像一个聪明的工厂经理,通过分析每台机器的重要性,决定用多少电压来运行它们。这样一来,工厂的总能耗大大降低,而生产效率几乎不受影响。

简单解释 像给14岁少年讲一样

想象你有一个超级大的乐高套装,但你的房间空间有限。你不能同时展示所有的乐高,所以你决定只展示最酷的部分。GEMQ就像一个聪明的朋友,帮你决定哪些乐高块最重要,然后用不同的盒子大小来存放它们,这样你就能在有限空间里展示最多的乐高,而不会失去乐趣!

术语表

混合精度量化 (Mixed-Precision Quantization)

一种通过分配不同位宽来降低模型内存需求的技术。

在GEMQ中用于优化MoE LLMs的内存使用。

全局线性规划 (Global Linear Programming)

一种数学优化方法,用于在全局范围内分配资源。

用于GEMQ中专家位宽的分配。

路由器微调 (Router Fine-Tuning)

通过调整路由器权重来适应量化后的模型。

在GEMQ中用于优化专家选择。

渐进量化框架 (Progressive Quantization Framework)

逐步优化量化过程以提高模型性能的方法。

在GEMQ中用于提高专家重要性估计的准确性。

专家网络 (Expert Network)

MoE模型中的子网络,负责处理特定输入。

在MoE LLMs中用于选择性激活。

开放问题 这项研究留下的未解疑问

  • 1 如何在不同任务下优化GEMQ的路由器微调策略?
  • 2 在硬件设计中集成GEMQ的可能性和挑战是什么?

应用场景

近期应用

内存优化

GEMQ可用于优化大规模语言模型的内存使用,适用于资源受限的环境。

远期愿景

硬件集成

将GEMQ集成到硬件设计中,以实现更高效的模型推理。

原文摘要

Mixture-of-Experts Large Language Models (MoE-LLMs) achieve strong performance but incur substantial memory overhead due to massive expert parameters. Mixed-precision quantization mitigates this cost by allocating expert-wise bit-widths based on their importance, approaching the accuracy-memory Pareto frontier and enabling extreme low-bit quantization. However, existing methods rely on layer-wise importance estimation and overlook router shifts induced by quantization, resulting in suboptimal allocation and routing. In this work, we propose Global Expert-level Mixed-precision Quantization (GEMQ) to overcome these limitations via (1) a global linear-programming formulation that captures model-wide expert importance based on quantization error analysis, and (2) efficient router fine-tuning to adapt routing to quantized experts. These components are integrated into a progressive quantization framework that iteratively refines importance estimation and allocation. Experiments demonstrate that GEMQ significantly reduces memory and accelerates inference with minimal accuracy degradation. Source code is available at https://github.com/jndeng/GEMQ .

cs.LG cs.CL