LEXI: Lossless Exponent Coding for Efficient Inter-Chiplet Communication in Hybrid LLMs

TL;DR

LEXI通过无损指数编码减少混合LLM芯片间通信延迟33-45%。

cs.AR 🔴 高级 2026-03-17 18 次浏览
Miao Sun Alish Kanani Kaushik Shroff Umit Ogras
无损压缩 芯片通信 大语言模型 指数编码 Huffman编码

核心发现

方法论

LEXI利用Huffman编码对BF16格式的指数进行无损压缩。通过在芯片间通信中实时压缩激活和缓存,离线压缩权重,减少数据传输延迟。设计中使用多通道LUT解码器,确保最大链路带宽,且仅增加0.09%的面积和能耗。

关键结果

  • 在Jamba、Zamba和Qwen模型上,LEXI将芯片间通信延迟减少33-45%,端到端推理延迟减少30-35%。
  • 使用GF 22 nm技术实现,面积和能耗仅增加0.09%。
  • 在WikiText-2和C4数据集上,保持模型精度的同时实现无损压缩。

研究意义

LEXI在不影响模型精度的前提下,显著降低了大语言模型的通信延迟,解决了数据密集型阶段的内存带宽瓶颈问题。这一技术对于需要高效芯片间通信的混合LLM具有重要意义,推动了更大规模模型的实际应用。

技术贡献

LEXI提出了一种针对BF16格式指数的无损压缩方案,与现有方法相比,提供了更高效的硬件实现。通过在芯片路由器的I/O端集成压缩解码器,确保了最小的面积和能耗开销。

新颖性

LEXI首次实现了指数字段的无损编码,且在全速率下运行,几乎没有面积和能耗开销。与以往仅关注权重压缩的方法不同,LEXI同时压缩激活和混合缓存。

局限性

  • 在极端情况下,指数值超过32个可能导致压缩效率降低。
  • 需要特定硬件支持以实现最佳性能。

未来方向

未来工作可探索将LEXI与其他量化和剪枝技术结合,以进一步减少通信开销。此外,可研究在不同硬件架构上的适应性。

AI 总览摘要

大语言模型(LLM)的推理延迟主要受数据移动开销影响,尤其是在多芯片加速器中。现有方法如量化和剪枝虽然能缓解部分问题,但往往以牺牲模型精度为代价。为此,本文提出了LEXI,一种基于Huffman编码的无损指数压缩方案,专注于BF16格式的指数字段。

LEXI通过在芯片间通信中实时压缩激活和缓存,离线压缩权重,显著减少数据传输延迟。其设计中使用多通道LUT解码器,确保最大链路带宽,且仅增加0.09%的面积和能耗。实验结果表明,LEXI在Jamba、Zamba和Qwen模型上将芯片间通信延迟减少33-45%,端到端推理延迟减少30-35%。

这一技术在不影响模型精度的前提下,显著降低了大语言模型的通信延迟,解决了数据密集型阶段的内存带宽瓶颈问题。未来工作可探索将LEXI与其他量化和剪枝技术结合,以进一步减少通信开销。此外,可研究在不同硬件架构上的适应性。

深度分析

研究背景

随着大语言模型(LLM)的规模不断扩大,其推理阶段的瓶颈逐渐从计算转向数据移动。尤其是在多芯片加速器中,跨芯片通信成为主要障碍。现有方法如量化和剪枝虽然能缓解部分问题,但往往以牺牲模型精度为代价。BF16格式因其在训练和推理中的稳定性而被广泛采用,其指数字段的高压缩性为优化通信开销提供了可能。

核心问题

大语言模型的推理延迟主要受数据移动开销影响,尤其是在多芯片架构中,跨芯片通信成为主要瓶颈。现有方法如量化和剪枝虽然能缓解部分问题,但往往以牺牲模型精度为代价。因此,如何在不影响模型精度的前提下,降低通信延迟成为亟待解决的问题。

核心创新

LEXI提出了一种基于Huffman编码的无损指数压缩方案,专注于BF16格式的指数字段。通过在芯片间通信中实时压缩激活和缓存,离线压缩权重,显著减少数据传输延迟。与以往仅关注权重压缩的方法不同,LEXI同时压缩激活和混合缓存。

方法详解

  • �� 利用Huffman编码对BF16格式的指数进行无损压缩。
  • �� 在芯片间通信中实时压缩激活和缓存,离线压缩权重。
  • �� 使用多通道LUT解码器,确保最大链路带宽。
  • �� 设计中仅增加0.09%的面积和能耗。

实验设计

实验在Jamba、Zamba和Qwen模型上进行,使用WikiText-2和C4数据集。通过模拟通信流量,评估LEXI在减少通信延迟和保持模型精度方面的表现。实验结果表明,LEXI将芯片间通信延迟减少33-45%,端到端推理延迟减少30-35%。

结果分析

LEXI在Jamba、Zamba和Qwen模型上将芯片间通信延迟减少33-45%,端到端推理延迟减少30-35%。使用GF 22 nm技术实现,面积和能耗仅增加0.09%。在WikiText-2和C4数据集上,保持模型精度的同时实现无损压缩。

应用场景

LEXI可直接应用于需要高效芯片间通信的大语言模型,尤其是在多芯片加速器中。其低面积和能耗开销使其适用于大规模模型的实际部署。

局限与展望

在极端情况下,指数值超过32个可能导致压缩效率降低。此外,LEXI需要特定硬件支持以实现最佳性能。未来工作可探索将LEXI与其他量化和剪枝技术结合,以进一步减少通信开销。

通俗解读 非专业人士也能看懂

想象你在一个大型仓库中工作,负责将货物从一个区域搬运到另一个区域。每个货物都有一个标签(指数),而你需要尽可能快速地搬运这些货物。通常情况下,你会发现这些标签的种类并不多,所以你可以用一种特殊的方式来压缩这些标签,从而减少搬运的次数。这就是LEXI的工作原理:通过压缩指数字段,减少数据在芯片间的传输时间,就像在仓库中更高效地搬运货物一样。

简单解释 像给14岁少年讲一样

想象一下你在玩一个游戏,你需要在不同的关卡之间传送物品。每个物品都有一个标签,而你发现这些标签其实很相似。所以你决定用一种聪明的方法来压缩这些标签,这样你就能更快地传送物品。这就是LEXI的工作方式:通过压缩数据中的指数部分,让大语言模型在芯片之间更快速地传输数据,就像在游戏中更快地传送物品一样。

术语表

无损压缩 (Lossless Compression)

一种数据压缩方法,确保解压后数据与原始数据完全一致。

在LEXI中用于压缩指数字段。

Huffman编码 (Huffman Coding)

一种用于无损数据压缩的算法,通过使用变长编码来减少数据量。

用于LEXI的指数压缩。

BF16格式 (BF16 Format)

一种浮点数格式,使用8位指数和7位尾数,广泛用于神经网络训练。

LEXI专注于BF16格式的指数字段。

芯片间通信 (Inter-Chiplet Communication)

在多芯片架构中,芯片之间的数据传输。

LEXI旨在减少芯片间通信延迟。

混合缓存 (Hybrid Cache)

结合多种缓存策略以提高数据访问效率的缓存结构。

在LEXI中用于实时压缩。

开放问题 这项研究留下的未解疑问

  • 1 如何在不同硬件架构上实现LEXI的最佳性能?
  • 2 能否将LEXI与其他压缩技术结合以进一步提高效率?

应用场景

近期应用

大规模模型部署

LEXI可用于需要高效芯片间通信的大语言模型的实际部署,尤其是在多芯片加速器中。

远期愿景

更大规模模型的支持

通过减少通信延迟,LEXI为支持更大规模的大语言模型铺平了道路。

原文摘要

Data movement overheads increase the inference latency of state-of-the-art large language models (LLMs). These models commonly use the bfloat16 (BF16) format for stable training. Floating-point standards allocate eight bits to the exponent, but our profiling reveals that exponent streams exhibit fewer than 3 bits Shannon entropy, indicating high inherent compressibility. To exploit this potential, we propose LEXI, a novel lossless exponent compression scheme based on Huffman coding. LEXI compresses activations and caches on the fly while storing compressed weights for just-in-time decompression near compute, without sacrificing system throughput and model accuracy. The codecs at the ingress and egress ports of network-on-chip routers sustain the maximum link bandwidth via multi-lane LUT decoders, incurring only 0.09 percent area and energy overheads with GF 22 nm technology. LEXI reduces inter-chiplet communication and end-to-end inference latencies by 33-45 percent and 30-35 percent on modern Jamba, Zamba, and Qwen LLMs implemented on a homogeneous chiplet architecture.

cs.AR