StrataCL: Fabric-Native Communication Library for Production Supernodes

TL;DR

StrataCL通过注册即分配实现用户缓冲区直接通信,提升带宽1.6倍,推理吞吐量1.9倍。

cs.DC 🔴 高级 2026-07-29 24 次浏览
Tiancheng Hu Jin Qin Yuzheng Wang Ke Liu TangShengsheng Li Sheng Wang Zhongzhe Hu Tianlun Hu Wei Wang Lijun Li Jingbin Zhou Xiaoming Bao Hongwei Sun Jieru Zhao Huimin Cui Tao Xie Chenxi Wang
通信库 分布式计算 超级节点 AI推理 带宽优化

核心发现

方法论

StrataCL引入注册即分配机制,消除冗余数据拷贝。通过工作负载平衡的NPU核心分区和NPU驱动的SDMA卸载,充分利用超级节点架构特性。

关键结果

  • 在Huawei CloudMatrix384上,StrataCL将集体总线带宽提高至1.6倍,MoE调度/合并总线带宽提高至1.4倍。
  • 在三个生产工作负载中,StrataCL将LLM推理吞吐量提高至1.9倍,P99 TTFT减少至2.2倍。
  • LLM和Recsys训练迭代时间分别减少至1.4倍和1.3倍。

研究意义

StrataCL通过消除冗余数据拷贝和优化通信操作符,显著提高了分布式AI工作负载的通信效率。这一进展不仅在学术界具有重要意义,还为工业界提供了更高效的解决方案,解决了长期存在的通信瓶颈问题。

技术贡献

StrataCL的技术贡献在于其零冗余的通信路径设计和对超级节点架构特性的充分利用。其注册即分配机制和NPU驱动的SDMA卸载为现有的通信库提供了新的工程可能性。

新颖性

StrataCL首次在超级节点架构中实现了用户缓冲区直接通信,显著减少了通信延迟。与现有方法相比,其创新在于消除了注册开销,并优化了通信操作符。

局限性

  • 在大规模场景中,注册即分配的可扩展性仍需改进。
  • 需要对不同架构的适应性进行进一步验证。

未来方向

未来工作包括进一步优化注册即分配机制的可扩展性,并验证其在其他超级节点架构上的适用性。

AI 总览摘要

现代分布式AI工作负载跨越数百个加速器运行,通信成为主要瓶颈。现有通信库大多以缓冲区为中心,导致冗余数据拷贝或昂贵的用户缓冲区注册。StrataCL通过注册即分配实现用户缓冲区直接通信,并设计了工作负载平衡的NPU核心分区和NPU驱动的SDMA卸载,以充分利用超级节点架构特性。

在Huawei CloudMatrix384上,StrataCL将集体总线带宽提高至1.6倍,MoE调度/合并总线带宽提高至1.4倍。在三个生产工作负载中,StrataCL将LLM推理吞吐量提高至1.9倍,P99 TTFT减少至2.2倍。LLM和Recsys训练迭代时间分别减少至1.4倍和1.3倍。

StrataCL的技术贡献在于其零冗余的通信路径设计和对超级节点架构特性的充分利用。其注册即分配机制和NPU驱动的SDMA卸载为现有的通信库提供了新的工程可能性。未来工作包括进一步优化注册即分配机制的可扩展性,并验证其在其他超级节点架构上的适用性。

深度分析

研究背景

随着AI模型规模和集群规模的增长,分布式执行成为常态,通信效率成为关键瓶颈。现有通信库如NCCL、RCCL等主要依赖缓冲区管理,导致冗余数据拷贝。超级节点架构如Huawei CloudMatrix384提供了新的优化机会。

核心问题

现有通信库在用户和通信缓冲区管理上的分离导致冗余数据拷贝,增加了延迟和HBM消耗。如何在超级节点架构中实现高效的用户缓冲区直接通信是一个亟待解决的问题。

核心创新

StrataCL通过注册即分配机制,消除了通信路径上的冗余数据拷贝。其工作负载平衡的NPU核心分区和NPU驱动的SDMA卸载充分利用了超级节点的高带宽、低延迟特性。

方法详解

  • �� 注册即分配:在物理内存分配后立即进行异步注册。
  • �� 阴影虚拟地址:为每个NPU分配独立的虚拟地址范围,简化地址翻译。
  • �� 工作负载平衡:通过NPU核心分区避免长尾问题。
  • �� SDMA卸载:NPU核心提交DMA描述符,SDMA引擎异步执行数据移动。

实验设计

在Huawei CloudMatrix384上进行实验,使用512个NPU芯片和三个实际生产应用。比较了StrataCL与现有通信库在总线带宽、推理吞吐量和训练时间上的表现。

结果分析

StrataCL在集体通信中提高了1.6倍的总线带宽,在MoE调度/合并中提高了1.4倍。在LLM推理中,吞吐量提高至1.9倍,P99 TTFT减少至2.2倍。训练时间分别减少至1.4倍和1.3倍。

应用场景

StrataCL适用于需要高效通信的分布式AI工作负载,如大规模语言模型推理和训练。其高效的通信机制可以显著提高系统的整体性能。

局限与展望

StrataCL在大规模场景中的可扩展性仍需改进,特别是在动态内存分配模式下。未来需要进一步验证其在不同超级节点架构上的适用性。

通俗解读 非专业人士也能看懂

想象一个大型工厂,机器之间需要快速传递零件。传统方法需要先将零件放入中转站,再传递给下一个机器,耗时且浪费资源。StrataCL就像在每台机器之间搭建了一条直接的传送带,零件可以直接传递,大大提高了效率。这种方法不仅减少了等待时间,还节省了资源。

简单解释 像给14岁少年讲一样

想象你在玩一个多人在线游戏,你和队友需要快速分享装备。传统方法就像你每次都要先把装备放到一个公共箱子里,再由队友取走,浪费时间。StrataCL就像给你们之间搭建了一条直接的传送带,装备可以直接传给队友,游戏体验更流畅!

术语表

超级节点 (Supernode)

一种集成了大量加速器的服务器架构,提供高带宽、低延迟的通信能力。

StrataCL在超级节点架构中实现高效通信。

注册即分配 (Registration-on-allocation)

在内存分配后立即进行异步注册,以实现用户缓冲区的直接通信。

StrataCL通过注册即分配消除冗余数据拷贝。

NPU驱动的SDMA卸载 (NPU-driven SDMA offloading)

NPU核心提交DMA描述符,由SDMA引擎异步执行数据移动。

用于减少NPU核心的争用,提高通信效率。

阴影虚拟地址 (Shadow Virtual Addressing)

为每个NPU分配独立的虚拟地址范围,简化地址翻译。

StrataCL通过阴影虚拟地址简化通信操作符的实现。

MoE调度/合并 (MoE Dispatch/Combine)

一种用于大规模模型推理的操作,涉及动态的令牌路由。

StrataCL在MoE调度/合并中提高了总线带宽。

开放问题 这项研究留下的未解疑问

  • 1 如何在动态内存分配模式下进一步优化注册即分配机制的可扩展性?
  • 2 StrataCL在其他超级节点架构上的适用性如何?
  • 3 如何进一步减少NPU核心的争用以提高计算与通信的重叠度?

应用场景

近期应用

大规模语言模型推理

通过提高通信效率,StrataCL可以显著提升大规模语言模型的推理性能。适用于需要快速响应的在线服务。

远期愿景

分布式AI系统优化

StrataCL的通信优化方法可以应用于其他分布式AI系统,推动整个行业的性能提升。

原文摘要

Modern distributed AI workloads run across hundreds of accelerators, making communication a major bottleneck. Existing communication libraries remain largely buffer-centric because user and communication buffers are managed separately, causing redundant data copies or costly user-buffer registration. This paper presents StrataCL, a zero-redundancy and fabric-native communication library for production supernodes. StrataCL introduces registration-on-allocation to realize user-buffer direct communication, and designs communication operators with workload-balanced NPU-core partitioning and NPU-driven SDMA offloading to exploit supernode architecture features. On the Huawei CloudMatrix384, StrataCL improves collective bus bandwidth by up to 1.6x and improves MoE dispatch/combine bus bandwidth by up to 1.4x. Across three production workloads, StrataCL improves LLM inference throughput by 1.9x, reduces P99 TTFT by 2.2x, and reduces LLM and Recsys training iteration time by 1.4x and 1.3x, respectively.

cs.DC