核心发现
方法论
NOVA系统结合4F^2垂直通道晶体管DRAM单元与周围电路叠加结构,形成双层NMP架构。第一级针对低到中等Op/B操作,第二级针对中到高Op/B操作。通过跨层并行执行,支持混合LLM的多样计算模式。
关键结果
- NOVA在Nemotron3-Nano等模型上实现了平均4.5倍的吞吐量提升,端到端延迟降低69.8%,能效提高5倍,相较于GPU基线。
- 在内存容量不变的情况下,NOVA仅增加了3.9%的面积开销。
- NOVA有效支持混合LLM的多样计算模式,最大化推理性能。
研究意义
NOVA通过技术与架构的协同设计,突破了传统DRAM的物理极限和现有NMP架构的计算特性限制,显著提升了混合LLM推理的性能和能效。这一突破为大规模语言模型的推理提供了新的解决方案。
技术贡献
NOVA在技术上采用4F^2 VCT DRAM单元,实现了更高的内存密度,并通过双层NMP架构有效支持多样化的计算模式。这种设计突破了现有NMP架构的局限,为混合LLM推理提供了新的可能。
新颖性
NOVA首次将4F^2 VCT DRAM与双层NMP架构结合,解决了混合LLM推理中的内存容量和计算特性问题。相比于传统方法,NOVA在内存密度和计算效率上实现了显著提升。
局限性
- NOVA在某些极端高Op/B的计算场景下可能效率不如专用硬件。
- 在特定的内存密集型任务中,可能会遇到带宽瓶颈。
未来方向
未来可以探索NOVA在更大规模LLM上的应用,以及进一步优化其在极端计算场景下的性能。
AI 总览摘要
随着大语言模型的快速发展,现有的近存储处理架构面临技术和架构的双重挑战。NOVA系统通过结合4F^2 VCT DRAM单元与双层NMP架构,成功突破了这些限制。
在技术层面,NOVA采用了4F^2垂直通道晶体管DRAM单元,结合周围电路叠加结构,实现了更高的内存密度。在架构层面,NOVA通过双层NMP设计,支持混合LLM的多样计算模式,最大化推理性能。
实验结果显示,NOVA在多个混合LLM模型上实现了显著的性能提升,吞吐量提高4.5倍,延迟降低69.8%,能效提高5倍。这一突破为未来大规模语言模型的推理提供了新的解决方案。
深度分析
研究背景
近年来,大语言模型(LLM)的快速发展对计算和内存提出了更高的要求。传统的DRAM技术在10nm节点上遇到了物理极限,而现有的NMP架构难以支持混合LLM的多样计算特性。
核心问题
混合LLM推理面临内存容量和计算特性的双重挑战。传统DRAM技术难以满足大规模MoE模型的内存需求,而现有NMP架构无法高效支持异构计算特性。
核心创新
NOVA通过技术与架构的协同设计,采用4F^2 VCT DRAM单元和双层NMP架构,解决了内存密度和计算特性的问题。相比于传统方法,NOVA在内存密度和计算效率上实现了显著提升。
方法详解
- �� 采用4F^2 VCT DRAM单元,提升内存密度。
- �� 通过周围电路叠加结构,进一步提高内存密度。
- �� 双层NMP架构:第一级针对低到中等Op/B操作,第二级针对中到高Op/B操作。
- �� 跨层并行执行,支持混合LLM的多样计算模式。
实验设计
在Nemotron3-Nano等多个混合LLM模型上进行评估,比较基线为GPU。实验重点考察吞吐量、延迟和能效等指标。
结果分析
NOVA在多个混合LLM模型上实现了平均4.5倍的吞吐量提升,端到端延迟降低69.8%,能效提高5倍。
应用场景
NOVA适用于大规模混合LLM推理,特别是在内存密集型和计算密集型任务中,能够显著提升性能和能效。
局限与展望
NOVA在某些极端高Op/B的计算场景下可能效率不如专用硬件。在特定的内存密集型任务中,可能会遇到带宽瓶颈。
通俗解读 非专业人士也能看懂
想象一个工厂,传统的生产线需要把原材料从仓库运到生产车间,这就像传统的计算架构,需要把数据从内存搬到处理器。NOVA就像在仓库里安装了小型生产设备,可以直接在仓库里处理原材料,减少了搬运时间,提高了效率。
简单解释 像给14岁少年讲一样
嘿,小伙伴们!想象一下你在玩一个超大的拼图游戏。通常你需要把所有的拼图块搬到桌子上才能开始拼图,但NOVA就像是让你可以直接在盒子里拼图,这样你就不用来回搬运拼图块了,是不是超酷?
术语表
NMP (近存储处理)
一种计算架构,直接在内存附近进行计算,减少数据传输。
用于提升混合LLM推理的性能。
DRAM (动态随机存取存储器)
一种常用的内存技术,具有高密度和低成本的特点。
NOVA采用改进的DRAM技术提升内存密度。
MoE (专家混合)
一种模型架构,使用多个专家网络来提高模型的灵活性和性能。
NOVA支持大规模MoE模型的推理。
Op/B (运算强度)
计算操作与内存带宽的比值,反映计算任务的特性。
NOVA通过双层架构支持不同Op/B的计算任务。
VCT (垂直通道晶体管)
一种新型DRAM单元设计,通过垂直结构提高内存密度。
NOVA采用VCT技术实现更高的内存密度。
开放问题 这项研究留下的未解疑问
- 1 如何在更大规模的LLM上应用NOVA?
- 2 NOVA在极端高Op/B场景下的性能如何优化?
应用场景
近期应用
大规模LLM推理
NOVA可以用于提升大规模混合LLM推理的性能,适用于需要高效处理大量数据的场景。
远期愿景
新型计算架构
NOVA的成功可能推动未来计算架构的变革,挑战传统的计算与内存分离的设计理念。
原文摘要
The rapid evolution of hybrid large language models (LLMs), which interleave grouped-query-attention (GQA), state-space model (SSM), and Mixture-of-Experts (MoE) layers, introduces two fundamental challenges for near-memory processing (NMP) architectures. First, the Technology Wall: the conventional 6F^2 DRAM cell is approaching its physical scaling limits at 10nm-class nodes, making it difficult to meet the memory capacity demands of MoE models with hundreds of experts. Second, the Architecture Wall: existing NMP designs target narrow arithmetic intensity (Op/B) ranges and cannot efficiently support the heterogeneous compute characteristics of hybrid LLMs, spanning memory-bound SSM layers, compute-intensive GQA layers, and large Op/B variations across experts. We propose NOVA, a technology-architecture co-designed NMP system that overcomes both walls. On the technology side, NOVA combines a 4F^2 vertical channel transistor (VCT) DRAM cell with a peri-over-cell (POC) structure to achieve approximately 2x memory density at iso-area over conventional 6F^2-based DRAM, enabling continued scaling into sub-10nm nodes. On the architecture side, NOVA repurposes the POC peripheral-die (peri-die) to host processing units, forming a 2-tier NMP architecture: Tier-1 (peri-die NMP) for low-to-mid Op/B operations, and Tier-2 (base-die NMP) for mid-to-high Op/B operations. Parallel execution across tiers supports diverse compute patterns for hybrid LLMs, maximizing inference performance. Evaluated on state-of-the-art hybrid and MoE LLMs including Nemotron3-Nano, Nemotron3-Super, Falcon-H1R, and Qwen3, NOVA achieves on average 4.5x higher throughput, 69.8% lower end-to-end latency, and 5x better energy efficiency over a GPU baseline, with only 3.9% area overhead and no loss in memory capacity.