NOVA: Technology-Architecture Co-Design of Near-Memory Processing for Attention-SSM-MoE Hybrid LLM Inference

TL;DR

NOVA结合4F^2 VCT DRAM和双层NMP架构,提升LLM推理性能4.5倍。

cs.AR 🔴 高级 2026-08-24 7 次浏览
In-Jun Jung Jaeha Min Joo-Young Kim
大语言模型 近存储处理 混合架构 DRAM技术 计算效率

核心发现

方法论

NOVA系统结合4F^2垂直通道晶体管DRAM单元与周围电路叠加结构,形成双层NMP架构。第一级针对低到中等Op/B操作,第二级针对中到高Op/B操作。通过跨层并行执行,支持混合LLM的多样计算模式。

关键结果

  • NOVA在Nemotron3-Nano等模型上实现了平均4.5倍的吞吐量提升,端到端延迟降低69.8%,能效提高5倍,相较于GPU基线。
  • 在内存容量不变的情况下,NOVA仅增加了3.9%的面积开销。
  • NOVA有效支持混合LLM的多样计算模式,最大化推理性能。

研究意义

NOVA通过技术与架构的协同设计,突破了传统DRAM的物理极限和现有NMP架构的计算特性限制,显著提升了混合LLM推理的性能和能效。这一突破为大规模语言模型的推理提供了新的解决方案。

技术贡献

NOVA在技术上采用4F^2 VCT DRAM单元,实现了更高的内存密度,并通过双层NMP架构有效支持多样化的计算模式。这种设计突破了现有NMP架构的局限,为混合LLM推理提供了新的可能。

新颖性

NOVA首次将4F^2 VCT DRAM与双层NMP架构结合,解决了混合LLM推理中的内存容量和计算特性问题。相比于传统方法,NOVA在内存密度和计算效率上实现了显著提升。

局限性

  • NOVA在某些极端高Op/B的计算场景下可能效率不如专用硬件。
  • 在特定的内存密集型任务中,可能会遇到带宽瓶颈。

未来方向

未来可以探索NOVA在更大规模LLM上的应用,以及进一步优化其在极端计算场景下的性能。

AI 总览摘要

随着大语言模型的快速发展,现有的近存储处理架构面临技术和架构的双重挑战。NOVA系统通过结合4F^2 VCT DRAM单元与双层NMP架构,成功突破了这些限制。

在技术层面,NOVA采用了4F^2垂直通道晶体管DRAM单元,结合周围电路叠加结构,实现了更高的内存密度。在架构层面,NOVA通过双层NMP设计,支持混合LLM的多样计算模式,最大化推理性能。

实验结果显示,NOVA在多个混合LLM模型上实现了显著的性能提升,吞吐量提高4.5倍,延迟降低69.8%,能效提高5倍。这一突破为未来大规模语言模型的推理提供了新的解决方案。

深度分析

研究背景

近年来,大语言模型(LLM)的快速发展对计算和内存提出了更高的要求。传统的DRAM技术在10nm节点上遇到了物理极限,而现有的NMP架构难以支持混合LLM的多样计算特性。

核心问题

混合LLM推理面临内存容量和计算特性的双重挑战。传统DRAM技术难以满足大规模MoE模型的内存需求,而现有NMP架构无法高效支持异构计算特性。

核心创新

NOVA通过技术与架构的协同设计,采用4F^2 VCT DRAM单元和双层NMP架构,解决了内存密度和计算特性的问题。相比于传统方法,NOVA在内存密度和计算效率上实现了显著提升。

方法详解

  • �� 采用4F^2 VCT DRAM单元,提升内存密度。
  • �� 通过周围电路叠加结构,进一步提高内存密度。
  • �� 双层NMP架构:第一级针对低到中等Op/B操作,第二级针对中到高Op/B操作。
  • �� 跨层并行执行,支持混合LLM的多样计算模式。

实验设计

在Nemotron3-Nano等多个混合LLM模型上进行评估,比较基线为GPU。实验重点考察吞吐量、延迟和能效等指标。

结果分析

NOVA在多个混合LLM模型上实现了平均4.5倍的吞吐量提升,端到端延迟降低69.8%,能效提高5倍。

应用场景

NOVA适用于大规模混合LLM推理,特别是在内存密集型和计算密集型任务中,能够显著提升性能和能效。

局限与展望

NOVA在某些极端高Op/B的计算场景下可能效率不如专用硬件。在特定的内存密集型任务中,可能会遇到带宽瓶颈。

通俗解读 非专业人士也能看懂

想象一个工厂,传统的生产线需要把原材料从仓库运到生产车间,这就像传统的计算架构,需要把数据从内存搬到处理器。NOVA就像在仓库里安装了小型生产设备,可以直接在仓库里处理原材料,减少了搬运时间,提高了效率。

简单解释 像给14岁少年讲一样

嘿,小伙伴们!想象一下你在玩一个超大的拼图游戏。通常你需要把所有的拼图块搬到桌子上才能开始拼图,但NOVA就像是让你可以直接在盒子里拼图,这样你就不用来回搬运拼图块了,是不是超酷?

术语表

NMP (近存储处理)

一种计算架构,直接在内存附近进行计算,减少数据传输。

用于提升混合LLM推理的性能。

DRAM (动态随机存取存储器)

一种常用的内存技术,具有高密度和低成本的特点。

NOVA采用改进的DRAM技术提升内存密度。

MoE (专家混合)

一种模型架构,使用多个专家网络来提高模型的灵活性和性能。

NOVA支持大规模MoE模型的推理。

Op/B (运算强度)

计算操作与内存带宽的比值,反映计算任务的特性。

NOVA通过双层架构支持不同Op/B的计算任务。

VCT (垂直通道晶体管)

一种新型DRAM单元设计,通过垂直结构提高内存密度。

NOVA采用VCT技术实现更高的内存密度。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模的LLM上应用NOVA?
  • 2 NOVA在极端高Op/B场景下的性能如何优化?

应用场景

近期应用

大规模LLM推理

NOVA可以用于提升大规模混合LLM推理的性能,适用于需要高效处理大量数据的场景。

远期愿景

新型计算架构

NOVA的成功可能推动未来计算架构的变革,挑战传统的计算与内存分离的设计理念。

原文摘要

The rapid evolution of hybrid large language models (LLMs), which interleave grouped-query-attention (GQA), state-space model (SSM), and Mixture-of-Experts (MoE) layers, introduces two fundamental challenges for near-memory processing (NMP) architectures. First, the Technology Wall: the conventional 6F^2 DRAM cell is approaching its physical scaling limits at 10nm-class nodes, making it difficult to meet the memory capacity demands of MoE models with hundreds of experts. Second, the Architecture Wall: existing NMP designs target narrow arithmetic intensity (Op/B) ranges and cannot efficiently support the heterogeneous compute characteristics of hybrid LLMs, spanning memory-bound SSM layers, compute-intensive GQA layers, and large Op/B variations across experts. We propose NOVA, a technology-architecture co-designed NMP system that overcomes both walls. On the technology side, NOVA combines a 4F^2 vertical channel transistor (VCT) DRAM cell with a peri-over-cell (POC) structure to achieve approximately 2x memory density at iso-area over conventional 6F^2-based DRAM, enabling continued scaling into sub-10nm nodes. On the architecture side, NOVA repurposes the POC peripheral-die (peri-die) to host processing units, forming a 2-tier NMP architecture: Tier-1 (peri-die NMP) for low-to-mid Op/B operations, and Tier-2 (base-die NMP) for mid-to-high Op/B operations. Parallel execution across tiers supports diverse compute patterns for hybrid LLMs, maximizing inference performance. Evaluated on state-of-the-art hybrid and MoE LLMs including Nemotron3-Nano, Nemotron3-Super, Falcon-H1R, and Qwen3, NOVA achieves on average 4.5x higher throughput, 69.8% lower end-to-end latency, and 5x better energy efficiency over a GPU baseline, with only 3.9% area overhead and no loss in memory capacity.

cs.AR