核心发现
方法论
Aicir采用层次化架构,结合配对实数张量、固定秩门视图和硬件特定公式,实现在Ascend NPU上的原生模拟。其核心包括电路构建、多状态表示(态矢量、密度矩阵、张量网络、MPS)、测量、微分和变分算法。通过封装19个接口方法,连接数值层与模拟引擎,实现跨设备分区与反向传播。验证中禁用CPU回退,测试2、4、8个NPU的通信与梯度,确保模拟路径正确性。
关键结果
- 在融合层电路测试中,Aicir CPU运行时间为Qiskit Aer的0.97-1.28倍,Cirq的0.76-1.10倍,表现与主流模拟器相当。NPU原生执行验证显示路径正确,未追求速度提升。
- 分布式模拟在2、4、8个NPU上实现,保持反向传播路径完整,通信协议验证无误。
- 支持噪声模拟、张量网络、矩阵乘积状态引擎,兼容多种量子算法与架构搜索,拓展模拟平台的硬件适应性。
研究意义
该研究突破了NPU原生支持的量子模拟瓶颈,为硬件加速提供新途径。通过结合多状态表示与分布式策略,显著提升模拟效率与规模,为量子算法验证和量子机器学习等应用提供强大工具,推动量子硬件与软件的深度融合。其创新设计为未来硬件特定优化提供范例,促进量子模拟的多平台兼容性,具有重要理论与实践价值。
技术贡献
Aicir提出了基于配对实数张量和硬件特定公式的模拟路径,创新性地将反向传播与分布式模拟结合在Ascend NPU上。其19接口实现了电路、状态、测量、微分等全栈功能,支持多状态表示与多引擎集成。通过封装多架构搜索方法,增强了模拟的灵活性与扩展性,显著区别于现有GPU为主的模拟器体系。
新颖性
Aicir首次实现了支持Ascend NPU的全栈量子电路模拟器,突破了传统GPU依赖限制。其利用硬件特定路径与分布式策略,兼容多状态表示与微分,提供了高效、可扩展的模拟平台,填补了NPU原生支持的空白,推动硬件加速在量子模拟中的应用创新。
局限性
- 当前主要面向电路级模拟,尚未涵盖电子结构等电子-结构计算场景,限制在特定硬件路径优化,复杂度较高的场景仍需优化。
- 模拟性能受限于硬件特性,某些复杂电路或大规模分布式场景仍存在瓶颈,未来需进一步优化通信与存储效率。
- 对噪声模型和误差分析支持有限,未来需增强噪声模拟的多样性与准确性。
未来方向
未来将扩展支持更复杂的量子算法与架构搜索,优化分布式通信协议,提升模拟规模与速度。同时,结合量子硬件特性,开发更高效的噪声模型和误差校正策略,推动量子软件生态的多平台融合。
AI 总览摘要
量子计算作为解决经典方法难以应对问题的前沿技术,受到广泛关注。然而,现有量子硬件受制于规模、噪声和保真度的限制,实际应用成本高昂。量子电路模拟器成为研究的重要工具,允许科学家在经典计算机上设计和验证算法,为后续硬件实验提供基础。大部分高性能模拟器依赖GPU加速,鲜有支持NPU的全栈方案。为填补这一空白,本文提出Aicir,一款支持华为Ascend NPU的原生模拟器,融合多状态表示、噪声模拟、张量网络和分布式模拟能力。其核心创新在于利用配对实数张量和硬件特定公式,确保路径在设备上高效执行,同时支持跨多NPU分区和反向传播。验证结果显示,Aicir在CPU上与主流模拟器性能相当,在NPU上实现了路径正确性,彰显其潜力。该平台不仅满足变分算法、量子机器学习和量子架构搜索的需求,还为未来硬件优化提供了范例。尽管目前主要面向电路模拟,未来将拓展到更复杂的应用场景,推动量子模拟技术的多平台融合发展。
深度分析
研究背景
量子模拟技术经历了从经典模拟器到GPU加速的快速发展,Qiskit Aer、Cirq、Qulacs等成为主流工具。GPU的高并行性极大提升了模拟效率,但受限于设备依赖和扩展性。近年来,硬件特定的模拟路径逐渐成为研究热点,尤其是在张量网络和矩阵乘积状态方面取得突破。随着量子硬件的不断发展,模拟器需要更高效、灵活的架构以应对大规模、多状态、多算法的需求。支持多平台、多引擎的全栈模拟器成为行业趋势,但现有方案多依赖GPU,缺乏对NPU的原生支持,限制了硬件多样性和应用场景。
核心问题
现有模拟器多依赖GPU,缺少对Ascend NPU的原生支持,导致硬件利用率不足,限制模拟规模和效率。同时,跨设备分布式模拟和微分路径的完整性难以保证,影响算法验证的准确性。如何在硬件特定路径上实现高效、可扩展的模拟,成为亟待解决的问题。特别是在支持多状态表示和复杂算法(如变分、量子机器学习)方面,现有方案存在性能瓶颈和兼容性问题。
核心创新
Aicir提出了基于配对实数张量和硬件特定公式的模拟路径,突破了GPU依赖。其创新点包括:• 设计了支持Ascend NPU的全栈架构,封装19个接口实现跨平台兼容;• 利用配对实数张量避免复杂数运算,提升路径在硬件上的执行效率;• 支持多状态表示(态矢量、密度矩阵、张量网络、MPS),满足不同场景需求;• 实现多设备分区与反向传播,支持大规模分布式模拟;• 集成噪声模拟、架构搜索和多引擎,增强平台适应性。
方法详解
- �� 电路构建:用户定义电路,支持参数化和自定义门;• 状态表示:采用态矢量、密度矩阵、张量网络和Factored状态;• 核心模拟:封装19个接口,连接数值引擎(NumPy、PyTorch、Ascend NPU);• 硬件路径:利用配对实数张量、固定秩门视图和硬件特定公式,确保路径在设备上执行;• 分布式模拟:将状态在多NPU间分割,保持反向传播完整;• 变分算法:支持微分路径和架构搜索,优化量子电路设计。
实验设计
在融合层电路(GHZ、QFT、随机电路)上测试,CPU性能与Qiskit Aer、Cirq相当,NPU路径验证正确。分布式模拟在2、4、8个NPU上实现,通信协议完整。验证指标包括梯度一致性、路径正确性和通信效率,确保模拟的准确性和扩展性。
结果分析
Aicir在CPU上表现与主流模拟器相当,CPU时间为Qiskit Aer的0.97-1.28倍,Cirq的0.76-1.10倍。NPU路径验证成功,支持多设备分区,保持微分路径完整。支持噪声模拟和多引擎,拓展模拟能力,验证了其在多场景下的适用性。分布式模拟实现了跨多NPU的高效通信与同步,为大规模量子电路仿真提供了新方案。
应用场景
该平台适用于量子算法验证、变分电路设计、量子机器学习和量子化学模拟。其多状态表示和分布式能力满足大规模、多样化的研究需求,为硬件加速和算法优化提供基础。未来可扩展到电子结构、量子误差校正等更复杂场景,推动量子软件生态发展。
局限与展望
目前主要面向电路模拟,尚未涵盖电子结构等复杂应用。硬件路径优化受限于Ascend硬件特性,复杂电路在大规模分布式场景下仍存在性能瓶颈。噪声模型支持有限,未来需增强误差模拟能力。
通俗解读 非专业人士也能看懂
想象你在一个大型工厂里工作,工厂里有许多不同的机器,每台机器都能完成特定的任务。以前,我们只能用一种通用的机器(比如GPU)来模拟这个工厂的所有生产过程,但这样效率不高,也不能充分利用不同机器的优势。现在,Aicir就像是为华为的Ascend NPU设计的专属工厂机器人,它能直接在这个特殊的机器上运行,利用硬件的特殊功能,让模拟变得更快、更大。它还能把工厂的生产线分成多个部分,分布在不同的机器上协作,就像多个工人同时工作一样。这样,不仅节省时间,也能模拟更复杂的生产流程。这个新工具让科学家可以更好地测试和验证量子算法,就像工厂里用新设备提升生产效率一样。虽然还不能模拟所有复杂的场景,但这是向未来迈出的一大步。
原文摘要
Quantum computing is a promising way to study problems that are difficult for classical methods, but current quantum hardware still faces limits in scale, noise, and fidelity. Running quantum algorithms on physical machines can also be costly. Quantum circuit simulators therefore remain important because they let researchers design and test algorithms on classical computers before using quantum hardware. Most high-performance simulators provide GPU backends, while few offer native support for NPUs. This gap limits the computing platforms available for quantum-algorithm research. We developed Aicir to provide a full-stack quantum circuit simulator with a native Huawei Ascend NPU backend. Aicir connects circuit construction, several state representations, measurement, differentiation, variational algorithms, quantum machine learning, and quantum architecture search through one programming model. It also supports noise simulation, tensor-network and matrix-product-state engines, and distributed state simulation. On the NPU, paired real tensors, fixed-rank gate views, and hardware-specific formulas keep the tested simulation paths on the device. The same representation lets Aicir partition a state across $2^{p}$ NPUs while retaining reverse-mode differentiation. We validated native execution with CPU fallback disabled and checked distributed communication and gradients on 2, 4, and 8 NPUs. For the tested fused layered circuits, Aicir's CPU runtime is within $0.97$--$1.28\times$ that of Qiskit Aer and $0.76$--$1.10\times$ that of Cirq. These results place its CPU execution in the same range as established simulators for this workload, while the NPU tests establish correct native execution rather than CPU-to-NPU speedup.