GPU-Accelerated Quantum Simulation of Stabilizer Circuits
本文介绍了 QuaSARQ,这是一种 GPU 加速的模拟器,它采用用于稳定器电路演化与测量的创新并行算法,实现了与最先进的 CPU 和 GPU 模拟器相比高达 105 倍的速度提升和超过 80% 的能耗降低,从而能够高效模拟高达 180,000 个量子比特的电路。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在构建可用量子计算机的过程中,科学家们面临着一个悖论:为了证明一台机器是否有效,他们必须首先在经典计算机上模拟其行为。然而,模拟量子系统极其困难,因为描述一个量子系统所需的信息量会随着每增加一个粒子而呈爆炸式增长。一个量子比特(qubit)可以处于叠加态,即同时代表 0 和 1。当你将许多量子比特连接在一起时,它们的组合状态会变成一个庞大且复杂的可能性网络,极难追踪。不过,有一类特殊的量子电路被称为稳定器电路(stabilizer circuits),它们的行为更加可预测。这些电路使用一组特定的操作,虽然足以测试纠错和通信协议,但并不会产生通用量子计算机那种完整的、混沌的复杂性。由于这种结构,它们可以在经典机器上进行模拟,但前提是模拟过程必须足够聪明,以避免陷入海量数据的泥潭。
挑战在于,随着这些电路规模的扩大——达到数万个量子比特和数百万次操作时——传统的模拟方法会撞上南墙。当电路包含测量(measurement)时,这些方法表现得尤为吃力;测量是观察量子态并迫使其坍缩为确定结果的时刻。测量引入了随机性,并要求计算机不断重新组织其内部数据结构,这一过程在标准处理器上会变得异常缓慢且具有顺序性。莱顿大学的研究人员现在推出了一种新方法,通过将整个模拟过程转移到图形处理器(GPU)上,绕过了这些瓶颈。这些芯片最初是为渲染视频游戏设计的,天生擅长同时执行数千个简单的计算,这使得它们非常适合模拟大型量子电路所需的这种大规模并行数据处理。
由 Muhammad Osama、Dimitrios Thanos 和 Alfons Laarman 领导的团队开发了一种名为 QuaSARQ 的新模拟器。他们并没有试图让旧的顺序执行方法跑得更快,而是完全重写了底层算法,以适配 GPU 的架构。在标准的模拟中,在测量后更新量子电路的状态通常涉及一个逐步的过程,类似于解一个复杂的拼图,在放置当前碎片之前无法移动下一块。这产生了一个依赖链,从而拖慢了整体速度。研究人员重新设计了这个过程,使 GPU 可以同时处理数千个此类更新。他们通过以一种让内存能够以平滑、连续流的形式进行访问的方式来组织数据,消除了当许多处理器试图同时读写同一内存空间时通常会出现的停顿和冲突。
他们工作中的一个关键创新是处理模拟过程中的“枢轴”(pivot)点。当发生测量时,模拟器必须识别哪些部分的量子态受到了影响并对其进行更新。在以往的方法中,寻找这些受影响部分是一个缓慢的搜索过程,且高度取决于具体的电路。新方法将这些搜索结果打包成一个紧凑、精简的列表,允许 GPU 通过一次高效的扫描来处理它们。此外,他们用一种并行技术取代了传统的逐步数据消除法,该技术通过三次协调的扫描来计算必要的变更。这使得模拟器能够处理高达 180,000 个量子比特和 1,000 层深度的电路,这一规模在以前是许多现有工具无法企及的。
他们的测试结果令人瞩目。在与包括高度优化的基于 CPU 的工具 Stim 在内的现有最快模拟器进行对比时,QuaSARQ 展示了巨大的速度提升。在最具挑战性的测试案例中,这个新模拟器的运行速度比其竞争对手快了高达 105 倍。除了原始速度之外,效率的提升同样显著。由于 GPU 完成任务的速度快得多,它比基于 CPU 的替代方案节省了超过 80% 的能量。这是一个至关重要的发现,因为运行大规模模拟的能源成本正成为研究人员关注的主要问题。该工具在“多样本”(many-shot)采样方面也表现出色,这是一个通过运行数千次相同电路来构建其行为统计图的过程。当其他模拟器随着所需样本数量的增加而显著减速时,QuaSARQ 保持了稳定且快速的节奏,轻松处理数千次采样。
研究人员使用从小型电路到拥有 180,000 个量子比特的大型电路的一系列基准测试对他们的系统进行了测试。在这些测试中,QuaSARQ 不仅持续优于 Stim,还优于 Qiskit-Aer、Qibo、Cirq 和 PennyLane 等其他领先的软件包。在一次具体对比中,当领先的 CPU 模拟器在 132 小时内完成了 125 个电路时,QuaSARQ 仅用 72 小时就完成了 177 个电路。在具有大量测量的电路中,这种优势尤为明显,因为新的并行算法防止了模拟过程陷入停滞。团队指出,他们的方法不仅仅是让现有的模拟变快,它还使得在以前无法详细研究的规模上模拟量子电路成为可能。
这项工作表明,理解复杂量子系统的路径可能在于使经典硬件学会并行思考,而非顺序思考。通过重新思考数据存储和更新计算的方式,研究人员已经证明,当前模拟器的局限性并非基本的物理定律,而是可以通过工程手段解决的挑战。QuaSARK 的成功表明,对于特定类型的稳定器电路,专门的算法与现代 GPU 硬件相结合,可以为验证量子纠错和设计未来的量子协议提供强大的工具。虽然这并未解决所有类型量子电路的模拟问题,但它为一类对于开发可靠量子计算机至关重要的基础问题提供了稳健且高效的方法。这些发现清晰地展示了,只要方法得当,模拟大规模量子行为的计算障碍是可以被显著降低的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。