← 最新论文
⚛️ quantum physics

Qu-Trefoil: Large-Scale Quantum Circuit Simulator Working on FPGA With SATA Storages

该论文介绍了 Qu-Trefoil,这是一种利用广泛的 SATA 存储来成功模拟超过 43 个量子比特的大规模量子电路的低成本 FPGA 系统,克服了通常将此类模拟限制在超级计算机上的内存限制。

原作者: Kaijie Wei, Hideharu Amano, Ryohei Niwase, Yoshiki Yamaguchi, Takefumi Miyoshi

发布于 2026-08-17
📖 1 分钟阅读🧠 深度阅读

原作者: Kaijie Wei, Hideharu Amano, Ryohei Niwase, Yoshiki Yamaguchi, Takefumi Miyoshi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机不仅仅是在 0 和 1 之间计数,而是在两者之间同时舞动、交织成一片模糊影迹的世界。这就是量子计算的领域,它承诺解决那些即便使用今天的超级计算机也需要数千年才能破解的复杂问题。但在我们能够制造出这些神奇机器之前,科学家们需要一种方法,在没有实际硬件的情况下测试他们的想法。于是,“量子模拟器”应运而生——这是一个数字游乐场,研究人员可以在其中观察量子比特(即“qubits”)的行为。但问题在于:当你向模拟中添加更多量子比特时,追踪它们所需的计算机内存量会呈爆炸式增长。这就像试图绘制一名旅行者可能采取的所有路径;如果只有几个站点,这很容易;但如果有几十个站点,地图就会变得巨大无比,甚至能填满地球上所有的图书馆。几十年来,模拟超过 40 个量子比特一直是那些最庞大、最昂贵的超级计算机的专属工作,这让许多研究人员被拒之门外。

本文介绍了一位进入该领域的聪明新玩家,名为 Qu-Trefoil。研究人员并没有依赖价值数十亿美元的超级计算机,而是利用一种被称为 FPGA 的专用芯片(可以将其想象为一个你可以瞬间重新编程的电子“乐高板”)连接到一个巨大的标准硬盘墙上,构建了一个系统。他们成功模拟了一个包含 43 个量子比特的量子电路,这一壮举需要超过 128 TB 的内存。虽然在这样的设置下运行单次模拟需要 3.72 到 13.06 小时,但这一成就具有变革意义,因为它证明了你不需要超级计算机也能进行大规模的量子数学运算。通过使用一种独特的架构,将存储驱动器视为计算的积极参与者,Qu-Trefoil 为那些想要探索量子世界却不想在超级计算机排队等待的研究人员,提供了一个灵活且成本更低的替代方案。

问题所在:内存怪兽

为了理解为什么这件大事如此重要,请将量子态想象成一个巨大的数字列表。你每在模拟中增加一个量子比特,该列表的大小就会翻倍。这是一个呈指数级增长的“内存怪兽”。仅仅为了模拟 40 个量子比特,你就需要如此巨大的内存空间,以至于在开始进行任何数学运算之前,仅持有数据就需要 2^44 字节(大约 16 TB)。大多数笔记本电脑只有几个 GB;即使是强大的游戏 PC 也可能有几十 GB。为了处理 40 个以上的量子比特,你通常需要一台耗资数百万美元、消耗电力足以供应一个小镇的超级计算机。这使得普通的大学实验室或规模较小的公司很难进行大规模量子算法的实验。

解决方案:Qu-Trefoil

由庆应义塾大学和东京大学研究人员领导的团队决定用一种不同的方法来解决这个问题。他们构建了一个名为 Trefoil 的系统,它本质上是一个配备了 FPGA 的巨型高速存储单元。可以将 FPGA 想象成一个超快且可重构的大脑,而存储单元则是一个装满了 32 个 SATA 硬驱动器(就是你在普通电脑中看到的那些,但在本例中,每个驱动器容量为 8 TB)的仓库。

Qu-Trefoil 的精妙之处在于它如何使用这些驱动器。通常,硬盘只是用来存储文件的;它们很慢,在计算机进行思考时处于闲置状态。Qu-Trefoil 将驱动器变成了积极的工人。FPGA 芯片紧挨着驱动器并高效管理数据流,使其能够提取信息块,进行量子数学运算,并将结果推回,而无需等待系统的缓慢部分跟上进度。这就像有一位厨师(FPGA),他不仅不会等待食材送达,还拥有一套传送带系统,能将食材直接送到切菜板旁,切好后送出菜肴,而与此同时,储藏室(硬盘)就在旁边。

工作原理:量子的舞蹈

该系统通过对量子比特应用“门”(gates)来模拟量子电路。在量子世界中,一个“门”就像一个改变量子比特状态的开关。研究人员编写了他们的 FPGA 来处理一组特定的门,包括著名的 Hadamard (H)Pauli-Z (Z)Phase (S)Controlled-NOT (CNOT)T 门,以及复杂的矩阵运算。

他们使用了一种称为高层次综合 (HLS) 的技术来设计这些门。想象一下,你用平实的英语写下一份食谱,然后让机器人自动将其翻译成机器需要遵循的具体指令。这使他们能够为每种门类型创建高效的定制电路。

该系统通过将数据分解为“块”来处理海量数据。由于单个量子态是一个占用 16 字节的复数,他们将 32 个此类状态打包进单个 512 字节的硬盘扇区中。当模拟运行时,FPGA 读取一个数据块,同时对该块中的所有量子比特进行数学运算,并将结果写回。如果一次计算需要来自两个不同驱动器的数据,系统会协调它们并行工作,确保过程不会陷入停滞。

结果:大数字,真时间

团队首先用一个 35 量子比特的模拟对系统进行了测试,以观察其表现。他们发现,运行模拟所需的时间很大程度上取决于数据的访问方式:

  • 如果数据都在同一个驱动器的同一个“块”中,速度最快。
  • 如果数据分布在同一驱动器的两个不同“块”中,耗时会稍长。
  • 如果数据分布在两个不同的驱动器上,耗时最长,但系统仍能平稳处理。

随后,他们将极限推向了 43 个量子比特。这需要超过 128 TB 的内存。在一个单一存储子系统(一个带有 32 个驱动器和一个 FPGA 的板卡)上,该系统成功模拟了一个 43 量子比特的电路。所花费的时间根据特定的门类型和使用的 SATA 代际而变化:

  • 使用 SATA II 驱动器时,耗时在 3.72 到 13.06 小时之间。
  • 使用更快的 SATA III 驱动器时,时间显著下降,根据门的类型不同,实现了约 22% 到 29% 的加速。

研究人员指出,随着量子比特数量的增加,时间消耗呈指数级增长,这在量子力学的性质下是符合预期的。然而,关键的结论在于,他们能够在成本远低于超级计算机的系统上达到 43 个量子比特。

为什么这很重要

论文明确排除了“由于内存限制导致 FPGA 过于局限”的观点。通过将 FPGA 直接连接到大规模 SATA 阵列,他们绕过了通常阻碍此类模拟的内存瓶颈。他们还表明,虽然模拟速度不如顶级超级计算机(后者可以在几分钟或几秒钟内完成同样的工作),但其成本和可及性要优越得多。

对于无法接触到超级计算机的研究人员来说,Qu-Trefoil 提供了一条探索大规模量子算法的可行路径。它不是一个能瞬间解决一切问题的魔杖,但它是一个强大且灵活的工具,使量子模拟变得大众化。作者建议,未来的改进(如使用更快的 NVMe 驱动器或进行数据压缩)可以使系统更加高效,从而可能将量子比特的极限推向更高。

简而言之,Qu-Trefoil 证明了你不需要一台超级计算机来模拟一个“超级量子”世界。凭借一点巧妙的工程设计和大量的硬盘,你就可以在一个能放进房间且成本可控的系统中,实现 43 个量子比特的力量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →