← 最新论文
⚛️ quantum physics

Qupertino: Pure MLX Array Kernels versus Hand-Tuned Metal Shaders for Quantum Circuit Simulation on Apple Silicon

该论文介绍了 Qupertino,这是一个针对 Apple Silicon 的开源量子电路模拟器,它展示了经过手工调优的 Metal 着色器如何显著超越纯 MLX 数组操作,在保持对多种量子工作负载的精确正确性的同时,实现比现有 CPU 和 GPU 模拟器高出达 95 倍的加速。

原作者: Shlomo Kashani

发布于 2026-09-18
📖 1 分钟阅读🧠 深度阅读

原作者: Shlomo Kashani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

要理解此处呈现的工作,人们必须首先了解现代量子计算面临的挑战本质。量子计算机不仅仅是目前我们使用的机器的快速版本;它们运行在一种根本不同的物理规则之上,通过操纵信息的方式,允许它们同时探索许多可能性。由于这些机器仍处于早期阶段,容易出错且规模有限,科学家们严重依赖经典计算机来模拟它们的行为。这种模拟是一个关键工具,用于测试算法并校准真实硬件。然而,模拟量子系统是极其困难的,因为描述一个系统所需的信息量会随着每增加一个粒子而呈爆炸式增长。仅仅为了模拟一个由二十五个粒子组成的系统,计算机就必须追踪大量的数字,这项任务甚至会让最强大的超级计算机也达到极限。长期以来的问题在于,最新一代的消费级计算机,特别是那些使用苹果定制芯片的计算机,是否能够高效地处理这一负担,以及如果可以,这种力量中有多少来自于巧妙的软件,又有多少来自于纯粹的硬件工程。

一位研究人员通过构建一种名为 Qupertino 的新模拟工具解决了这个问题,该工具专门为 Apple Silicon 处理器设计。这些处理器之所以独特,是因为它们使用统一内存架构,这意味着中央处理器和图形处理器共享同一个内存池,而无需在它们之间来回复制数据。这种设计消除了传统计算机中存在的显著瓶颈,即在独立的内存库之间移动大量数据会减慢一切速度。研究人员想确切知道,仅使用这些芯片上现有的标准、高层编程工具能达到多远,以及通过编写专门针对图形处理器调优的自定义底层代码,可以获得多少额外的性能提升。他们设定了两种方法进行比较:一种完全依赖于标准数组操作,另一种则结合了旨在榨取硬件每一滴速度的纯手工打造指令。

研究表明,标准方法虽然令人印象深刻,但仍留下了显著的性能空间。当研究人员仅使用标准数组操作运行模拟时,该软件已经比在中央处理器上运行的现有工具更快了。然而,当他们启用系统的第二层级——即使用针对图形处理器的自定义手工调优指令时——速度得到了剧烈提升。对于某些复杂的任务,例如许多量子算法中使用的傅里叶变换,定制版本比标准基于处理器的工具快了近九十五倍,比 PennyLane 模拟软件快了近一百倍。在其他场景中,例如模拟磁性系统的演化,定制方法的速度仍然快了三十倍以上。研究人员仔细测量了这些结果,在同一台机器上反复运行相同的测试,以确保差异是真实的而非随机波动。他们发现,在所有十八个对比单元格中,定制调优方法的平均运行时间是最快的,尽管在特定的稀疏电路(如 25 个量子比特的 Grover 搜索)上,它在统计学上与 CPU 基准持平,而在最小的门稀疏电路(15 个量子比特)上,CPU 基准仍然更快。

这种性能差距的关键在于软件如何处理量子电路的结构。标准方法以一种较为通用的方式对待每一个门(或操作),即使其中许多门遵循可预测的模式。然而,定制调优方法能够识别这些模式。例如,当一系列操作仅仅是旋转量子态的相位时,定制代码会在一次流线型的处理中完成计算,而不是逐个处理每一步。同样,当模拟涉及交换粒子位置或应用特定类型的数学变换时,定制代码会将这些动作组合在一起,作为一个统一的块来执行。这类似于一名快递员,不再是每到一个街道上的每家住户都停下来投递单个包裹,而是将该街道所有的包裹装载好,然后进行一次高效的投递。通过识别并利用这些模式,定制代码减少了计算机访问内存的次数,而访问内存正是最耗时的部分。

尽管取得了如此巨大的速度增益,研究人员仍谨慎地确保定制代码不会改变结果。他们构建了一个系统,能够自动检测电路是否符合可以优化的模式,并将其路由到定制代码路径,而将其余部分交给标准路径运行。他们验证了定制代码的结果与标准代码完美匹配,精确到最小的十进制位。这意味着用户可以在不牺牲准确性的情况下获得定制代码的速度。该工具还支持多种量子算法,包括用于优化、搜索和模拟化学反应的算法。它甚至包含了一种模拟多达一百五十个粒子系统的的方法,前提是这些系统不是过于纠缠的,这在相同硬件上的标准方法下是不可能实现的。

研究结果表明,虽然现代消费级硬件足以运行复杂的量子模拟,但运行在其之上的软件也必须同样精密,才能释放其全部潜力。Apple Silicon 的统一内存提供了一个坚实的基础,消除了数据复制的需求,但真正的速度来自于编写能够理解问题特定结构的程序。研究人员证明,虽然一个纯粹由标准操作编写的模拟器是一个可行的工具,但与使用手工调优指令的版本相比,它存在百分之二十五到三十三倍的性能差距。这种差距并非硬件的失败,而是提醒我们,在高性计算领域,最有效的路径往往需要对机器架构有深刻的理解。这项工作为如何为下一代量子实验构建更快的模拟器提供了清晰的路线图,表明统一内存与精心设计的代码相结合,可以推向单台桌面电脑所能达到的极限。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →