← 最新论文
⚛️ quantum physics

From Circuits to Hardware: Benchmarking Standard and Qubit-Efficient Quantum Optimization on Real Hardware

本文通过在 IBM Heron 处理器上针对四种 NP 难问题对各种基于门电路的量子优化算法进行全面的真实硬件基准测试,揭示了当前的噪声水平使得大多数可行结果与随机机会无法区分,并且虽然提高量子比特效率的方法可以扩展可运行的实例规模,但它们仍受限于严格的经验保真度预算。

原作者: Monit Sharma, Hoong Chuin Lau

发布于 2026-07-14
📖 1 分钟阅读🧠 深度阅读

原作者: Monit Sharma, Hoong Chuin Lau

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图用一只全新的、极其脆弱的机械臂去解决一个巨大的、纠缠在一起的拼图。你手头有很多不同的策略:有些试图一次性抓取整个拼图,有些试图把拼图缩小到能放进兜里,还有些在开始之前就试图重新排列这些碎片。这篇论文就像是一个巨大的、现实世界的压力测试,它在四种非常不同的拼图类型上测试了这些机械臂,使用的是真实的量子计算机(即“机械臂”),而不是仅仅在电脑屏幕上进行模拟。

以下是当他们把这些策略投入到真实硬件上测试时发生的情况。

大局观:“口袋拼图”陷阱

主要的发现是一个现实的警示。长期以来,人们一直认为在量子计算机上解决难题的最佳方法是让问题变小,使其能够适应更少的“量子比特”(即机械臂的手指)。其核心思想是:手指越少 = 越容易解决。

但本论文表明,这并不总是成立的。 虽然缩小拼图(使用“量子比特高效型”方法)确实能让你在机器上运行更大的问题,但这并不能保证你能得到一个好的答案。事实上,有时缩小拼图会导致机械臂因为噪声而剧烈晃动,从而导致碎片掉落。作者在真实的 IBM Heron 处理器上测量了这一点,并发现仅仅因为一种方法使用的量子比特较少,并不意味着它表现得更好。 这就像试图用一个很小的背包背着一个沉重的箱子;没错,背包很小,但如果箱子对你的背部来说太重了,你仍然会把它掉在地上。

四个拼图:四个问题的寓言

研究人员测试了四种不同类型的“NP-hard”问题(这意味着对于普通计算机来说,这些问题也超级难)。每种问题表现各异:

  1. 多维背包问题 (MDKP): 想象一次背包旅行,你必须携带一些物品,这些物品既有重量,又占空间,还必须放入特定的隔层中。

    • 发生了什么: 这是个“中庸之道”。所有的策略,从规模大的到压缩后的微型策略,实际上都设法找到了一些有效的解。压缩方法(PCE 和 QRAO)在这里表现良好,证明了缩小问题确实可以有所帮助,前提是机械臂足够稳固。
  2. 最大独立集 (MIS): 想象一场派对,你想邀请尽可能多的客人,但任何两个客人之间都不能是敌人(他们不能坐在一起)。

    • 发生了什么: 这是个“悬崖”。对于规模较小的派对,机器人表现出色。但随着派对规模变大,机器人突然停止了工作。论文展示了一个尖锐的“可行性悬崖”:一旦问题变得稍微大了一点,真实硬件上的噪声就会使得寻找任何有效的宾客名单都变得不可能。这就像是在飓风中搭建纸牌屋;放几张牌没问题,但一旦规模稍大,砰的一声,一切都会崩塌。
  3. 二次指派问题 (QAP): 想象将 10 或 12 个人分配到 10 或 12 个座位上,但成本取决于他们坐得有多远以及彼此是否会交谈。

    • 发生了什么: 这是个“彻底失败”。论文明确指出,在真实硬件上,没有任何测试过的策略能为这个问题返回哪怕一个有效的解。 为什么?因为规则如此严格(例如特定的排列组合),以至于有效的答案极其罕见——在所有可能的排列中,只有大约 102310^{23}103410^{34} 分之一是正确的。计算机上的噪声完全淹没了信号,导致机器人的行为就像在随机瞎猜。作者认为这不仅仅是“我们需要更好的计算机”的问题;问题本身的结构对于当前的技术来说过于稠密了。
  4. 市场份额问题 (MSP): 想象尝试切分一个披萨,让每个人都能恰好得到他们订购的那份大小。

    • 发生了什么: 这是个“压缩悖论”。压缩方法(PCE 和 QRAO)将问题缩小到了仅 7–11 个量子比特(极小!),而普通方法则需要多达 156 个。但关键在于:这些微型方法的结果非常糟糕。 它们无法达到目标值。普通的、规模较大的方法反而表现得更好。这证明了缩小问题并不自动意味着获得更好的答案。

“噪声”因素:当机器人摇晃时

论文引入了一种酷炫的方法来衡量计算机的摇晃程度。他们称之为“保真度代理”(FestF_{est})。你可以把它理解为一个“信噪比”计:

  • 如果计数值较高(接近 0.1 或 10%),说明机器人足够稳,可以听清指令。
  • 如果计数值降至 0.001(0.1%)以下,说明机器人摇晃得非常厉害,基本上是在原地打转。

他们发现,对于许多“QAOA”风格的方法(一种流行的算法家族),机器人的摇晃程度使得结果与随机选择答案没有区别。论文进行了一项对照测试,将机器人的输出与均匀随机猜测进行了比较。对于大多数大型复杂电路,机器人的表现并不比随机猜测好。事实上,在一种特定情况下,一种“热启动”(warm-start)方法比随机猜测稍好一点,但这只是一个罕见的例外,而非普遍规律。

论文排除了哪些可能性

作者非常谨慎地说明了他们没有发现的内容:

  • 他们排除了“量子比特越少 = 性能越好”的观点。数据表明,缩小电路往往会引入其他问题(比如在转换后电路深度增加),从而抵消了所带来的好处。
  • 他们排除了 QAOA 方法目前已经准备好处理这些难题的观点。在计算机将指令转换为自身的语言(转译)之后,电路变得如此庞大且充满噪声,以至于它们失效了。即使他们尝试优化路由(即机器人如何移动手指),电路依然会因为过于摇晃而无法工作。
  • 他们排除了 模拟结果(在完美的计算机上进行模拟)能说明全部情况的观点。在“完美模拟”与“真实硬件”之间存在巨大的鸿沟。在模拟中看起来很棒的方法,在真实硬件上往往表现得一塌糊涂,因为要让它实际运行需要额外的步骤。

他们的确定程度如何?

作者对他们测量到的内容非常有信心。他们不仅仅是在猜测;他们在真实的 IBM Heron 处理器(具体为 r1 和 r2 版本)上运行了 247 种不同的方法和问题的组合。他们记录了每一个步骤,从代码是如何被翻译的到最终结果。

  • 他们测量了机器人必须执行的精确门操作(步骤)数量。
  • 他们测量了所使用特定芯片的错误率。
  • 他们模拟了部分环节以建立基准,但他们明确表示,模拟结果仅作为参考,而非最终答案。

他们并不是在声称量子计算机是没用的。他们是在说:对于这些特定问题以及这些特定的现有机器,“缩小规模”的策略是有极限的,而且某些问题(如 QAP)目前对于现有的技术来说实在太难了。他们建议我们需要观察全貌——包括问题规模、噪声以及代码是如何被转译的——而不仅仅是计算量子比特的数量。

给好奇青少年的总结

把量子优化想象成尝试在一个嘈杂的房间里传递信息。

  • “标准”方式是清晰地大声喊出整个信息。声音很大,但如果房间太大,噪声就会淹没你的声音。
  • “压缩”方式是低声传递一段加密信息。它更安静,占用的空间也更小,但如果代码太复杂或者房间太吵,没人能解码,你得到的只会是乱码。

这篇论文说:“嘿,低声细语并不总是答案!有时候,即使是最好的代码也会在嘈杂的房间里迷失方向,因为环境实在太吵了。而且对于某些特别棘手的拼图(比如 QAP),这个房间里的噪声大到目前的机器人根本无法解决。”

作者并不是在说“放弃吧”。他们是在说:“让我们停止假装只要把拼图变小,我们就解决了问题。我们需要观察整个局面——噪声、转译过程以及实际的结果——来看看究竟什么才是真正有效的。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →