← 最新论文
🤖 machine learning

DreamQAS: Learning a Decision-Useful World Model for VQE-Efficient Quantum Architecture Search

DreamQAS 是一个基于模型的强化学习框架,它通过仅学习昂贵的 VQE 反馈并保持精确的电路动力学,从而加速量子架构搜索,与传统的无模型方法相比,显著减少了寻找最优架构所需的真实量子调用次数。

原作者: Jiayang Niu, Yan Wang, Jie Li, Ke Deng, Azadeh Alavi, Muhammad Usman, Yongli Ren

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiayang Niu, Yan Wang, Jie Li, Ke Deng, Azadeh Alavi, Muhammad Usman, Yongli Ren

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人建造一座完美的乐高城堡,但有一个限制:每当机器人增加一块积木时,你都必须把这座半成品城堡送进一台极其昂贵且运行缓慢的慢动作时间机器,让它告诉你这座城堡到底有多稳固。这台时间机器被称为变分量子特征值求解器(VQE),它是检查分子设计是否有效的金标准,但由于它非常昂贵且缓慢,你在预算耗尽之前只能询问它几千次。这就是量子架构搜索(QAS)领域每天都在面临的挣扎——科学家们试图为量子计算机设计出最佳的电路来解决化学问题。核心问题在于:当“真相”如此昂贵难以获取时,你该如何教机器人高效地构建这些电路?你不能盲目猜测,但也无法在每走一步之后都去询问时间机器寻求帮助。

这就是名为“DreamQAS”的论文所提出的巧妙技巧。与其尝试预测每一个可能存在的城堡的精确能量(这就像试图预测世界上每一条街道的天气一样),作者教机器人学会了“做梦”。他们构建了一个了解乐高规则的世界模型(你知道不能把积木放在虚空中,且某些形状是可以契合在一起的),但这个模型只学习如何猜测来自昂贵时间机器的“反馈”。机器人在梦境中练习建造,想象如果搭建出这座城堡会如何稳固,并且只有在它感到非常不确定,或者发现了一个特别有潜力的设计时,才会醒来向真实的机器询问。其结果是,该系统学会了使用比以往方法少得多的真实、昂贵的检查次数,就能构建出更好的量子电路,这证明了有时,良好的想象力是实验室中最有效的工具。

问题所在:昂贵的“时间机器”

在量子计算的世界里,科学家希望模拟分子以发现新的药物或材料。为此,他们使用一种量子电路——即一种特定的量子门排列方式——来表示该分子。目标是找到能产生最低能量的排列方式,这对应于分子的最稳定状态。这个过程被称为变分量子特征值求解器(VQE)。

可以将 VQE 想象成一个非常严格、非常缓慢的裁判。如果你展示一个电路设计,它会运行复杂的优化过程来告诉你精确的能量。但关键在于:运行这个裁判需要耗费大量的时间和计算资源。在寻找最佳电路(即量子架构搜索)的传统方法中,一个计算机程序(“智能体”)尝试逐个量子门地构建电路。在它每添加一个量子门后,它都必须停下来并请求 VQE 裁判给出一个评分。如果智能体想要从数千次尝试中学习,它就必须向裁判询问数千次。这就像是通过在每一步棋之后都请一位特级大师来分析你的棋局来学习下棋一样;在你学会这项技能之前,你就会先耗尽耐心(和金钱)。

解决方案:以梦代检

该论文的作者 Jiayang Niu 及其同事意识到,虽然 VQE 的反馈非常昂贵,但构建电路的规则其实是简单且已知的。你完全清楚添加一个量子门后会发生什么:电路只是变长了。你唯一不能确定的是,这个新电路到底有多好,直到进行昂贵的 VQE 检查为止。

因此,他们开发了 DreamQAS。DreamQAS 不是一个盲目猜测的机器人,也不是一个每走一步都询问裁判的机器人,而是一个学会了“做梦”的机器人。

以下是“梦境”的工作原理:

  1. 现实世界: 机器人首先在现实世界中构建一些电路,并请求 VQE 裁判给出评分。这给了它一小堆“经过验证”的数据。
  2. 梦境世界: 利用这些验证数据,机器人构建了一个“世界模型”。这个模型完美掌握了游戏的规则(它确切知道当添加一个门时电路是如何变化的),但它学会了根据在现实数据中看到的模式来猜测 VVQE 的评分。
  3. 想象训练: 现在,机器人可以在脑海中(它的“梦”)构建数百个新电路。它添加一个门,不是去询问真实的裁判,而是询问它的梦境模型来获取评分。它连续进行许多步骤,创建长期的“想象轨迹”,以此学习哪些动作能带来更好的结果。
  4. 安全网: 机器人知道它的梦境可能会出错。因此,它有一套安全规则。如果梦境模型感到不确定(其内部预测之间存在高度“分歧”),机器人就会停止做梦并醒来,向真实的裁判寻求帮助。如果机器人在梦中发现了一个看起来非常有潜力的设计,它也会醒来进行验证。这防止了机器人迷失在幻想中——在幻想中它以为自己正在建造一座完美的城堡,而实际上城堡却会崩塌。

研究发现:梦境节省了时间

研究人员在五个不同的分子任务上测试了 DreamQS,范围涵盖了从简单的氢化锂(LiH)到更复杂的具有不同量子比特(qubits)数量的氢化铍(BeH2)分子。他们将 DreamQAS 与其他不进行“做梦”或使用不同策略的方法进行了对比。

结果令人印象深刻。在这些模拟实验中,DreamQAS 使用的真实 VQE 调用次数明显少于竞争对手,从而达到了同样高质量的电路设计。

  • 在五个任务中的四个任务上,DreamQAS 使用的真实 VQE 调用次数比标准方法减少了 1.6 到 2.0 倍,达到了相同的准确度。
  • 在最复杂的任务(具有 8 个量子比特的 BeH2)中,节省的幅度非常巨大:DreamQAS 使用的真实 VQE 调用次数减少了 10.6 倍

这意味着,通过花费一点点时间“做梦”(在标准计算机上运行模型),该系统节省了大量原本会浪费在询问昂贵量子裁判上的时间。

为什么“做梦”比单纯“猜测”更好

有人可能会想:“为什么不直接使用梦境模型来挑选最好的电路呢?”论文对此进行了明确测试。他们尝试将梦境模型作为一个简单的指南来挑选下一步的最佳动作(一种“贪婪”方法),但效果并不如完整的做梦过程。

核心洞察在于,梦境模型并不擅长预测完成后的城堡的精确能量。然而,它非常擅长学习动作的相对价值。它学到的是:“如果我添加这个门,分数通常会上升一点”,即使它并不知道最终的确切分数。通过在许多步骤中使用这些相对的提示(多步想象),机器人学会了如何构建整个电路的更好策略,而不是仅仅在每一步都挑选那个“看起来最好”的积木。

论文还表明,机器人判断自身置信度的能力至关重要。模型可以识别出自己何时处于不确定状态(其内部多个“梦想家”之间存在高度分歧)。当它感到不确定时,它会停止做梦并回到现实世界进行检查。这种“具备不确定性感知”的行为防止了机器人浪费时间在糟糕的想法上,或陷入错误猜测的死循环。

总结

DreamQAS 并不是试图取代昂贵的量子裁判;它试图让机器人变得更聪明,知道何时该寻求帮助。通过将电路构建的已知规则与昂贵的反馈分离,并利用“做梦”阶段进行练习,该系统能够更快地学习构建更好的量子电路。

在量子化学领域,每一次计算都意味着巨大的时间与能量成本,这种方法为未来指明了一条道路:不要仅仅靠蛮力解决问题。构建一个理解规则的模型,让它在梦中构思各种可能性,并且只在真正关键的时候才醒来检查现实。作者发现,这种方法不仅能找到更好的设计,而且能以极低的成本实现,这让通往实用量子模拟的道路变得不再那么陡峭。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →