← 最新论文
⚛️ quantum physics

Approximate Quantum State Preparation Through Proximal Policy Optimization

本文提出了一种基于近端策略优化(Proximal Policy Optimization)的深度强化学习框架,旨在高效搜索最优量子线路,从而在各种多比特场景下,以极高的保真度(101410^{-14})逼近目标态,同时最小化门数量。

原作者: Marco Mordacci, Michele Amoretti

发布于 2026-07-24
📖 1 分钟阅读🧠 深度阅读

原作者: Marco Mordacci, Michele Amoretti

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

量子乐高挑战

想象一下,你正试图用乐高积木搭建一座极其复杂、精巧的雕塑。现在,想象一下,每当你添加一个零件时,整个结构都会发生位移、旋转并改变颜色,其方式完全违背了常规物理定律。这就是量子计算的世界。不同于你口袋里的电脑使用简单的开/关开关(比特),量子计算机使用“量子比特”(qubits),它们可以同时存在于多种状态中。为了让这些机器发挥任何实际作用,科学家首先必须进行一种棘手的舞蹈,称为量子态制备(Quantum State Preparation, QSP)。你可以把它看作是“设置”阶段:你从一个空白状态(全为零)开始,需要通过扭转和旋转量子比特,直到它们形成一个非常特定的、理想的图案。

问题在于,随着你增加的量子比特数量增多,排列组合的方式会呈爆炸式增长。这就像是在一个可能性的配方数量增长速度超过你计数能力的宇宙中,试图寻找一个完美的乐高配方。如果你把配方写错了,量子计算机就无法工作。多年来,人类一直尝试手动编写这些配方,但这就像是在试图解开一个形状不断变化的迷宫。这就是**强化学习(Reinforcement Learning)**派上用场的地方。它是一种通过试错来学习的人工智能,有点像训练一只坐下就能得到奖励的狗。AI 尝试一个动作,如果接近目标则获得“奖励”,如果偏离较远则受到“惩罚”,从而在没有人类牵着手的情况下,慢慢摸索出最佳路径。

论文的故事:教机器人构建量子电路

在这篇论文中,来自帕尔马大学的 Marco Mordacci 和 Michele Amoretti 提出了一种解决这个乐高谜题的新方法。他们利用一种特定的强化学习算法——近端策略优化(Proximal Policy Optimization, PPO),构建了一个数字“智能体”(一个聪明的机器人大脑)。他们的目标简单但艰巨:教这个智能体构建一个量子电路,以创建特定的目标状态,同时尽可能使用最少的“门”(quantum gates,即量子的乐高砖块),并使结果在数学允许的范围内尽可能接近完美。

这个智能体循序渐进地工作。它观察当前量子系统的状态,然后决定添加一个新的门。它可选的门就像是一个基础工具箱:三种单比特旋转门(可以理解为在不同方向上旋转单个积木:RxR_xRyR_yRzR_z)以及一个名为 CNOT 的“纠缠”门(它将两个量子比特连接在一起,就像把两块积木卡在一起,使它们作为一个整体运动)。每当智能体添加一个门时,计算机都会运行一次快速的微型训练环节,通过微调旋转的角度,使结果尽可能接近目标。如果结果更接近,智能体就会获得奖励;如果结果变远或使用了过多的门,则会受到惩罚。

研究人员在从 2 个到 5 个量子比特不等的各种挑战中测试了这个“机器人建筑师”。他们要求智能体构建一些著名的、预定义的模式(如“Bell”、“GHZ”、“W”和“Dicke”态,这些都是类似于标准且广为人知的乐高模型),同时也包括完全随机且混乱的模式。

结果令人印象深刻,尤其是在小型系统中。对于 2 比特和 3 比特的任务,智能体经常能找到高效的解决方案,尽管并不总是绝对的理论最小值。例如,当被要求构建一个“Bell 态”(一种简单的两比特连接)时,智能体并没有找到精确的理论解(该解需要一个 Hadamard 门,而这不在它的工具箱内)。相反,它通过使用一个旋转门(RyR_y)来近似实现该效果。在处理随机的 2 比特状态时,它始终能使用 7 个门找到解决方案,这与其他科学家计算出的所需最小门数相吻合。然而,论文指出,在某些情况下,智能体并不能收敛到最优解;它可能会识别出正确的门,但由于惩罚不足而过度使用它们,需要后续进行人工简化。尽管存在这些小瑕疵,该智能体的精度极高,可以将误差率降至 101410^{-14},这意味着结果与完美目标几乎无法区分。

然而,随着谜题规模的扩大,故事变得复杂了一些。当研究人员尝试 4 比特和 5 比特系统时,智能体虽然仍在学习,但在每次都找到最短路径方面遇到了困难。对于随机的 4 比特状态,智能体通常构建的电路包含 47 到 70 个门(平均约为 63 个),而经过人工清理后的“优化版”可以减少到约 53 个。对于 5 个量子比特,搜索空间变得如此巨大,以至于智能体无法在允许的时间内完美完成任务,尽管它展示了自己仍能掌握基本原理。

作者还发现了一个帮助智能体在陷入困境时脱困的聪明技巧。通过使用一个“成功缓冲区”(success buffer)——即一个保存了智能体有史以来找到的最佳 10 个电路并偶尔对其进行重新训练的记忆库——机器人可以更快地找到更好的解决方案。他们还发现,通过改变计算“奖励”的方式,特别是使用对数尺度让微小的改进感觉像是一次巨大的胜利,智能体即使在已经达到 99.999% 的准确度时也能持续学习。

最后,论文表明这种由 AI 驱动的方法是设计量子电路的一种强大新工具。它不仅仅是在模仿人类的想法,而是在自主探索可能性的空间。虽然随着量子比特数量的增加,它会遇到复杂性的壁垒(鉴于该问题的指数级增长特性,这是预料之中的),但该框架成功实现了中小规模量子系统的设计自动化,达到了低至 101410^{-14} 的误差水平。作者指出,未来的工作将集中在如何让训练更快,并测试这些想法在更大规模量子系统上的表现,希望有一天能让这些 AI 建筑师设计出现实世界量子计算机所需的复杂电路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →