RubriQ: Rubric-Guided Group Relative Policy Optimization for Constraint-Aware Quantum Circuit Synthesis
RubriQ 是一个可扩展的、由高性能计算(HPC)驱动的框架,它利用基于准则引导的组相对策略优化(GRPO),实现量子电路合成的自动化,从而同时满足算法正确性、表面码成本最小化以及近期待用硬件约束。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图制造一台能够解决当今任何计算机都无法完成的任务的机器。这台机器是量子计算机,它利用微观粒子的奇特规则进行极速运算。但问题在于:这些机器极其脆弱。为了让它们发挥作用,我们需要将宏大、复杂的想法转化为一种非常特定的、底层的“门”(gates,即开关)语言,因为这才是机器能理解的语言。
问题在于,这种转化简直是一场噩梦。如果你只是让一台标准计算机来做这件事,数学规模会变得巨大无比,导致系统崩溃。如果你试图用现有的技术来构建它,它又太嘈杂且容易出错。因此,科学家们陷入了一个中间地带:他们需要设计出既能满足未来超级机器的完美要求,又能足够简单、能在当今不稳定的原型机上运行的电路。这就像是在尝试编写一份五星级宴会的食谱,但要求一个蹒跚学步的孩子也能在不烧毁厨房的前提下把它做出来。
于是,RubriQ 诞生了,它是一个全新的工具,充当了这些量子食谱的超级聪明且不知疲倦的编辑。RubriQ 并不只是盲目地猜测和尝试,它使用一个巨大的 AI,通过同时尝试数千种变体来进行学习,并由一套严格的“评分标准”(rubric,即评分表)进行引导,这套标准会明确告诉它如何改进。它不仅仅是在寻找“足够好”的方案,而是在寻找数学上的完美无瑕与在现有硬件上运行的实用性之间的完美平衡。
RubriQ 的故事:教导 AI 成为量子架构师
把设计量子电路想象成要求一名学生写故事。在过去,如果你要求计算机编写一个量子程序,就像是给学生一个模糊的提示词,比如“写点酷的东西”,然后寄希望于他们不会胡编乱造。如果他们写错了,你只会说“不对,再试一次”,却完全不知道错在哪里。这就是旧方法所做的:它们提供的是“稀疏奖励”(sparse reward),这意味着只有当答案 100% 完美时,AI 才会得到一分,除此之外任何情况都得零分。这使得学习过程极其缓慢且令人沮丧,就像在黑暗中练习骑自行车一样。
RubriQ 改变了游戏规则,它扮演着一位拥有详细评分标准的严厉但乐于助人的老师。它不再只是简单地说“通过”或“失败”,而是将评分细分为五个特定类别:
- 它奏效了吗?(故事逻辑通顺)。
- 它高效吗?(是否用了太多词?在量子术语中,这是关于减少“T 门”的问题,T 门是那些昂贵且耗资源的组成部分)。
- 它的 Clifford 占比如何?(是包含了太多难以制造的高级动作,还是大部分都是简单的动作?)。
- 它能在今天的机器上运行吗?(是否符合特定硬件的形状,就像把方榫头塞进圆孔里那样?)。
- 它快吗?(需要多少步?)。
该论文介绍了一种称为组相对策略优化(GRPO)的方法。想象一下,AI 是一位正在发明新菜肴的大厨。与其做出一道菜然后等待评价,RubriQ 要求大厨同时做出八个不同版本的菜肴。然后,它会对这些版本进行相互比较。如果其中一个版本比其他版本稍好一些,AI 就会学习制作更多这类菜肴。如果某个版本是一场灾难,它就会学习避开那条路径。这种“组内”比较比等待单个完美答案要快得多,也更稳定。
他们是如何制造这台机器的
为了实现这一目标,研究人员必须构建一个庞大的引擎。他们不能只在笔记本电脑上运行这个程序;它需要 NERSC Perlmutter 的动力,那是位于劳伦斯伯克利国家实验室的一个超级计算机集群。他们使用了 8 张 NVIDIA A100 GPU(用于 AI 的重型显卡)来运行模拟。
其中的巧妙之处在于:AI 并不只是瞎猜。它使用了一种程序化评分标准。这意味着“老师”不是一个可能会感到困惑的黑盒神经网络,而是一套硬编码的规则,能够瞬间检查数学逻辑、成本和硬件限制。如果 AI 生成的电路看起来很酷但在数学上失败了,评分标准会立即给它零分。如果它生成的电路虽然有效但使用了过多的昂贵“T 门”,评分标准会给出一个较低的分数,从而促使它变得更加高效。
他们还解决了一个主要的瓶颈问题:模拟速度。检查一个量子电路是否有效通常需要模拟整个过程,随着增加更多量子比特(qubits),这会呈指数级变得困难。RubriQ 集成了 CUDA-Q,这是一个允许他们在 GPU 上直接运行这些模拟的工具,这使得处理过程比在标准 CPU 上运行快了数千倍。
他们的发现
研究结果令人振奋,尽管作者在描述时非常谨慎,将其定位为迈出的重要一步而非万能灵药。
- 它比旧方法效果更好: 在对 1,500 个不同的量子任务进行测试时,RubriQ 实现了 96% 的正确率。这意味着几乎每次尝试,它都能生成执行正确数学运算的电路。
- 它更加高效: 量子计算机最重要的指标是“T 计数”(T-count,即昂贵门的数量)。与那些仅仅是“正确”但未经过优化的电路相比,RubriQ 平均将这些门的数量压缩了 3.31 倍。这意义重大,因为更少的 T 门意味着计算机需要更少的资源和更短的时间来运行。
- 它学习得更快: 由于它使用这些详细的评分标准而不是等待完美分数,RubriQ 的收敛速度(即掌握任务的速度)比其他依赖稀疏奖励的强化学习方法快了 2 到 3 倍。
- 它已准备好适配真实硬件: 团队并没有止步于模拟。他们将 RubriQ 生成的最佳电路在 IBM 和 IonQ 的真实量子计算机上进行了运行。他们发现,这些电路与这些机器是兼容的,硬件约束的违规率低于 1%。
这意味着什么
论文指出,通过将量子电路综合视为一种受严格的多维评分标准引导的代码生成任务,我们可以实现高质量量子程序的自动化创建。它反对认为我们需要复杂的、通过学习得到的“评论家”网络来评判 AI 作品的观点;相反,一个清晰的、基于规则的评分系统效果更好,且运行成本更低。
虽然论文并未声称已经解决了量子计算的所有问题,但它展示了一条可行的前进路径。通过将大语言模型(LLMs)的创造力与程序化评分标准的严谨纪律相结合,RubriQ 提供了一种设计电路的方法,这些电路不仅在数学上是可靠的,而且在面对如今嘈杂、不完美的机器时也具有实用性,同时也为未来的容错型量子巨头做好了准备。它是连接当前混乱的硬件现实与纯净的未来量子计算世界的一座桥梁。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。