← 最新论文
⚛️ quantum physics

RubriQ: Rubric-Guided Group Relative Policy Optimization for Constraint-Aware Quantum Circuit Synthesis

RubriQ 是一个可扩展的、由高性能计算(HPC)驱动的框架,它利用基于准则引导的组相对策略优化(GRPO)结合 GPU 加速仿真,自动合成既能实现显著的 T 门压缩,又能严格遵守硬件约束并保持高保真度的容错量子电路。

原作者: Ziqing Guo, Ziwen Pan

发布于 2026-07-09
📖 1 分钟阅读🧠 深度阅读

原作者: Ziqing Guo, Ziwen Pan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图用一套非常特定、昂贵且脆弱的乐高积木来组装一台复杂的机器。你有一个主蓝图(你想运行的算法),但你手头的说明书是用一种模糊的高级语言编写的,比如“建造一辆飞行汽车”。

问题在于,工厂车间(量子计算机)有着严格的规则:

  1. 积木很稀缺: 其中一种特定的积木类型(“T门”)制造起来极其昂贵。你希望尽可能少地使用它们。
  2. 布局很奇特: 有些机器(如 IBM 的)只允许连接紧挨着的积木。而另一些机器(如 IonQ 的)则允许任何积木与任何其他积木连接。
  3. 目标: 你需要将那个模糊的“飞行汽车”构想转化为一份精确的、分步骤的说明书,同时在遵守工厂布局规则的前提下,使用尽可能少的昂贵积木。

RubriQ 是一个旨在自动解决这个难题的新系统。以下是它的工作原理,通过简单的概念进行拆解:

1. “智能作家”(大语言模型 - LLM)

RubriQ 没有使用遵循固定规则的僵化计算机程序,而是使用了一个大语言模型(LLM)。你可以把它想象成一位非常聪明、富有创造力的作家,他读过数百万份说明书。

  • 你给这位作家一个提示词:“为 4 个量子比特的傅里叶变换编写一个量子电路。”
  • 作家尝试生成代码。有时他能写出完美的代码;有时他会写出乱码或者遗漏步骤。

2. “严厉的老师”(评分标准 - Rubric)

在过去训练这类 AI 时,计算机只会在最后阶段说“做得好”或“做得差”。这就像一位老师直到期末考试才告诉学生他们不及格,却没解释为什么。这会让学习过程变得缓慢且令人沮丧。

RubriQ 引入了一个评分标准(Rubric),就像老师使用的详细评分细则一样。它不再是简单的“通过/失败”,而是从五个特定维度检查生成的代码:

  • Clifford 分数: 你是否使用了廉价、常见的积木?
  • T-Count 分数: 你是否最小化了昂贵、稀有的积木的使用?
  • 硬件分数: 这段代码是否真的符合你所针对的具体机器(IBM 或 IonQ)?
  • 保真度分数: 机器是否真的完成了你要求的任务?
  • 效率分数: 这份说明书是否简洁得体?

系统会为每个领域给出分数。这提供了一种“稠密”的信号——大量的反馈——使得 AI 知道该修复代码的哪些部分,而不是靠瞎猜。

3. “小组竞赛”(GRPO)

为了教导 AI,RubriQ 使用了一种名为**群体相对策略优化(GRPO)**的方法。

  • 想象一下,你连续要求 AI 解决同一个问题 8 次。
  • 你不需要一个专门的“裁判”AI 来告诉你哪一个最好。相反,你只需将这 8 个答案相互进行比较
  • 评分标准得分最高的那个会得到一个“赞”,而得分较低的则会得到一个“踩”。
  • AI 通过观察自己群体内的优胜者和失败者来进行学习,并调整自己的写作风格,以便在下次产生更多的“优胜者”。

4. “超级工厂”(HPC)

训练这个 AI 需要极其沉重的计算量。模拟量子电路就像是在尝试同时计算每一种可能的未来天气;它需要巨大的计算能力。

  • 研究人员在 NERSC Perlmutter 上运行了这项工作,这是一台拥有数百块强大图形处理器(GPU)的超级计算机。
  • 他们构建了一个流水线:AI 生成代码,解析器检查代码是否可读,然后由模拟器在“虚拟工厂车间”上运行以检查分数。
  • 因为采用了“评分标准”方法,AI 的学习速度比以往依赖模糊“通过/失败”信号的方法快了 2 到 3 倍

结果

当研究人员测试 RubriQ 时:

  • 它节省了资源: 与标准工具相比,它平均减少了 3.3 倍 的昂贵“T门”使用量。
  • 它很准确: 它编写的电路在 IBM 和 IonQ 的真实量子计算机上测试时确实可以运行。
  • 它很高效: 它在更少的训练步骤内达到了目标,节省了大量的电力和计算机时间。

简而言之: RubriQ 是一个系统,它通过提供详细的清单(评分标准)来教导一位富有创造力的 AI 作家如何构建量子电路,并通过让它在群体内部进行自我比较来进行学习,最后在强大的超级计算机上运行,以确保其结果能够应用于现实世界的量子机器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →