想象一下,你正试图用一套非常特定、昂贵且脆弱的乐高积木来组装一台复杂的机器。你有一个主蓝图(你想运行的算法),但你手头的说明书是用一种模糊的高级语言编写的,比如“建造一辆飞行汽车”。
问题在于,工厂车间(量子计算机)有着严格的规则:
- 积木很稀缺: 其中一种特定的积木类型(“T门”)制造起来极其昂贵。你希望尽可能少地使用它们。
- 布局很奇特: 有些机器(如 IBM 的)只允许连接紧挨着的积木。而另一些机器(如 IonQ 的)则允许任何积木与任何其他积木连接。
- 目标: 你需要将那个模糊的“飞行汽车”构想转化为一份精确的、分步骤的说明书,同时在遵守工厂布局规则的前提下,使用尽可能少的昂贵积木。
RubriQ 是一个旨在自动解决这个难题的新系统。以下是它的工作原理,通过简单的概念进行拆解:
1. “智能作家”(大语言模型 - LLM)
RubriQ 没有使用遵循固定规则的僵化计算机程序,而是使用了一个大语言模型(LLM)。你可以把它想象成一位非常聪明、富有创造力的作家,他读过数百万份说明书。
- 你给这位作家一个提示词:“为 4 个量子比特的傅里叶变换编写一个量子电路。”
- 作家尝试生成代码。有时他能写出完美的代码;有时他会写出乱码或者遗漏步骤。
2. “严厉的老师”(评分标准 - Rubric)
在过去训练这类 AI 时,计算机只会在最后阶段说“做得好”或“做得差”。这就像一位老师直到期末考试才告诉学生他们不及格,却没解释为什么。这会让学习过程变得缓慢且令人沮丧。
RubriQ 引入了一个评分标准(Rubric),就像老师使用的详细评分细则一样。它不再是简单的“通过/失败”,而是从五个特定维度检查生成的代码:
- Clifford 分数: 你是否使用了廉价、常见的积木?
- T-Count 分数: 你是否最小化了昂贵、稀有的积木的使用?
- 硬件分数: 这段代码是否真的符合你所针对的具体机器(IBM 或 IonQ)?
- 保真度分数: 机器是否真的完成了你要求的任务?
- 效率分数: 这份说明书是否简洁得体?
系统会为每个领域给出分数。这提供了一种“稠密”的信号——大量的反馈——使得 AI 知道该修复代码的哪些部分,而不是靠瞎猜。
3. “小组竞赛”(GRPO)
为了教导 AI,RubriQ 使用了一种名为**群体相对策略优化(GRPO)**的方法。
- 想象一下,你连续要求 AI 解决同一个问题 8 次。
- 你不需要一个专门的“裁判”AI 来告诉你哪一个最好。相反,你只需将这 8 个答案相互进行比较。
- 评分标准得分最高的那个会得到一个“赞”,而得分较低的则会得到一个“踩”。
- AI 通过观察自己群体内的优胜者和失败者来进行学习,并调整自己的写作风格,以便在下次产生更多的“优胜者”。
4. “超级工厂”(HPC)
训练这个 AI 需要极其沉重的计算量。模拟量子电路就像是在尝试同时计算每一种可能的未来天气;它需要巨大的计算能力。
- 研究人员在 NERSC Perlmutter 上运行了这项工作,这是一台拥有数百块强大图形处理器(GPU)的超级计算机。
- 他们构建了一个流水线:AI 生成代码,解析器检查代码是否可读,然后由模拟器在“虚拟工厂车间”上运行以检查分数。
- 因为采用了“评分标准”方法,AI 的学习速度比以往依赖模糊“通过/失败”信号的方法快了 2 到 3 倍。
结果
当研究人员测试 RubriQ 时:
- 它节省了资源: 与标准工具相比,它平均减少了 3.3 倍 的昂贵“T门”使用量。
- 它很准确: 它编写的电路在 IBM 和 IonQ 的真实量子计算机上测试时确实可以运行。
- 它很高效: 它在更少的训练步骤内达到了目标,节省了大量的电力和计算机时间。
简而言之: RubriQ 是一个系统,它通过提供详细的清单(评分标准)来教导一位富有创造力的 AI 作家如何构建量子电路,并通过让它在群体内部进行自我比较来进行学习,最后在强大的超级计算机上运行,以确保其结果能够应用于现实世界的量子机器。
技术摘要:RubriQ – 用于约束感知量子线路合成的基于标尺引导组相对策略优化(Rubric-Guided Group Relative Policy Optimization)
1. 问题陈述
合成既符合算法正确性又具备硬件兼容性的容错量子线路(FTQC)是实现可扩展量子计算的关键瓶颈。主要挑战包括:
- 资源开销: 在 FTQC 中,非 Clifford 操作(特别是 T 门)需要魔法态制备(magic-state distillation),这比 Clifford 门消耗更多的物理资源。最小化 T 门计数对于降低制备开销和调度复杂度至关重要。
- 硬件约束: 近期设备存在严格的拓扑和原生门约束(例如,IBM 的 heavy-hex 连通性与 IonQ 的全连通性),要求高效转译线路以避免过多的 SWAP 开销。
- 现有方法的局限性:
- 启发式编译器(如 Qiskit、TKET)依赖于静态重写规则,缺乏发现新型代数简化的生成能力。
- 标准强化学习(RL) 方法通常受困于稀疏的终止奖励,导致梯度方差高且探索效率低。它们通常作用于狭窄的动作空间(门插入/删除),而非从零开始生成线路。
- 神经评论家(Neural Critics): 在高性能计算(HPC)环境中,训练数十亿参数的评论家网络会引入严重的内存和通信瓶颈。
2. 方法论:RubriQ 框架
RubriQ 将量子线路合成重新定义为一个面向大语言模型(LLM)的结构化代码生成任务,并通过无需学习价值函数的组相对策略优化(GRPO)进行优化。
A. LLM 即合成器
该系统将生成 OpenQASM 或 Qiskit Python 代码视为一个条件代码生成任务。
- 输入: 指定目标算法(如 QFT、哈密顿量模拟)和约束条件的自然语言提示词。
- 模型: 一个经过指令微调的 7B 参数代码 LLM(Qwen2.5-Coder-7B),通过低秩自适应(LoRA)进行微调。
- 生成: 策略针对每个提示词采样 N=8 个候选线路。
- 解析: 多策略解析器从 LLM 的原始文本输出中提取可执行的线路对象。无法解析的输出会被立即赋予零奖励。
B. 基于标尺的奖励引擎
RubriQ 并非使用神经评论家,而是采用了一个确定性的程序化评分引擎,从五个正交维度评估线路。总奖励 R(y) 是加权和:
R(y)=wCSC+wTST+wHSH+wFSF+wESE
- Clifford 比例 (SC): 属于 Clifford 操作(易于模拟)的门所占的比例。
- T 门计数削减 (ST): 一个指数衰减函数,对高 T 门计数进行惩罚,优先消除前几个 T 门,因为制备过程具有批处理特性。
- 硬件兼容性 (SH): 评估对特定后端拓扑(如 IBM Heavy-Hex、IonQ All-to-All)的合规性,惩罚 SWAP 路由开销和非原生门。
- 功能保真度 (SF): 通过生成的幺正算符与目标算法之间的 Hilbert-Schmidt 内积计算过程保真度,确保算法正确性。
- 线路效率 (SE): 奖励紧凑性和更低的线路深度。
C. GRPO 训练循环
RubriQ 利用组相对策略优化(GRPO)来更新策略:
- 组归一化: 对于给定的提示词,通过减去组均值并除以组标准差来对 N 个采样的完成结果进行归一化。
- 无评论家: 该方法消除了对学习型价值函数的需求,转而依赖于标尺提供的密集、确定性的信号。
- 优势估计: 归一化后的优势 A^i 驱动策略梯度更新,使模型能够从分级的反馈而非稀疏的二元成功/失败信号中学习。
D. HPC 系统架构
为了处理保真度模拟的高昂计算成本(其复杂度随量子比特数 nq 按 O(4nq) 缩放),RubriQ 部署在 NERSC Perlmutter 超级计算机上:
- 硬件: 通过 Slingshot-11 连接的 NVIDIA A100 (80 GB) 集群。
- 优化: 使用 DeepSpeed ZeRO-2 进行分布式梯度和优化器状态分区。
- 模拟: 将 GPU 加速的 CUDA-Q 模拟直接集成到 RL 循环中,以实现高吞吐量的保真度评估。
- 效率: 在 8 个 GPU 上实现了 >85% 的强扩展效率。
3. 核心贡献
- LLM-as-Synthesizer 形式化: 首次将数十亿规模、经指令微调的 LLM 应用于门级量子合成,并结合基于 RL 的后训练,超越了小型 Transformer 模型或启发式规则。
- 多目标标尺奖励引擎: 一种创新的神经评论家替代方案,利用具有领域基础且可解释的评分系统,在 Clifford、T 门计数、硬件、保真度和效率维度提供密集且有界的奖励。
- 可扩展的 HPC 架构: 在 NERSC Perlmutter 上的完整训练流水线实现,证明了其在处理指数级复杂度的量子优化任务时,能实现优于稀疏奖励基准的强扩展性,并减少了 2–3 倍的总模拟调用次数。
- 硬件验证评估: 通过自动化转译流水线,将合成的线路成功部署在物理 IBM Heron-3 和 IonQ Forte 处理器上。
- 实验性能: 在 1,500 个基准电路测试中表现出卓越性能,实现了显著的 T 门压缩,并比现有基准具有更快的收敛速度。
4. 结果
- T 门压缩: RubriQ 在基准数据集上实现了 3.31× 的平均 T 门压缩,显著优于稀疏奖励 RL 基准(2.05×)和基于规则的编译器(Qiskit O3: ~1.4×, TKET O2: ~1.7×)。
- 收敛速度: 该框架的收敛速度比稀疏奖励 RL 方法快 2–3×,达到目标压缩率所需的训练轮数更少。
- 资源效率: 由于收敛更快,RubriQ 相比 Sparse-PPO 和 Sparse-GRPO 基准减少了约 2.6× 的总 GPU 小时数。
- 约束遵循: 系统保持了低于 1% 的硬件约束违规率,并实现了极高的功能保真度(许多情况下 >99%)。
- 硬件验证: 排名前列的线路已成功在 IBM 和 IonQ 硬件上执行,证实了其在实际应用中的可行性。
5. 意义与主张
论文声称 RubriQ 通过将 LLM 驱动的代码生成与可验证的基于标尺的强化学习相结合,为自动化科学发现建立了一种新范式。其意义在于:
- 可扩展性: 证明了 LLM 式合成可以扩展到 HPC 环境,以解决量子计算中的指数级复杂度问题。
- 约束感知: 在单一优化框架内,成功解决了 FTQC 就绪性(T 门计数最小化)与近期硬件兼容性(拓扑约束)的双重需求。
- 效率: 证明了对于该领域,密集的程序化奖励塑造在计算上优于稀疏奖励或神经评论家,从而能够在现实的量子工作负载上训练大型模型。
- 实用性: 验证了 AI 生成的线路不仅在理论上是最优的,而且可以在当前一代量子硬件上执行。
作者将 RubriQ 定位为实现大规模、高性能计算驱动的故障容错、硬件就绪量子线路生成流程的关键一步。
每周获取最佳 quantum physics 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。