✨ 要点🔬 技术摘要
在现代计算不断演进的格局中,两个强大的世界正开始融合:一个是用于模拟气候变化和设计新材料的庞大经典超级计算机,另一个是正处于实验阶段、有望解决目前人类无法触及的问题的脆弱量子机器。这种融合创造了一种新型的混合系统,其中经典计算机充当“大脑”,向量子处理器发送特定任务,使其作为一种专门的加速器发挥作用。然而,这些量子机器目前正处于困难的发展阶段。它们具有噪声,这意味着它们的计算容易出错,并且规模有限,仅有少量的量子比特可用。因此,仅仅将程序发送到量子计算机是不够的;程序必须经过精心的准备、重塑,并使其与它将要运行的特定机器的特性相匹配。如果准备工作出错,结果将会是垃圾。挑战在于确定究竟该使用哪台机器以及如何为它转换代码,这项任务涉及在一个广阔且不断变化的可能性迷宫中进行导航。
德国莱布尼茨超算中心的研究人员,与慕尼黑工业大学和阿贡国家实验室的合作伙伴一起,提出了一种解决这一难题的新方法。他们将该系统称为 MQSS-Selector,这是一个旨在为整个过程提供统一引导的工具。该系统并没有将硬件的选择和软件的准备视为独立的步骤,而是学习同时做出这两种决策。团队利用一种称为强化学习的方法构建了这个工具,这是一种人工智能类型,其中计算机程序通过试错来学习,就像孩子学习骑自行车一样。程序尝试不同的量子设备和代码转换组合,接收关于结果效果如何的反馈,并逐渐学会选择最佳路径。
研究人员应对的核心难点在于,选择设备和排列代码步骤的问题极其复杂。事实上,随着选项数量的增加,要在每一个案例中快速找到完美解在数学上是不可能的。传统方法依赖于固定的规则或猜测,当量子机器改变其行为或引入新型代码时,这些方法往往会失效。研究人员证明了他们的基于学习的方法可以驾驭这种复杂性。他们创建了一个系统,该系统能够观察量子程序的特定特征,检查可用机器的当前状态,然后选择最合适的设备。同时,它决定应用哪种序列的代码优化,以使程序在该特定机器上高效运行。
为了测试他们的想法,团队在一个大型量子程序集上训练了他们的系统,其中包括旨在模拟化学分子的程序。他们将这种基于学习的选择器与标准方法进行了比较,发现引导模型在何时停止优化方面采取了一种非常保守的策略。虽然没有引导的模型在几乎所有情况下都未能调用“结束”动作,但引导模型在绝大多数试验中成功终止了过程,尽管它在召回率方面表现较低,即它错过了许多识别有效停止点的潜在机会。在程序结构方面,该系统并未产生更短的程序;与输入相比,生成的程序的深度和操作计数平均而言显著增加了。然而,引导方法确实提高了整体编译性能,确保了程序在 95.5% 的情况下是可执行的,这比非引导模型有了显著提升。当研究人员引入一种特殊的训练技术来帮助系统在庞大的可能性中探索而不至于迷失时,结果在可靠性方面得到了改善,尽管系统仍然难以识别所有的有效优化机会。
研究还表明,虽然该系统在选择设备方面表现良好,但负责排列代码步骤的部分仍需更多练习。研究人员发现,如果没有特殊的训练引导,系统很难独立找到好的解决方案,经常在无用的代码变更组合中徘徊;事实上,实验数据表明,在所考虑的资源约束下,如果不使用附加方法,强化学习并不是训练编译网络的可行途径。然而,通过引导,系统学会了专注于最有希望的路径,尽管表现得非常保守,从而实现了更可靠的执行。这表明,虽然作为量子计算的单一统一引导的概念是可行的,但它需要精心的训练和大量的数据才能真正发挥效用。团队的工作表明,通过将硬件的选择和软件的准备合并为一个智能决策过程,我们可以更接近于让量子计算机成为解决现实世界问题的有用工具。他们的研究结果表明,这种方法不仅仅是一个理论构想,而是一条切实可行的路径,能够适应当今量子机器具有噪声且多变的特性,前提是系统能获得足够的引导以克服任务固有的难度。
技术摘要:MQSS-Selector
问题陈述与动机 高性能计算(HPC)与量子计算(QC)向统一的 HPCQC 基础设施的融合,要求软件栈能够架起经典与量子工作流之间的桥梁。然而,当前的含噪声中型规模量子(NISQ)设备存在易出错、资源受限以及对校准和拓扑结构高度敏感的问题。因此,有效的执行需要专门的编译与优化。
现有的软件栈通常存在碎片化问题,将设备选择、编译器 Pass 优化和作业调度视为孤立的阶段。本文确定了两个关键且相互依赖的挑战:
设备选择: 从一组可用后端中选择目标量子设备,需考虑拓扑结构、门保真度、队列延迟和维护窗口。
相位排序(Phase Ordering): 确定变换量子程序的最佳编译器 Pass 序列,在确保符合设备规范的同时,最小化即时编译(JIT)时间和执行运行时。
作者正式证明(定理 1),设备选择和相位排序均为 NP-hard 问题,尽管它们归约为不同的硬度基础:设备选择归约为划分问题(Partition problem),而相位排序归约为停机问题(证明了其不可判定性)。此外,两者的相互依赖性造成了“引导困境”(bootstrapping dilemma),即孤立地优化其中一个阶段可能会导致另一个阶段的次优结果。目前的解决方案通常依赖于静态启发式算法或独立的学习任务(例如,用于设备的监督学习、用于 Pass 的强化学习),这些方法无法应对动态的后端状况或联合优化空间。
方法论 本文提出了 MQSS-Selector ,这是一个统一的、基于学习的框架,旨在将设备选择和 Pass 排序集成到一个凝聚的决策过程中。该方法利用机器学习中间表示(MLIR)编译框架(具体使用 Quake 方言)中的强化学习(RL)和深度学习。
该方法围绕统一调度器的两个概念方案构建,目前这两个方案被实现为独立的组件,计划在未来进行集成:
方案 1(混合式): 一种模块化设计,由监督学习模块处理设备选择,其输出为独立的基于 RL 的相位排序模块提供信息。
方案 2(全 RL 式): 一种单体化设计,将设备选择和相位排序合并为一个更大的单一 RL 智能体的动作空间。
核心组件:
设备选择模块: 利用监督学习模型(MLP、随机森林、SVM、KNN)预测程序在不同设备上的 Hellinger 保真度。系统通过归一化执行时间和保真度来进行设备排名,优先考虑相对排名精度而非绝对值精度。
Pass 选择模块: 实现了一种 Actor-Critic 强化学习算法。
状态(State): 包括程序特征(量子比特数、深度)、后端状态和中间编译结果。
动作(Action): 从扩展的 MQSS Pass 套件(92 个以上 Pass)、映射 Pass 或“完成(Finish)”动作中进行选择。
奖励函数(Reward Function): 设计旨在满足可执行性(原生门合规性)、早期停止(偏好获得同等结果但路径更短的过程)和结构优化(减少深度和操作计数)。
双退火探索引导(DAEP): 为解决编译展开成功率稀疏问题而引入的一种新颖训练策略。DAEP 在损失函数中引入了一个引导项,通过以衰减概率(p D A E P p_{DAEP} p D A E P )和幅度(α D A E P \alpha_{DAEP} α D A E P )覆盖 Actor 的选择,将其替换为预定义的策略。这通过在智能体学会独立利用 Critic 估计之前提供初始结构,从而加速收敛。
实验结果 作者使用两个数据集评估了各组件:
设备选择: 在 128 个 MQT-Bench 程序、12 个模拟 IBM 后端以及两个真实本地设备上的 2,880 个随机基准测试上进行了测试。
发现: 随机森林(RF)在模拟设备数据集上表现为最合适的候选模型,优于在不可行程序预测方面表现挣扎的 MLP。在所有程序均可执行的真实设备上,所有模型的表现相似,且具有较高的 R 2 R^2 R 2 分数。作者指出,虽然 SVM 和 KNN 在有限数据下显示出良好的保真度预测能力,但对于多样化、大规模的程序集,其扩展性可能不如随机森林。
Pass 选择: 在包含 1,548 个化学哈密顿量程序的数据集上进行了评估。
发现: 经过 DAEP 训练的 RL 智能体显著优于无引导的基准模型。
可执行性: 经过引导的模型在终止时实现了 95.5% 的程序可执行率,而无引导模型仅为 42.1%。
优化: 引导模型在 154 个样本中的 87 个样本中减少了程序深度,并在 154 个样本中的 93 个样本中减少了操作计数;相比之下,无引导模型分别仅在 8 个和 15 个样本中实现了这些减少。
终止: 引导型智能体学会了有效地调用“完成(Finish)”动作(153/154 次),而无引导智能体很少提前终止。
评述: 作者指出 Critic 网络仍需进一步训练,因为在引导模型中,其分类性能(真/假阳性)表现较为保守,这可能是由于 Actor 学会了以更少的步骤高效完成,从而为 Critic 提供了较少的训练样本。至关重要的是,实验数据表明,在所考虑的资源约束下,如果不使用诸如 DAEP 之类的方法,单纯依靠强化学习并不是训练编译网络的可行途径。
意义与主张 本文声称展示了数据驱动、MLIR 原生量子编译方法的基础构建模块(监督式设备选择和基于 RL 的 Pass 排序)的可行性。主要贡献包括:
统一框架概念: 本文提出了一个联合优化框架,以应对设备选择和 Pass 选择之间具有 NP-hard 且相互依赖的特性,从而摆脱碎片化的、针对特定阶段的启发式算法。然而,统一调度器本身仍是一个概念性设计,其两个组件计划在未来集成,而非一个已完全演示的集成系统。
MLIR 原生实现: 不同于以往针对 Qiskit 的工作(如 TuniQ),本研究扩展了 MQSS X 编译 Pass 套件,包含大量基于 MLIR 的 Pass,从而能够与现代编译器基础设施集成。
DAEP 策略: 引入的双退火探索引导(DAEP)解决了编译任务中奖励稀疏的问题,使 RL 智能体能够在随机探索失效的情况下学习到有效的策略。
审慎展望: 作者总结道,虽然统一方法通过利用相互依赖性,具有超越独立优化流水线的潜力,但 Pass 选择组件目前仍需要更广泛的训练和引导。他们强调,当前的工作是为能够处理动态 HPCQC 环境的集成自适应调度器建立基础构建模块,而非声称该统一系统已完全实现。
每周获取最佳 quantum physics 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。