在量子机器学习这一新兴领域中,研究人员正试图教计算机利用奇特的量子物理定律从数据中学习。这些系统并非使用大多数设备中常见的标准硅芯片,而是使用量子电路——即通过操纵信息来实现经典计算机无法实现的方式的微型组件网络。为了使这些电路发挥作用,科学家必须对其进行“训练”,这个过程涉及调整数十个“旋钮”(即参数),以最大限度地减少预测中的误差。挑战在于弄清楚应该如何转动这些旋钮。在经典计算中,这通常是通过计算“梯度”来完成的,即一个指向改进方向的数学方向。而在量子世界中,计算这个方向既昂贵又困难,因为系统具有噪声且非常脆弱。目前出现了两种主要方法来解决这个问题:一种是精确但缓慢的方法,它需要对系统进行多次独立的检查以获得准确答案;另一种是利用极少次数检查来猜测方向的捷径,但这种猜测往往摇摆不定且充满了随机误差。
一个研究小组旨在确定这种捷径方法是否足以胜任一项涉及语言理解的实际任务。他们专注于一个被称为“自然语言推理”的具体问题,即计算机必须判断一个句子是否在逻辑上可以由另一个句子推导出来。他们构建了一个拥有六十个可调参数的小型量子模型来解决这项任务。研究人员希望观察,是否可以通过仅仅调整其设置(例如随机猜测的大小和学习速度的变化快慢),就能让这种快速但多噪的捷径方法发挥作用。他们将这种方法与更缓慢、更精确的方法进行了对比,后者作为他们衡量成功的基准。
研究表明,虽然通过调整设置确实提高了捷径方法的性能,但它无法克服一个根本性的缺陷。研究人员在他们的六十参数模型上测试了几十种不同的设置组合。他们发现,当捷径方法与一种能够平滑学习过程的特定类型“动量”相结合时,其表现最好,达到了百分之五十五的测试句子准确率。这比仅达到百分之四十九的默认设置有了显著提升。然而,通过在每一步计算中花费更多时间,精确方法始终能达到百分之七十二至七十四之间的准确率。两者之间的差距依然巨大,捷径方法落后了十六到十九个百分点。
核心问题在于捷径本身的性质。这种方法通过仅两次观察系统的输出结果来估算改进方向。由于依赖于如此小的样本量,所得出的估算值本质上具有噪声,并且在每次尝试中都会剧烈波动。研究人员发现,即使是使用最复杂的调整手段,包括一种试图解释量子空间独特几何结构的技巧,也无法驯服这种噪声。事实上,将这种几何修正应用于带有噪声的捷径,反而使结果变得更差且更不稳定,导致模型的表现甚至比未经过修正的版本还要糟糕。在他们使用的有限训练周期内,噪声实在太强,以至于模型无法可靠地学习。
研究结果表明,对于中小规模的量子模型而言,使用捷径方法所获得的提速并不值得以精度损失为代价。尽管精确方法需要更多的计算步骤,但它提供了更清晰的信号,使模型能够有效地学习。研究人员得出结论,捷径方法所使用的两样本估算值过于多变,在这一背景下无法被信任用于可靠的学习。虽然捷径在那些时间节省至关重要的大型系统中,或者在可以通过其他手段降低噪声的情况下可能仍然有用,但在针对小型量子电路训练语言模型的特定任务中,它目前还不能作为精确方法的可靠替代方案。这项研究强调,在当前量子技术的噪声时代,追求准确性往往仍需依赖精确计算的耐心。
技术摘要:用于变分量子自然语言推理的 SPSA 超参数调优
问题陈述
在含噪声中等规模量子(NISQ)时代,训练变分量子算法(VQA)需要高效的梯度估计。虽然参数平移规则(parameter-shift rules)可以提供精确梯度,但对于每个参数向量而言,其计算成本为 O(P) 次前向评估,这对于较大的电路来说是难以承受的。同时扰动随机逼近法(SPSA)提供了一种更廉价的替代方案,无论参数数量 P 为多少,仅需两次函数评估即可估计梯度。然而,SPSA 会产生高方差的估计值,这可能会降低优化效果,尤其是在具有非凸目标的小型监督任务中。
本文解决的具体挑战是:确定 SPSA 在变分量子自然语言推理(QNLI)任务上的性能缺陷,究竟是由于超参数调优不当,还是由于两样本梯度估计本身存在的固有局限性。此外,本文还研究了使用 Bures 度量进行几何预处理(这有助于精确梯度优化器)是会改善还是加剧 SPSA 梯度的噪声。
方法论
作者对一个使用 Qiskit 实现的 6 量子比特、60 参数的 QNLI 分类器进行了全面的网格搜索,该分类器采用态矢量模拟(statevector simulation)。该模型包含:
- 电路: 3 层作用于 6 个量子比特的 Rx 和 Rz 旋转,并带有最近邻 CNOT 门(36 个参数)。
- 读取层(Readout): 一个线性分类器,包含额外的 24 个可训练权重和偏置,处理由前提-假设对(premise-hypothesis pairs)衍生的拼接特征向量。
- 数据集: 300 个合成 QNLI 样本(210 个训练样本,90 个测试样本),包含三个标签(蕴含、矛盾、中立)。
研究对比了五种优化策略,共进行 40 个 epoch:
- 参数平移 AdamW(Parameter-shift AdamW): 使用精确梯度的基准方法。
- BuresQNG: 由对角 Bures 度量进行预处理的参数平移梯度。
- SPSA-Classical: 标准 SPSA,采用衰减增益调度(ak=η/kγ)。
- SPSA-AdamW: 将 SPSA 梯度估计输入到 AdamW 动量累积中。
- BuresSPSA: 由对角 Bures 度量进行预处理的 SPSA 梯度。
研究针对 SPSA 变体评估了一个广泛的超参数网格:
- 初始扰动尺度 (c0): {0.01,0.05,0.10,0.20}
- 学习率 (η): {0.05,0.10,0.20,0.50}
- 增益衰减 (γ): {0.10,0.30,0.50}
这总共产生了 144 次 SPSA 运行(48 种配置 × 3 种变体),并在三个随机种子下进行了评估。
关键结果
- 性能差距: 尽管进行了广泛的调优,SPSA 仍未能缩小与参数平移基准之间的性能差距。表现最好的 SPSA 配置(采用 AdamW 风格,且 c0=0.01,η=0.10,γ=0.10)实现了 55% ± 11% 的测试准确率。这仍比参数平移 AdamW (72%) 和 BuresQNG (74%) 基准低 16–19 个百分点。
- 超参数敏感性: 最优 SPSA 配置聚集在小扰动(c0≤0.05)、中等学习率和慢衰减(γ=0.10)附近。较大的学习率经常导致发散。
- 优化器比较:
- SPSA-AdamW: 优于经典的增益调度,占据了前十个最佳网格配置中的九个。
- 经典增益 SPSA(Classical-Gain SPSA): 峰值准确率为 51%,但需要较大的学习率和较慢的衰减。
- BuresSPSA: 表现最差,最高仅达到 46%,且具有高度不稳定性(标准差为 10–18 个百分点)。
- 方差分析: 即使是最好的 SPSA 配置,在不同种子之间也表现出高方差(例如 11 个百分点)。SPSA 变体的测试损失稳定在 1.0 附近,显著高于参数平移方法实现的约 0.60。
意义与主张
本文得出结论:对于一个 60 参数的模型及小型监督任务,两样本 SPSA 梯度估计的方差是限制因素,而不仅仅是缺乏超参数调优。
- 固有方差: 在 40 个 epoch 内,两样本估计中固有的噪声对于 60 个参数的可靠优化而言过高。无论是 AdamW 动量还是 Bures 度量,都无法充分抑制这种方差,使其达到与精确梯度相当的性能。
- 适得其反的预处理: 将 Bures 度量应用于带噪声的 SPSA 梯度是有害的。因为该度量根据局部几何敏感性重新缩放更新,它会放大沿敏感电路方向的噪声,而不是纠正噪声。
- 上下文适用性: 作者指出,虽然在此处 SPSA 表现较差,但在编码器规模更大、参数平移的 O(P) 成本在墙钟时间(wall-clock time)上占据主导地位的情况下,只要采用方差缩减策略(例如多次扰动平均),SPSA 可能会具有竞争力。
本研究确立了对于小规模、监督式的 VQA 任务,SPSA 的计算节省目前无法抵消由梯度方差导致的优化质量下降。
每周获取最佳 quantum physics 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。