✨ 要点🔬 技术摘要
在现代物理学和计算机科学的寂静角落,研究人员不断寻找着在数据匮乏时理解世界的方法。想象一位科学家试图预测天气或新材料的行为,但手头只有极少数昂贵的测量数据。在这种“少样本”机制下,计算模型的纯粹算力并不如其内置的直觉重要,或者说专家所称的“归纳偏置”。这正是 Kolmogorov–Arnold 网络旨在解决的具体问题。与通过调整节点处固定开关来进行学习的标准神经网络不同,这些网络通过在连接边上塑造灵活的一维曲线来进行学习。这种结构使得模型的逻辑更容易解释,并且在理论上更适合从极少量的数据中学习。最近,科学家们尝试利用量子力学的奇异规则来构建这些网络,希望量子粒子的独特属性能使其比经典计算机更具优势。一个核心问题仍然存在:这些量子版本究竟是否提供了实际的益处,还是仅仅是实现经典计算机已擅长之事的复杂手段?
一组研究人员致力于以严谨、务实的态度回答这个问题,他们评估了一种被称为“自适应生长变分量子 Kolmogorov–Arnold 网络”的新型量子模型。该系统并非猜测哪些量子设置可能效果最好,而是通过构建一种能够自我生长结构的系统,仅在提升模型性能时才逐一添加量子算符。为了确保结果的可信度,他们设计了一项研究以避免常见的陷阱:他们使用完全相同的随机起点将模型与其他模型进行对比,从未让模型在训练期间窥探测试数据,并在进行任何实验之前就锁定了分析计划。他们在一系列数学挑战上测试了这个量子模型,涵盖了从简单的四变量问题到多达十八维度的复杂场景,且每个任务仅使用十个训练点。
结果描绘了一幅清晰且略显谦逊的图景。当研究人员在四比特量子系统上测试该模型时,其表现并不优于同等规模的标准量子神经网络,且明显逊色于简单的经典计算机模型。然而,当他们转向一个更困难的高维挑战——即模型必须仅凭十个数据点来学习复杂模式时,情况发生了变化。在这种特定的“少样本”机制下,该量子模型确实击败了表现最好的未正则化经典模型以及经过调优的量子神经网络。它实现了良好的泛化能力,在经典竞争对手失败的地方做出了准确的预测。然而,这一胜利并非源于某种神秘的量子力量。当研究人员将该量子模型与使用特定平滑技术(称为核岭回归)的经典方法进行比较时,两者的表现几乎完全一致。量子模型的成功并非在于其表达能力或功能更强大,而在于其天生的约束性;其较小的规模和特定的结构充当了一个内置过滤器,防止了它对微小数据集的过拟合。
随着研究人员增加可用数据量,量子模型的优势消失了。当他们将训练点从十个增加到二十个时,经典模型赶上并超越了量子模型。同样,当他们将问题的复杂度提升到十八维时,量子模型的表现下降到了仅相当于简单猜测的水平,而经过良好调优的经典模型则持续提升。这证实了该量子模型的优势仅限于数据极其匮乏且模型容量被刻意保持在较低水平的一个非常狭窄的窗口期。研究还测试了该模型对现实世界缺陷的韧性。他们模拟了实际量子硬件中的噪声,并将训练好的电路运行在 IBM 的一台拥有 156 个量子比特的真实量子处理器上。该模型表现得异常稳健,其在物理机器上的表现与理想模拟结果的差异不到百分之一。这证明了该模型足以在当今量子设备的噪声和测量误差环境下稳健运行。
最终,这项研究为这些量子网络能做什么以及不能做什么提供了一个可重复的参考基准。它表明,自适应量子 Kolmogorov–Arnold 网络并不是解决所有学习问题的灵丹妙药,也不具备表达能力上的根本量子优势。相反,它作为一个高效的低容量工具发挥作用,提供了一种隐式正则化,使其仅在数据极其有限时才具有实用价值。研究结论指出,对于这些特定任务,一种经过精心选择的经典方法可以达到同样的效果。这项工作的价值在于其清晰度:通过剥离炒作并使用严格的预注册协议,作者展示了量子机器学习的前行之路不在于寻找更大的模型,而在于准确理解这些特定的量子结构在何时以及为何能提供独特但有限的优势。
技术摘要:一种自适应增长的变分量子 Kolmogorov–Arnold 网络用于少样本回归
问题陈述 机器学习正越来越多地应用于从有限数量的高成本测量或模拟中插值物理量。在这种“少样本”机制下,模型的归纳偏置(inductive bias)往往比其原始容量更为关键。Kolmogorov–Arnold 网络(KANs)提供了一种特定的偏置,即通过在网络边缘而非节点上放置可学习的一维函数来实现。虽然已经提出了几种量子实现的 KAN,但其实际效用尚不明确。以往的比较存在方法论上的缺陷:它们依赖于单次训练运行、使用未经调优的基准模型(包括量子和经典模型),并且通常利用测试集进行模型选择,从而引入了数据泄漏。本研究旨在通过一种旨在消除这些干扰因素的协议,对自适应变分量子 KAN(Adaptive VQKAN)进行严格评估。
方法论 作者提出并评估了一种 Adaptive VQKAN ,这是一种变分量子算法,其 ansatz(拟设)是逐算符进行增长的。
架构: 该模型通过 N q = max ( 4 , d ) N_q = \max(4, d) N q = max ( 4 , d ) 个量子比特上的哈密顿量 H ^ \hat{H} H ^ 的期望值,将输入 x ∈ [ 0 , 1 ] d x \in [0, 1]^d x ∈ [ 0 , 1 ] d 映射为标量预测。输入编码使用旋转门 R y ( arccos x j + π / 2 ) R_y(\arccos x_j + \pi/2) R y ( arccos x j + π /2 ) 。一个 KAN 层由一系列 Pauli 串组成,其中每个串携带一个由依赖于测量的单比特期望值的旋转角实现的、可学习的边函数。边函数是具有 8 个可学习控制值的二次 B-样条(quadratic B-splines)。
自适应增长: 训练从单个 Pauli 算符(X 1 X_1 X 1 )开始。每经过 T g T_g T g 个优化步,从候选池(所有一体和二体 Pauli 串)中挑选算符进行尝试性添加,并将其控制值设为零。能够最大程度降低训练成本的算符将被永久采用。这模仿了 ADAPT-VQE 的选择规则,但使用的是成本最小化而非能量最小化。
实验协议: 为了确保可重复性和公平性,研究采用了:
种子配对比较: 所有方法都在相同的随机种子生成的训练集和测试集上进行测试。
严格的模型选择: 模型选择(包括基准模型的超参数调优)完全依赖于训练成本;测试集绝不用于选择过程。
预注册: 在执行前,针对 12、16 和 18 维目标的验证性研究已完成了预注册,并固定了假设、种子和分析脚本。
基准模型: 对比对象包括硬件高效的量子神经网络(QNN)(包括经过调优和未经调优的版本)、经典 KAN、多层感知器(MLP)、线性回归,以及正则化经典回归器(Ridge、通过留一交叉验证 [LOO-CV] 进行调优的 Kernel Ridge 以及高斯过程)。
关键结果 评估在四量子比特基准测试和受控难度的 12、16 及 18 维目标族上进行,仅使用 10 个训练点。
四量子比特基准测试: 在合成的 4-qubit 目标上,Adaptive VQKAN(24 个参数)在统计上与具有相同参数量的 QNN 无异。两者都被经典回归器(线性回归和 MLP)显著超越。在此规模下,未观察到 KAN 结构的优势。
缩放研究(12 和 16 维): 使用 10 个训练点时,拥有 32 个参数的 Adaptive VQKAN 显著优于未正则化的经典回归器和经过调优的 QNN(Holm 校正后 p ≤ 0.017 p \le 0.017 p ≤ 0.017 )。
在 d = 12 d=12 d = 12 时,VQKAN 的误差为 11.1,而表现最好的未正则化经典基准为 13.0。
在 d = 16 d=16 d = 16 时,VQKAN 的误差为 11.7,而基准为 15.0。
然而,使用留一交叉验证(LOO-CV)在相同 10 个点上选择超参数的 Kernel Ridge 回归器 达到了与 VQKAN 相当的性能(例如在 d = 12 d=12 d = 12 时,11.2 vs. 11.1)。
缩放极限(18 维): 在 d = 18 d=18 d = 18 时,量子模型的优势消失;其性能变得与经典预言机(oracle)和常数预测器无异。
鲁棒性: 模型性能对有限测量次数(256 次 shot 产生的结果与精确模拟相当)和门噪声具有鲁棒性。训练后的电路在 156 量子比特的 IBM Heron 处理器(i b m _ m a r r a k e s h ibm\_marrakesh ibm _ ma r r ak es h )上成功执行,测试误差与精确值相比偏差在 0.3 以内。
样本量敏感性: 随着训练点数增加(从 10 到 100),量子模型的误差保持近乎平坦(在 9.5 左右饱和),而经典模型(尤其是经过交叉验证的 Kernel Ridge)则持续显著改善。
机制与解释 作者得出结论,在少样本机制下观察到的 Adaptive VQKAN 的益处并非 源于量子表达能力(expressivity)的优势。相反,它源于一个刻意设计的低容量模型的隐式正则化 。
自适应增长规则选择了极少量的算符(通常是 4 个二体串),导致固定的参数量(32)在高维空间中无法过拟合这 10 个训练点。
未正则化的经典模型会过拟合这些少量点,导致泛化能力差。
量子模型的性能可以被带有适当正则化(LOO-CV)的经典核方法有效复制,这表明量子特征空间并不比可访问的经典核更丰富,而仅仅是受到更多的约束。
意义与主张 本文声称提供了一个关于变分量子 KAN 的资源与极限的可重复参考点 。
它证明了以往关于 KAN 量子优势的说法可能是由于实验设计不当(未经调优的基准、单次运行、数据泄漏)导致的伪影。
它确立了对于所研究的特定目标,量子模型相对于经过良好正则化的经典核方法并无优势,也不具备更优越的表达能力(这由样本量增大时误差趋于饱和所证实)。
研究强调,这种“少样本”益处是一种容量效应,仅在模型过小以至于无法过拟合时存在,且随着维度增加或样本量增加而消失。
作者强调,发布该协议和代码是为了允许未来测试不同的编码方式或目标族(特别是那些在理论上适合 KAN 结构的族)是否能产生真正的量子优势。
每周获取最佳 quantum physics 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。