在物理学研究粒子如何在大规模群体中共同行为的寂静角落里,一种强大的工具已经出现,用以理解那些看似不可能的事物。这种被称为张量网络(tensor network)的工具,最初旨在模拟量子粒子复杂的舞蹈,帮助研究人员理解物质如何趋于其最稳定的状态。你可以将其想象为一种方法,通过一组可控的构建模块来描述一个庞大且复杂的系统,而不是试图将每一个细节都存储在计算机的内存中。最近,科学家们开始借鉴这些思想用于机器学习,希望教计算机利用统治量子世界的同样高效的逻辑来识别模式。其目标是创建不仅功能强大,而且能够运行在未来的量子计算机上的学习系统,而这些计算机的操作原理与我们今天的设备完全不同。然而,一个显著的障碍存在着:量子系统有一个严格的规则,即所有可能结果的总概率必须始终等于一,而标准的学习方法往往忽略了这一条件。
一个研究团队致力于通过将一种特定的优化技术——密度矩阵重整化群(DMRG)应用于机器学习,来弥补这一差距。这种长期作为量子物理学支柱的方法,以通过逐个调整系统的组成部分来寻找系统最佳配置而闻名。研究人员将这种方法应用于一种基于矩阵乘积态(matrix product states)的神经网络架构,矩阵乘积态是一种将数据排列成链状结构的张量网络。他们的主要创新在于将量子力学的严格归一化规则直接强制执行到学习过程中。这意味着,当计算机调整其内部参数以从数据中学习时,它被强制要求保持系统数学表示的完美平衡,正如自然界所要求的那样。他们测试了两种实现方式:一种是使用梯度进行逐步调整的标准方法,以及他们新的改进版 DMRG 算法,后者使用一种更复杂的数学捷径来寻找最优解。
为了验证他们的想法是否奏效,该团队训练这些系统去识别来自著名的 MNIST 数据集的手写数字,这是计算机学习识别零到九等数字的标准基准。他们使用了 5,000 张图像的子集,并将它们调整为 49 个像素的小型网格,然后将其分为训练组和测试组。结果显示,在量子约束下,系统的行为表现出显著差异。当他们使用不带归一化约束的标准优化方法时,系统达到了 94.7% 的测试准确率。然而,系统的内部数学状态变得如此庞大且失衡,以至于它不再代表一个有效的量子态。论文指出,该状态的范数约为 390 万。当研究人员强制使这个失衡的状态符合规则进行归一化时,损失函数中的重叠变得微乎其微,导致了一个约 0.5 的平凡损失。这表明,虽然无约束方法产生了较高的准确率指标,但生成的模型并不是一个有效的量子态,无法在不丢失其学习属性的情况下直接部署在量子硬件上。
相比之下,那些从一开始就强制执行归一化条件的模型表现得不同。归一化梯度下降法和改进后的 DMRG 方法都产生了尊重量子规则的系统,但它们并未达到与无约束方法同样高的准确率。归一化梯度下降和改进后的 DMRG 都达到了约 73% 的测试准确率,损失值在 0.36 附近波动。虽然这些数值低于无约束方法,但它们代表了一个真实的、稳定的学习过程,实际上可以在量子计算机上运行。研究人员发现,使用特定数学压缩技术来解决优化问题的改进版 DMRG 算法,其表现与归一化梯度下降几乎完全一致,这证实了这种受量子启发的捷径是一个可行的替代方案。
研究得出结论,虽然强制系统遵守量子规则使其目前的形式与标准经典方法相比显得不够强大,但这是迈向未来的一步。无约束方法的高准确率是通过忽略量子世界的根本法则来实现的,从而导致生成了一个并非有效量子态的模型。通过接受目前的较低准确率,研究人员建立了一个数学上严谨且为量子硬件做好准备的基础。他们承认,仍需更多的工作来提高性能并开发处理这些约束的更复杂方法,但前进的道路是清晰的:要将机器学习带入量子计算机,算法必须首先学会尊重量子领域的严格规则。
技术摘要:基于 DMRG 的量子张量网络学习
问题陈述
张量网络(TN),特别是矩阵乘积态(MPS),已成为一种受量子多体物理启发、极具前景的机器学习架构。虽然标准的 TN 方法通常利用梯度下降进行优化,但它们往往缺乏物理量子态所必需的严格归一化条件。在量子力学中,概率守恒要求量子态和量子信道必须是归一化的。本文解决了如何使基于 TN 的机器学习满足这些归一化约束的挑战,从而实现这些模型在量子计算机上的直接部署。作者指出,在将局部优化技术(特别是密度矩阵重整化群 DMRG 及其底层的 Lanczos 方法)迁移到归一化量子机器学习语境时存在空白。
方法论
作者提出了一个框架,其中 MPS 拟设(ansatz)被约束为在收缩后产生一个归一化向量,从而有效地代表一个量子态。其核心方法在于修改标准优化算法,以尊重单位范数约束(⟨Ψ∣Ψ⟩=1)。
损失函数与约束:
作者为分类任务定义了一个均方误差损失函数 L。与可能导致最优解为 A−1∣b⟩ 的无约束优化不同,归一化约束要求解位于希尔伯特空间的单位球面上。损失函数公式化为:
L=21+2N1i=1∑N[⟨Ψ∣(∣di⟩⟨di∣D⊗1B)∣Ψ⟩−2Re(⟨Ψ∣DB(∣di⟩D⊗∣li⟩B))]
其中 ∣di⟩ 代表输入数据,∣li⟩ 代表标签。
带归一化的梯度下降:
作者通过改进梯度下降算法来处理归一化约束。他们没有采用简单的更新,而是采用了投影梯度下降方法。在计算梯度步 ∣n⟩=∣Ψ⟩−α∣g⟩ 后,对状态进行重归一化:∣Ψ′⟩=∣n⟩/⟨n∣n⟩。为了优化效率,他们通过令损失函数对 α 的导数为零,推导出了最优步长 α 的条件,并使用牛顿迭代法求解 α。
改进的 DMRG 算法:
作者认识到 Krylov 子空间方法(如 DMRG)通常比简单的梯度下降更有效,因此开发了一种改进的 DMRG 算法。标准 DMRG 最小化能量期望值,但并未本质地考虑机器学习损失函数中的线性项(公式 3)。
- 后处理步骤: 在 Lanczos 算法将局部有效哈密顿量 As 压缩为三对角形式 As′ 之后,作者引入了一个后处理步骤。他们求解一个缩放因子 x,使得归一化状态的梯度垂直于单位球面。
- 解析解: 通过将问题分解为压缩矩阵的特征基,他们推导出了确保满足归一化约束的 x 的方程(公式 6)。他们证明了对于 x<0,存在唯一的全局最小值,并通过仔细初始化以确保收敛的牛顿迭代法求解该值。
主要贡献
- 归一化条件: 为 MPS 拟设引入了全局归一化条件,确保生成的向量可以映射为有效的量子态。
- 算法适配: 修改了梯度下降和 DMRG/Lanczos 算法,使其能在该归一化约束下运行。
- 对比分析: 对标准共轭梯度下降、归一化梯度下降以及所提出的改进型 DMRG 方法进行了直接比较。
实验结果
研究方法在 MNIST 数据集的子集(5,000 张图像,缩放为 7x7)上进行了验证,其中 4,000 张用于训练,1,000 张用于测试。模型在三个完整的两点扫描(two-site sweeps)中进行优化,最大键维数为 20。
- 性能: 标准的共轭梯度下降实现了最高的准确率(94.70% 测试准确率)和最低的损失(0.08680)。然而,生成的 MPS 范数约为 ≈3.9×106。当进行事后归一化时,这会导致重叠度消失,并产生约 ≈0.5 的平凡损失,使得模型无法有效使用。
- 归一化方法: 归一化梯度下降和改进的 Lanczos (DMRG) 方法产生了相同的训练和测试损失(≈0.36)及准确率(≈73%)。
- 观察: 引入归一化条件显著影响了结果,虽然与无约束的共轭梯度法相比降低了准确率,但确保了模型在物理上是有效的(已归一化)。
意义与主张
本文声称,实施归一化条件是使张量网络算法适用于量子计算机部署的必要步骤。作者将这项工作定位为使张量网络方法适应更高效量子机器学习的一步。
然而,作者对目前的性能表现持谦逊态度。他们明确指出,结果表明这些归一化方法的性能“需要提高,才能与其他当代算法竞争”。他们承认,目前尚未达到与经典张量网络方法(后者并不以同样的方式强制执行严格归一化)相当的水平。论文得出结论,需要进一步的研究,包括研究更复杂的归一化条件(例如针对量子信道的条件)以及改进评估方法,以有效地将机器学习带入量子计算领域。
每周获取最佳 quantum physics 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。