Pixel-Translation-Equivariant Quantum Convolutional Neural Networks via Fourier Multiplexers
本文介绍了像素平移等变量子卷积神经网络(PCS-QCNNs),该网络通过构建与像素循环移位精确对易的傅里叶复用层,解决了图像编码对称性与标准量子比特置换之间的不匹配问题,在经过平移处理的 MNIST 基准测试上展示了优于非等变量子控制模型的性能,并强调了由有限采样成本引起的关键训练-部署不匹配问题。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人识别照片中的猫。如果你给机器人看一张位于左侧的猫的照片,然后又给它看一张位于右侧的完全相同的猫,一个聪明的机器人应该意识到:“嘿,这仍然是一只猫!”这种理解物体即使在移动时仍是同一个物体的能力,被称为平移对称性(translation symmetry)。在经典计算机的世界里,我们构建了被称为**卷积神经网络(CNN)**的特殊工具,这些工具天生就遵循这一规则,使其在识别图像方面表现得极其出色。
现在,想象我们要使用量子计算机来构建这些智能工具。量子计算机就像神奇的骰子,可以同时处于多种状态,提供了巨大的潜力。但问题在于,在量子世界中,你如何将图片放入计算机(称为编码/encoding)会改变游戏规则。如果你通过将每个像素分配给特定的“位置”(就像剧院里的座位)来对图像进行编码,那么移动图像意味着移动座位。但如果你通过将像素分配给“地址列表”(就像图书馆的目录卡)来对图像进行编码,那么移动图像则意味着更改目录卡上的数字。今天探讨的这篇论文解决了一个棘手的谜题:许多现有的量子设计都是为了处理“移动座位”的规则而构建的,但对于“目录卡”方法,这个规则并不适用。作者意识到,如果你想让你的量子计算机真正擅长识别移动的物体,你必须构建它以尊重数据编码的具体方式,而不仅仅是遵循通用的量子力学规则。
伟大的量子错位
来自 ITMO 大学(ITMO University)的作者 Dmitry Chirkov 和 Igor Lobanov 注意到了量子计算机处理图像时的一个有趣的脱节。他们称之为“像素与量子比特”的错位(Pixel vs. Qubit mismatch)。
想象你有一排电灯开关(这些是量子比特/qubits,量子信息的最小单位)。在许多量子设计中,工程师们假设如果将整排开关向右移动一个位置,计算机应该将新的排列视为同一张图像,只是发生了偏移。这就像滑动一排多米诺骨牌;如果图案移动了,图案本身依然存在。这被称为量子比特循环移位(QCS)。
然而,作者研究了一种流行的将图像放入量子计算机的方法,称为 FRQI(灵活表示量子图像/Flexible Representation of Quantum Images)。在这种方法中,图像并不是存储在开关本身,而是存储在开关的地址中。可以把它想象成一个图书馆,书(像素)并不按顺序摆放在书架(量子比特)上;相反,书架上有标签(地址),而书被列在卡片目录中。如果你把一本书从书架 1 移到书架 2,你不仅仅是在移动书架,你是在改变卡片上的编号。
论文证明了“滑动开关”的规则(QCS)并不匹配 FRQI 所使用的“改变地址”的规则(像素循环移位,或 PCS)。这就像试图用一把虽然能插进锁孔、但手柄形状不对的钥匙去开门。如果你构建的量子网络只尊重“滑动开关”的规则,那么当使用这种特定的编码时,它将无法识别出偏移后的图像是同一张图像。作者认为,要为这些图像构建真正的“量子卷积神经网络”(QCNN),你必须构建它以尊重“地址”规则,而不是“开关”规则。
傅里叶魔术
那么,如何修复一个观察规则错误的网络呢?作者提出了一个使用名为**傅里叶变换(Fourier Transform)**的数学工具的巧妙解决方案。
在经典世界中,如果你想分析声波,可以将其分解为不同的音符(频率)。在量子世界中,作者意识到,当你通过这些“音符”的视角观察图像时,“地址偏移”规则会变得非常简单。他们称之为傅里叶基(Fourier basis)。
他们设计了一种新型的量子层,其工作原理类似于一个三步走的魔术:
- 转化为音符: 首先,量子计算机使用一种特殊的门(量子傅里叶变换)将图像从“像素地址”转换为“傅里叶音符”。
- 多路复用器: 接下来,它应用一个特殊的滤波器,称为傅里叶多路复用器(Fourier Multiplexer)。这是全场的明星。想象一个巨大的调音台,每个“音符”(频率)都有自己独特的音量旋钮和效果。计算机可以独立地微调每个音符而不影响其他音符。因为“偏移”规则在这些音符中只是一个简单的变化,通过这种方式进行微调可以保证计算机尊重平移对称性。
- 转回原样: 最后,它将音符转回像素地址,以便计算机读取结果。
通过这样构建网络,作者创建了一个像素平移等变 QCNN(PCS-QCNN)。这意味着该网络在数学上被保证能够理解偏移后的图像是同一张图像,特别是针对 FRQI 编码方法。
测试理论:偏移后的 MNIST 游戏
为了观察他们的设计是否真的有效,作者使用著名的 MNIST 数据集进行了系列实验,该数据集包含手写数字(0 到 9)。
他们创建了一个特别的挑战,称为**平移 MNIST(Translated MNIST)**基准测试。他们没有将数字放在页面中心,而是随机移动它们(偏移)最多 8 个像素。对于一个不理解运动概念的计算机来说,这使得任务变得更加困难。
他们对比了四个不同的“选手”:
- 经典 CNN: 经典计算机的金标准,专门设计用于处理偏移。
- 经典 MLP: 一种标准的、“全连接”神经网络,它不知道偏移(就像一个背下了答案解析但并不理解概念的学生)。
- PCS-QCNN: 作者开发的新型量子模型,尊重地址偏移规则。
- RBC-QCNN: 一个“随机基控制”(Random Basis Control)量子模型。这是一个看起来与作者的新模型完全一样的量子模型,但使用的是随机的、不符合对称性的规则,而不是傅里叶多路复用器。它是作为“对照组”来证明对称性的重要性。
结果:
- 经典对决: 正如预期的那样,经典 CNN 以 97.68% 的准确率碾压了任务,而全连接 MLP 则在 48.93% 处跌倒(它只是记住了答案而非理解概念)。这证明了该任务确实对平移对称性敏感。
- 量子对决: 作者的新型 PCS-QCNN 得分为 75.89%。而随机的 RBC-QCNN(忽略了对称性)仅得分为 40.82%。
- 差距: 新设计比随机版本高出了 35.08 个百分点。这是一个巨大的胜利,表明尊重数据编码的特定对称性至关重要。
然而,量子模型并没有达到经典 CNN 那种近乎完美的水平。作者指出,这可能是因为他们的量子模型仍然是一个“理想化”的模拟,尚未针对真实量子计算机的硬件约束进行优化。
“采样次数(Shot)”问题:现实降临
还有一个转折。量子计算机不会直接给你答案;它给你的是一个概率。为了得到一个清晰的答案,你必须多次询问计算机同一个问题(称为采样次数/shots)。
作者模拟了当无法拥有无限次提问时间时会发生什么。他们发现,如果只使用较少的采样次数(例如 128 或 256 次),准确率就会下降。更糟糕的是,他们发现了一个“训练-部署不匹配”现象。一个在拥有无限采样次数(完美信息)时看起来完美的模型,在测试次数有限时,表现实际上可能会变差。这就像一个用完美教科书学习的学生,在面对一份模糊的复印件考试时感到困惑。
这表明,当我们最终构建这些量子模型用于实际应用时,我们不能仅仅看它们学习得有多好,我们还必须设计它们,使它们即使在无法承担数百万次测量成本的情况下也能保持鲁棒性。
总结
这篇论文并不是声称解决了量子图像识别问题,或者构建了一个能击败最强经典计算机的可用量子计算机。相反,它解决了一个基本的逻辑谜题。它证明了对称性并非“一刀切”的。你不能直接将经典卷积的规则或通用的量子对称性“复制粘贴”到量子图像编码器上。
作者证明了对于流行的 FRQI 编码方法,你必须构建一个尊重“地址偏移”规则(PCS)的量子网络,并使用他们的新型傅里叶多路复用器技术。他们的实验表明,这样做会带来巨大的提升,比忽略此规则的模型准确率提高了 35% 以上。尽管仍存在“采样次数”成本和硬件限制等障碍,但这项工作为构建能够真正理解图像如何移动的量子网络提供了一个清晰且具有建设性的方案。这是让量子计算机不仅更快,而且在感知世界方面更聪明的关键一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。