← 最新论文
💻 computer science

Photonic Quantum-Enhanced Knowledge Distillation

本文介绍了光子量子增强知识蒸馏(PQKD),这是一种利用光子量子处理器的内在随机性为参数高效的学生网络生成调节信号的混合框架,通过利用샷噪声缩放和特征平滑来应对有限采样限制,在标准基准测试中实现了在激进压缩下的竞争性准确率。

原作者: Kuan-Cheng Chen, Shang Yu, Chen-Yu Liu, Samuel Yen-Chi Chen, Huan-Hsin Tseng, Yen Jui Chang, Wei-Hao Huang, Felix Burt, Esperanza Cuenca Gomez, Zohim Chandani, William Clements, Ian Walmsley, Kin K. L
发布于 2026-09-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Kuan-Cheng Chen, Shang Yu, Chen-Yu Liu, Samuel Yen-Chi Chen, Huan-Hsin Tseng, Yen Jui Chang, Wei-Hao Huang, Felix Burt, Esperanza Cuenca Gomez, Zohim Chandani, William Clements, Ian Walmsley, Kin K. Leung

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代世界中,人工智能已成为一种强大的工具,但它也带来了沉重的代价:这些系统通常需要大量的计算机内存和能量来运行。为了使它们能在日常设备上使用,科学家们长期以来一直尝试缩小它们的规模,这一过程被称为模型压缩。其中一种最有效的方法叫做知识蒸馏(knowledge distillation)。想象一位博学多才、受过高度训练的老师了解某个学科的一切,而一个更小、更渴望学习的学生需要学习同样的材料。学生不仅仅是通过死记硬背正确答案来学习,而是通过观察老师的思考过程,吸收老师所看到的微妙模式和关系。这使得学生在不需要同样庞大体积的情况下,也能变得异常出色。与此同时,另一门科学领域正在探索如何利用光而非电力来进行计算。基于光的计算机,或称光子处理器,具有一个独特的特性:当我们测量光时,结果自然是随机的,就像掷骰子一样。这种随机性并非缺陷,而是一种可以被利用来生成复杂模式的特性。

现在,一支研究团队将这两个想法结合在一起,创造了一种名为“光子量子增强知识蒸馏”(Photonic Quantum-Enhanced Knowledge Distillation)的新方法。他们构建了一个系统,其中一个小型、基于光的计算机在训练较小的人工智能模型过程中充当专门的助手。在这种设置中,一个大型、强大的“教师”网络引导着一个更小的“学生”网络。其巧妙之处在于,学生不仅从老师的答案中学习,还接收来自光子处理器的独特且不断变化的信号。这个基于光的设备接收固定的光输入,将其通过由反射镜和相位移器组成的程序化电路,然后测量输出。由于测量过程本质上是带有噪声且随机的,它产生了一个丰富的结构化信号,学生利用该信号来决定如何混合其内部信息。研究人员发现,这种方法允许学生被压缩到其通常体积的一小部分,同时仍能表现得几乎与原始教师一样好。

研究人员在三组不同的视觉数据上测试了这种方法:手写数字、服装图像和日常物品的小图。在每种情况下,他们都用一个更轻量级的版本替换了学生网络中标准的、沉重的数学层。学生不再从头开始学习滤波器中的每一个数字,而是学习一组基本的形状。随后,光子处理器提供一个动态信号,告诉学生如何针对每一张特定的图像来组合这些基本形状。这意味着学生只需要学习一些基本模式以及如何混合它们,而不是记忆数百万个单独的数字。结果显示,该模型显著变小,但保持了极高的准确度。在识别手写数字等较简单的任务上,即使被压缩到原始尺寸的极小比例,压缩后的学生模型的表现也几乎与庞大的教师模型不相上下。

这项发现的一个关键点在于理解系统如何处理基于光硬件的自然随机性。由于光子处理器依赖于计数单个光粒子,每次生成信号时结果都可能发生轻微波动,这种现象被称为散粒噪声(shot noise)。研究人员观察到,如果使用的测量次数非常少,学生的性能就会下降。然而,他们发现,通过在时间上对信号进行简单的平均,就可以平滑这些波动。这使得系统即使在测量次数有限的情况下也能可靠运行,证明了该方法对于尚无法进行完美、无噪声计算的现实世界硬件具有鲁棒性。

该研究还探讨了这种压缩可以推进到什么程度。当研究人员将该技术应用于学生网络的第一层时,性能依然保持优秀。当他们将其应用于前两层时,系统仍然表现良好。最后,他们压缩了整个层堆栈,在某些情况下将可训练参数减少了一百倍以上。即使在如此极端的压缩水平下,学生网络也没有崩溃。它继续学习并收敛到一个解,保持了稳定的准确度,仅略低于教师模型。这表明,教师的指导与光生成的信号相结合,创造了一个非常强大的学习基础,使得学生即使在自由度非常少的情况下也能找到良好的解。

研究人员在多个数据集和不同规模的教师网络上验证了他们的发现。他们发现该系统存在一个清晰的权衡:随着模型变小,准确度会下降,但这种下降是可预测且可控的。通过调整学生学习的基本形状数量以及分配给光子处理器的“预算”,他们可以调节系统以找到规模与性能之间的最佳平衡。这项工作证明,基于光的量子硬件可以作为训练高效人工智能的实用工具,其作用不是取代整个计算机,而是在学习阶段作为一个专门的复杂信号生成器。一旦训练完成,最终的学生模型完全在标准的经典计算机上运行,这意味着复杂的基于光的硬件仅在构建模型时需要,而在使用模型时则不需要。

这种方法为提高人工智能的效率提供了一条新路径。它表明,量子光的固有随机性——通常被视为障碍——可以转化为一种有用的资源。该方法并不要求最终的 AI 在昂贵或脆弱的量子机器上运行;它只需要在创建过程中使用量子机器。研究结果表明,随着光子硬件的改进,这种技术可以实现更强大且更紧凑的人工智能系统,使其能够在资源有限的设备上运行。这项研究为如何将这些新兴技术整合到主流机器学习中提供了蓝图,弥合了量子计算的理论潜力与现代人工智能实际需求之间的差距。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →