← 最新论文
⚛️ quantum physics

Quantum Variational Activation Functions Empower Kolmogorov-Arnold Networks

本文引入了量子变分激活函数(QVAFs),特别是单比特 DARUAN 机制,以构建 QKAN 架构,该架构将 Kolmogorov-Arnold 网络与量子启发式表达能力相统一,在经典模拟和 NISQ 硬件上均实现了卓越的参数效率、可扩展性和泛化能力。

原作者: Jiun-Cheng Jiang, Morris Yu-Chao Huang, Tianlong Chen, Hsi-Sheng Goan

发布于 2026-07-07
📖 1 分钟阅读🧠 深度阅读

原作者: Jiun-Cheng Jiang, Morris Yu-Chao Huang, Tianlong Chen, Hsi-Sheng Goan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:赋予神经网络“量子超能力”

想象一下,你正在试图教计算机识别模式,比如识别照片中的猫或预测天气。为了实现这一目标,计算机使用神经网络,它们就像是由许多小工人(神经元)组成的巨大工厂,信息在工人之间传递。

通常,这些工人有一个简单的、固定的规则来处理信息(就像一个标准的灯开关:开或关)。最近,科学家发明了一种新型网络,称为 KAN(Kolmogorov-Arnold 网络)。在 KAN 中,每个工人都有一个可定制的规则(一个“可学习的激活函数”),他们可以根据工作需求进行微调。这使得 KAN 非常擅长理解复杂的形状和模式,但由于它们需要大量的内存,运行起来会变得沉重且昂贵。

本论文提出了一个新的转折点: 如果我们用微小的、模拟的量子电路来替换这些可定制的规则,会发生什么?

作者称之为 QKAN(量子启发式 KAN)。他们并不是在整个量子机器上运行程序(因为目前的量子计算速度慢且容易出错),而是利用量子物理学的数学原理来让这些工人变得更聪明、更高效。

主角:名为 “DARUAN” 的工人

论文介绍了一种特定类型的工人,称为 DARUAN(数据重上传激活,DatA Re-Uploading ActivatioN)。把 DARUAN 工人想象成一位演奏单弦乐器的音乐家(单个量子比特)。

  • 运作方式: 这种工人不仅仅是看一次数据,而是将数据“重上传”到乐器中多次,每次都用特定的曲调(参数)轻微扭转琴弦。
  • 神奇之处: 通过以特定的几何模式(例如每次将张力翻倍)来扭转琴弦,这单个工人就能创造出极其广泛的音域(频率)。
  • 优势: 一个传统的工人为了演奏每一个新音符,都需要购买一件全新的乐器。而一个 DARUAN 工人只需通过改变调音方式,就能使用同一件乐器演奏出指数级增长的音域。这节省了大量的空间(参数)。

类比:管弦乐队 vs. 独奏者

  • 旧网络 (MLPs): 像是一个合唱团,每个人都唱着同样的简单音符。为了获得复杂的和谐感,你需要成千上万名歌手。
  • 标准 KANs: 像是一个合唱团,每个歌手都拥有一件独特且复杂的乐器。听起来很棒,但整个管弦乐队规模庞大且维护成本高昂。
  • QKAN(本文): 像是一个合唱团,其中的每位歌手都是一位拥有神奇乐器的大师级独奏者 (DARUAN)。一位独奏者就可以模仿一整个乐器组的声音。你只需要更少的歌手就能创造出同样(甚至更好)的音乐。

他们实际做了什么(研究结果)

作者不仅停留在理论层面;他们构建了这些网络,并在三个主要任务上进行了测试:

  1. 拟合噪声曲线(回归任务):

    • 任务: 在杂乱的点阵中画出一条平滑的线(例如预测带有噪声数据的股票趋势)。
    • 结果: QKANs 比标准网络画出的线条更平滑、更准确,且平均减少了 24% 的参数(内存空间)。它们特别擅长从噪声中发现隐藏的模式。
  2. 图像识别(分类任务):

    • 任务: 识别手写数字 (MNIST) 或照片中的物体 (CIFAR)。
    • 结果: QKANs 在使用显著更少参数的同时,达到了与标准网络相当甚至更高的准确率。
    • “混合”技巧: 对于非常复杂的图像,他们引入了 HQKAN。想象一下在量子工人面前放一个“压缩透镜”。它将图像缩小到一个极小的、易于处理的尺寸,让量子工人施展魔法,然后再将其放大。这使得他们能够处理巨大的数据集,而不会导致网络因体积过大而无法装入内存。
  3. 文本生成(生成式建模):

    • 任务: 训练一个像人类一样写文本的模型(使用类似 GPT-2 的模型)。
    • 结果: 通过将标准的文本处理层替换为 HQKAN 层,该模型学习得更快,生成的文本质量更高(较低的“困惑度”),同时仅使用了三分之一的参数和更少的内存。

“现实世界”检验:在真实的量子硬件上运行

论文中最酷的部分之一是,他们不仅仅是在普通计算机上进行模拟。他们将训练好的模型运行在了真实的物理量子计算机(IBM 的 “Aachen” 处理器)上。

  • 测试: 他们要求真实的量子芯片充当网络中的“工人”。
  • 结果: 由于目前的量子芯片还带有一定的“噪声”(就像一位乐器略微走调的音乐家),结果并非完美无缺。然而,对于简单的任务(如识别图像),量子芯片在大多数情况下仍能得到正确答案。这证明了即使在不完美的现实硬件上,其数学逻辑也是成立的。

为什么这很重要(根据论文观点)

  • 效率: 你可以获得复杂量子数学的力量,而无需需要一台庞大且无误差的量子计算机。
  • 可扩展性: 由于这些“量子工人”非常高效,它们可以在普通的计算机(如你的笔记本电脑或数据中心 GPU)上非常快速地进行模拟。
  • 可解释性: 就像标准的 KAN 一样,QKANs 是透明的。你可以观察工人在演奏什么样的“音乐”,并理解它到底学到了什么样的数学规则(例如:“啊,这个工人学会了正弦函数”)。

总结

论文的核心观点是:“我们找到了一种方法,利用量子物理的数学原理,让神经网络的‘工人’变得更聪明、更精简。我们构建了一个名为 QKAN 的系统,它使用了这些‘量子启发式’的工人。它比现有方法表现更好,且占用更少的内存,我们甚至证明了它可以运行在真实的量子硬件上——尽管目前最好还是在强大的经典计算机上运行。”

它是连接量子计算的未来与当今人工智能实际需求之间的一座桥梁。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →