← 最新论文
💻 computer science

From Physics to Attention: Building Vision Transformers from Oscillatory Neural Network Hardware

本文介绍了 HoKuVit,这是一种可扩展的卷积视觉 Transformer,它将基于 Kuramoto 的卷积层和基于 Hopfield 的线性层集成到振荡神经网络(ONN)架构中,在实现 CIFAR-10 状态最佳性能的同时,展示了将 ONN 扩展到深度人工智能流水线的可行路径。

原作者: Tamas Endrei, Andras Horvath, Gyorgy Csaba

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Tamas Endrei, Andras Horvath, Gyorgy Csaba

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代计算机速度极快,但同时也非常耗电。随着人工智能变得日益复杂,运行这些系统所需的能量已成为一个显著的瓶颈。科学家们长期以来一直向人类大脑寻求灵感,希望能够构建出像神经元那样处理信息的方式:即低功耗、高效率。一条充满前景的路径涉及“振荡神经网络”(oscillatory neural networks),这是一种利用微小电子电路的节奏性脉冲来存储和处理数据的计算类型。这些系统并不依赖于传统芯片中稳定的二进制开关(开/关),而是利用波形的定时与同步。虽然研究人员已经成功构建了小型版本的此类网络来解决简单的谜题,但在将其规模化方面却遇到了困难。挑战在于如何将这些节奏性电路连接成能够驱动当今最先进视觉系统的深层分层架构——这些系统能够以接近人类的准确度识别照片中的物体。

匈牙利帕兹曼·彼得天主教大学的一组研究人员在解决这一规模化问题方面迈出了重要一步。他们设计了一种名为 HoKuVit 的新型人工智能模型,该模型几乎完全由这些节奏性的振荡组件构建而成。研究人员成功地将两种特定的物理原理结合到了一个单一的、可运行的系统中。第一个原理涉及一个耦合振荡器网络,它充当过滤器,通过图像不同部分之间同步的程度来对视觉信息进行分类。第二个原理使用一个作为记忆的网络,在该网络中,系统会趋于一个稳定的状态,从而代表一个被识别出的模式。通过将这两种物理行为编织进一个层级结构中,该团队创建了一个视觉 Transformer(一种能够分析图像的现代 AI 架构),其运作基于物理定律而非仅仅是数字逻辑。

研究人员在 CIFAR-10 数据集上测试了他们的成果,这是一个包含 60,000 张彩色图像的标准集合,涵盖了十个不同的类别,如飞机、猫和卡车。这比通常用于测试振荡网络的简单数字识别实验要难得多。HoKuVit 模型实现了接近 80% 的准确率,这一结果被认为是目前所有主要基于振荡动力学构建的架构中报告的最高水平。虽然这低于同一架构的标准数字版本所达到的 92% 准确率,但这种权衡是有意为之的。目标并非要匹配当前数字芯片的原始速度,而是为了证明这些物理电路可以通过训练来处理复杂的现实世界视觉任务。该模型包含约 87 万个参数,其中约 88% 是使用振荡组件实现的,只有最后的决策层保持数字形式。

这项工作的特别之处在于研究人员是如何训练该系统的。传统上,振荡网络是根据固定规则或简单的学习方法设计的,无法适应复杂的数据。在本研究中,团队使用了被称为“反向传播”(backpropagation)的技术,这是训练现代深度学习模型的标准方法。他们教会了振荡电路通过调整自身的内部连接和节奏来最小化误差,从而使系统能够直接从图像中学习。“记忆”部分的部分学会了为每个物体类别沉淀出截然不同且稳定的模式,而“过滤器”部分则学会了通过同步其节奏来突出图像中的重要特征。研究人员验证了这些数字模拟的行为与它们在物理设备中的表现完全一致:随着系统找到正确答案,系统的能量会逐渐降低,就像一个球滚下山坡寻找最低点一样。

研究还考察了如果使用真实的、不完美的硬件,这些系统会表现得如何稳健。物理电路经常受到组件微小差异或信号噪声的影响。研究人员通过在模型的计算中加入随机噪声并降低其记忆权重的精度来模拟这些缺陷。系统表现出了惊人的韧性;即使当记忆权重被降低到极低精度或引入显著噪声时,准确率的下降也小于一个百分点。这表明该架构非常适合物理实现,因为它不需要数字计算机所要求的那种完美精度。研究人员估计,如果构建在专门的硬件上,节能效果将非常显著,只要振荡部分消耗的功率可以忽略不计,其效率有望比全数字系统提高四倍。

这项工作表明,理论物理与实用人工智能之间的差距正在缩小。通过将电子电路的节奏行为视为核心计算引擎而非限制,研究人员已经证明,构建在本质上不同于我们今天所使用的模型之上的深度学习模型是可能的。HoKuVit 模型提供了一个蓝图,预示着一个人工智能运行在物理系统自然动力学之上的未来,这条路径通向那些不仅更聪明而且更加节能的机器。虽然目前的模型仍处于模拟阶段,但概念验证是明确的:振荡器的节奏脉冲确实可以被用来观察并理解这个世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →