在追求构建能够像人类大脑一样高效地进行视觉感知与思考的机器的过程中,研究人员长期以来一直关注着一种被称为脉冲神经网络(spiking neural network)的特殊人工网络。与以稳定、连续流形式处理信息的标准计算机程序不同,这些网络模仿了大脑自身的电学语言:即被称为“脉冲”的短暂且尖锐的活动爆发。这种方法特别适用于旨在模拟生物学的各种新型硬件,这类硬件可以在执行复杂任务的同时,仅消耗传统计算机所需能量的一小部分。然而,一个主要的障碍一直存在。目前教导这些网络识别模式的最准确方法,依赖于一种需要计算机将误差信号向后传回网络每一层的过程,而这一过程无法在节能型硬件本身上运行,且在生物大脑中也找不到对应的机制。科学家们一直在寻找一种仅使用局部规则来训练这些网络的方法,即每个部分仅通过与其直接相邻的部分进行学习,而不需要来自顶层的全局信号。
一支研究团队现在引入了一种新系统,通过教导网络预测其邻居即将经历的内容来解决了这一问题。在这种被称为 MPC-SNN 的新架构中,每个神经元不仅对接收到的信号做出反应,还会尝试猜测同一层中的同伴将接收到什么信号。如果预测正确,神经元就会保持静默;如果预测错误,神经元则会发出一个脉冲以发出“惊讶”信号。这种机制使得网络完全通过局部交互进行学习,并使用一种特定的规则,即神经元根据自身的误差和邻居近期的活动来更新其连接。研究人员在利用一种仅能捕捉光影变化的特殊相机记录的手势数据集上测试了该系统,这一任务完美契合了此类技术的优势。
研究结果表明,这种方法效果显著。在包含 288 个手势样本的测试集上,该网络达到了 95.83% 的准确率,这一表现与现有的不使用全局误差信号的最佳方法相匹配,并显著优于那些已经部署在物理神经形态芯片上的系统。或许更重要的一点是,该网络在学习过程中变得更加高效。在训练过程中,它发出的脉冲数量减少了 60% 以上,这意味着最终系统在做出决策时消耗的能量要少得多。这种效率并非通过特定的稀疏化规则强制实现的,而是自然涌现的结果,因为网络学会了仅在真正对输入感到“惊讶”时才发出脉冲。
该研究的一个关键发现是,允许神经元预测其邻居输入的机制不仅是一个理论构想,而且是系统中一个活跃且不断增长的部分。当研究人员开始训练时,负责这些预测的连接几乎为零。随着网络的学习,这些连接显著增长,其中最强的层将其预测能力提升了二十倍以上。这种增长是在没有任何标签或外部指导的情况下发生的,证明了网络确实在学习如何预判同伴的活动。研究还发现,该系统对所给信息的使用效率极高。即使研究人员将用于训练的有标签数据减少到原始数量的四分之一,网络仍保留了近四分之三的准确率,这表明初始的局部学习阶段已经构建了一个对视觉世界的稳健理解。
虽然该系统在模拟中表现出色,但研究人员谨慎地指出,目前的结果仅限于计算机模型,尚未在物理神经形态芯片上进行测试。他们还观察到,该系统在识别与训练数据结构差异极大的手势时表现挣扎,表明其检测异常输入的能力仍然有限。尽管如此,这项工作提供了一个具体的论证,证明网络可以仅利用局部规则和预测编码来学习复杂任务,为构建以低能耗和高速度运行的智能机器提供了可行路径。这种方法的成功表明,高效人工智能的未来可能不在于将海量数据向后传回网络,而在于教导系统的每一个部分去倾听并预测其邻居的行为。
技术摘要:用于局部训练脉冲神经网络的相互侧向预测机制
问题陈述
脉冲神经网络(SNNs)是神经形态硬件(如 Intel Loihi-2, SpiNNaker2)的自然计算模型,能为来自动态视觉传感器(DVS)等事件驱动型数据提供低能耗推理。然而,目前最准确的 SNN 通常依赖于带有代理梯度的随时间反向传播(BPTT)。这种方法需要将误差信号沿层间和沿时间进行反向传播,这一机制与神经形态芯片(缺乏层间梯度广播机制)不兼容,也与生物学合理性(缺乏类似的后向路径)不符。虽然预测编码为严格局部学习提供了一条路径,但现有的脉冲形式通常仅允许神经元预测自身的正向驱动,而忽略了其侧向邻居接收到的驱动。
方法论:MPC-SNN
作者引入了 MPC-SNN(相互侧向预测编码 SNN),这是一种完全通过局部、无需反向传播规则训练的卷积 SNN。该架构和学习过程由三个核心组件定义:
架构创新(侧向预测):
不同于以往的树突预测仅依赖于正向突触前脉冲的架构,MPC-SNN 引入了一个学习到的侧向权重矩阵 Wlat。每个神经元利用其同层同伴在上一时刻发射的脉冲,来预测这些同伴的正向输入。
- 树突估计值 I^[t] 计算为:I^[t]=Wdspre[t]+Wlatzlayer[t−1]。
- Wlat 被实现为一个在相同空间位置上的通道间学习到的 1×1 卷积。
- 预测误差 ϵ[t] 是实际突触前脉冲向量与该侧向/正向估计值之间的偏差。
严格局部学习规则:
该网络利用三个从第一性原理推导出的更新规则,不需要全局误差信号或外部目标:
- 胞体权重 (Ws): 通过结合预测误差、资格迹(eligibility trace)和神经调节信号的三因子赫布(Hebbian)规则进行更新。
- 树突权重 (Wd): 用于最小化预测误差的正向分量。
- 侧向权重 (Wlat): 这是新增组件,通过对局部目标(预测误差平方的一半)求导得出。其更新规则 ΔWlat=ηlatϵ[t]elat[t]⊤ 仅需要神经元自身的预测误差以及同层同伴的前一时刻脉冲。这比 e-prop(广播输出误差)或 LTTS(需要外部目标脉冲序列)的方法更具严格的局部性。
两阶段训练程序:
- 阶段 1(无监督预训练): 50 个 epoch,没有类别标签或全局损失。每一层使用局部预测误差独立更新其权重。此阶段旨在学习可重用的表示并验证侧向机制的有效性。
- 阶段 2(有监督微调): 400 个 epoch,附加一个线性读出层,并使用交叉熵损失和标签平滑对网络进行端到端优化。
关键结果
在 11 类 DVS128 Gesture 基准测试中,MPC-SNN 展示了以下结果:
- 准确率: 该模型实现了 95.83% 的测试准确率。这在统计上与最强的局部学习基准(DECOLLE,约 95.5%)相匹配,并显著超过了已部署的神经形态实现(Loihi 为 89.64%,Spike Gating Flow 为 87.50%)。
- 机制活性: 在阶段 1 期间,侧向权重 (Wlat) 从接近零的初始化值(≈0.001)增长了高达 21.1 倍(在第一层),证实了侧向规则在没有标签驱动信号的情况下在机械层面是活跃的。
- 标签效率: 模型表现出高标签效率。在使用仅 25% 的训练标签时,它仍保留了 73.50% 的准确率。这产生了 2.94 的信息保留率(IRR),意味着每个带标签的样本提供的准确率增益几乎是线性缩放的三倍。
- 稀疏性: 在阶段 2 期间,单次推理的脉冲计数从约 730,000 降至约 143,000,展示了在没有显式稀疏性惩罚项的情况下涌现出的稀疏性。
- 消融实验: 移除侧向组件(条件 B)导致准确率略有下降(94.79% 对比 95.83% 最佳值)以及脉冲计数增加 5.8%,但在五个种子下的 288 个样本测试集中,这些差异未达到统计学显著性。
意义与主张
论文声称 MPC-SNN 是第一个结合了同层侧向预测编码与局部推导预测误差规则的 SNN。其意义被界定为三个截然不同的贡献:
- 架构上: 它引入了一个学习到的同层侧向权重矩阵来预测同伴的正向输入,这一构造此前在 SNN 文献中从未见报道。
- 理论上: 侧向更新规则是基于预测误差目标而非启发式方法推导出来的,建立了一种严格局部的学习规则(不需要层间协作或外部目标)。
- 经验上: 该模型在标准神经形态基准测试中实现了具有竞争力的准确率,同时展示了高度的标签效率和无监督预训练期间活跃的侧向权重增长。
局限性与诚实的负面结果
作者明确指出了几项局限性:
- 统计显著性: 虽然侧向机制在消融研究中显示出较大的效应量(Cohen's d=1.01),但由于测试集较小(288 个样本),导致这些结果未能达到统计学显著性。需要更大的测试集来明确证明侧向权重的可靠性。
- 收敛问题: 中间层(conv2)在阶段 1 期间的预测误差收敛是非单调的,这表明局部目标可能在处理既非纯粹局部边缘、亦非完全抽象的特征时会遇到困难。
- 分布外(OOD)检测: 一项测试脉冲计数作为异常评分进行 OOD 检测的实验得出了 AUROC 为 0.578(不显著)。作者将其报告为“诚实的负面结果”,并将其归因于留出类与训练类之间的语义相似性,而非检测逻辑本身的根本缺陷。
- 部署: 本研究仅限于模拟;将阶段 1 训练映射到物理神经形态芯片上的效率尚未经过测试。
总之,本文将 MPC-SNN 呈现为一种侧向预测编码的具体、无需反向传播的实现,它弥合了生物合理性与高性能神经形态计算之间的差距,同时也承认了进一步统计验证和硬件部署研究的必要性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。