在快速发展的人工智能领域,一种被称为“Transformer”的特定计算机程序已成为主导力量,驱动着从语言翻译到图像识别的一切技术。这些系统功能极其强大,但同时也极其耗能且占用内存,通常需要庞大的数据中心来运行。为了将这种智能带入智能手机或传感器等更小的日常设备中,工程师们转向了一种受人类大脑启发的新方法:脉冲神经网络(Spiking Neural Networks)。与持续处理信息的传统程序不同,这些网络基于事件运行,仅在必要时才进行触发,这使得它们天生具有极高的效率。然而,教导这些网络直接在设备上学习新任务一直是一个棘手的难题。训练它们的标准方法涉及计算如何调整网络中的每一个连接,这对于小型芯片来说过于复杂且对内存需求过高。存在一种更简单的方法,即通过对连接进行微小的随机扰动并观察结果是否变好,从而估算如何改进系统,但这种方法自身也面临着严重的硬件障碍,使其难以投入实际应用。
一组研究人员现在设计了一种新的架构,清除了这些障碍,使得这些高效的类脑网络能够在专门的计算机芯片上直接学习,而无需不断重写其内部存储。他们面临的核心挑战在于,进行这类随机扰动的标准方式要求芯片反复读取存储的信息、修改信息并将其写回。这种被称为“读-改-写”(read-modify-write)的过程速度缓慢且耗电,实际上抵消了这些专用芯片原本旨在提供的节能优势。此外,为网络中的每一个连接生成大量所需的随机数,将需要一个比内存本身还要大的随机数生成器。研究人员提出了一个巧妙的变通方案:与其直接改变存储的权重,不如将随机变化注入到计算过程本身中,即注入到数字相加的地方。这保持了存储权重的原封不动和静止状态,从而保留了芯片的效率。
为了实现这一目标,团队构建了一个专门的单元,它仅为网络中当前处于活跃状态的部分生成这些随机扰动。因为这些类脑网络具有天然的稀疏性,即在任何给定瞬间,大多数连接都是沉默的,所以这个单元的大小只需要是完整网络的一小部分。然而,仅仅重复使用同一组较小的随机数来处理网络的不同部分会产生一个隐藏问题:这些扰动会变得过于相似,导致学习过程陷入停滞或变得不准确。为了解决这个问题,研究人员引入了一种混合方案,根据位置将这些重复使用的数字以特定方式进行组合,确保网络的每个部分都能接收到独特且独立的扰动。他们将这种混合过程称为“地址驱动的异或重组”(address-driven XOR recombination),它恢复了系统有效学习所需的统计独立性。
当团队测试这一新设计时,结果令人瞩目。在利用标准芯片制造工艺进行的模拟和硬件测试中,他们的系统达到了与使用完美、独立随机数的软件方法同样的高准确度。相比之下,一个仅仅是重复使用随机数而没有使用混合方案的简化版本则表现糟糕,在图像识别任务中损失了近百分之十的准确度,并且需要更长的学习时间。新设计还证明了其卓越的能效。由于避免了重写内存这一昂贵过程,它在典型设置下的功耗不到传统方法的一半。尽管新的混合单元增加了一小部分额外的硬件,但由于系统学习的速度极快,整个训练过程消耗的总能量比简单的重复使用方法减少了一半。这项工作表明,通过将随机调整从存储区域转移到计算区域,并结合一种智能的混合技术,可以在能量受限的硬件上直接训练复杂的类脑人工智能模型,为能够随时学习、更具适应性的智能设备开启了大门。
技术摘要:用于脉冲 Transformer 零阶微调的事件触发隐式扰动
问题陈述
在资源受限的边缘平台上部署脉冲 Transformer(Spiking Transformers)在进行片上学习时面临重大障碍。虽然零阶(Zeroth-Order, ZO)优化通过仅依赖前向传播评估,为不可微的脉冲神经网络(SNNs)提供了一种内存高效的替代方案,但其在存内计算(In-Memory Computing, IMC)加速器上的实现受到两个主要架构失配的阻碍:
- 随机数生成(RNG)的硬件开销: ZO 优化要求为每个权重参数提供统计独立的随机扰动。使用均匀随机数生成器(RNGs)为每个权重生成这些扰动会产生极高的面积占用,因为用于 RNG 的逻辑(例如线性反馈移位寄存器,LFSRs)其面积远超存储权重的存储单元本身。
- 对权重驻留数据流的破坏: 传统的显式扰动 ZO(EPZO)要求在每个梯度估计步骤中读取整个权重矩阵,应用扰动,并将修改后的权重写回 IMC 阵列。这种频繁的读-改-走(Read-Modify-Write, RMW)操作抵消了 IMC 的能效优势,并会导致大规模的数据移动;此外,对于非易失性存储器(NVM),这还会加剧写寿命限制。
现有的解决方案(如通过复用 RNG 输出来减少硬件开销的扰动高效型 ZO,即 PeZO)虽然降低了硬件开销,但会在扰动之间引入空间相关性,从而降低学习精度和收敛速度。
方法论
作者提出了隐式扰动 ZO(Implicit-Perturbation ZO, IPZO),这是一种硬件-算法协同设计的架构,它将扰动注入点从存储的权重域转移到了累加域。
核心架构转变
IPZO 不直接修改 IMC 阵列中存储的权重 (θ),而是通过在标准矩阵-向量乘法(MVM)结果中加上扰动和来计算扰动后的输出。利用 MVM 的分配律,扰动后的输出 x⋅(θ±ϵzi) 可以计算为:
x⋅θ±x⋅ϵzi
这里,x⋅θ 是标准的 IMC 输出,而 x⋅ϵzi 是由专门的**扰动生成单元(Perturbation Generation Unit, PGU)**计算的扰动和。这种方法保留了 IMC 阵列的权重驻留执行特性,消除了重复的 RMW 操作。
事件触发式扰动生成(PGU)
为了解决 RNG 面积开销问题,PGU 利用了 SNN 的固有稀疏性:
- 维度缩减: PGU 仅针对在给定时间步被输入脉冲激活的权重行生成扰动,而不是针对整个权重矩阵。这使 RNG 阵列的大小与 IMC 阵列的物理维度解耦。
- 基于地址的 XOR 重组(PGU-XOR): 为了防止因在多个行之间复用减少后的 RNG 而导致的统计相关性(这是基准方案 PGU-Reuse 的问题),作者引入了一种重组方案。
- 脉冲地址被分解为商 (qi) 和余数 (ri)。
- 两个独立的 LFSR 集生成随机数:与商相关的 LFSRs(Q-LFSRs)和与余数相关的 LFSRs(R-LFSRs)。
- 特定行的最终扰动向量是通过将选定的 Q-LFSR 输出与对应的 R-LFSR 行进行按位异或(XOR)生成的。这确保了尽管 RNG 硬件规模减小,但在整个权重矩阵中仍能实现统计独立的扰动。
- 累加网络: 为了处理当多个脉冲地址映射到同一个 RNG 行时产生的资源竞争,累加网络通过多个周期对访问进行串行化处理,以牺牲有限的延迟为代价来换取紧凑的硬件占用。
核心贡献
- IPZO 架构: 一种新型框架,将扰动注入累加域,消除了重复的 RMW 操作,并保持了权重驻留的 IMC 执行。
- PGU-XOR 方案: 一种事件触发式扰动生成器,它根据脉冲稀疏性缩减了 RNG 阵列的维度,并采用基于地址的 XOR 重组方案来确保统计独立性,克服了简单 RNG 复用导致的精度下降问题。
- 硬件验证: 在 TSMC 16-nm CMOS 工艺下的后仿真实现,证明了该设计的可行性,包括面积、吞吐量和能量分析。
实验结果
该框架通过算法仿真和硬件实现进行了评估:
- 精度与收敛性:
- 在 Spikingformer (CIFAR-10) 上,PGU-XOR 达到了 76.41% 的准确率,与软件 RNG 基准(Randint 为 76.53%)相匹配;而 PGU-Reuse 则降至 66.85%(下降了 9.56 个百分点)。
- 在 SpikeGPT (WikiText-2) 上,PGU-XOR 的困惑度(PPL)为 54.20,与软件基准(约 53.23)相当;而 PGU-Reuse 的 PPL 则为 66.01。
- PGU-XOR 的收敛速度显著更快,在 CIFAR-10 上比 PGU-Reuse 少需要 2.9 倍的 epoch,在 WikiText-2 上比 PGU-Reuse 少需要 5.7 倍的步数即可达到同等性能水平。
- 统计特性: 对权重更新矩阵的分析表明,PGU-XOR 实现了接近全秩的探索(有效秩约为 120),与软件 RNG 相似;而 PGU-Reuse 则坍缩到了低维子空间(有效秩约为 61.5),证实了扰动多样性的恢复。
- 硬件效率(TSMC 16-nm):
- 面积: 由于增加了 Q-LFSRs,PGU-XOR 相对于 PGU-Reuse 产生了 40.3%–46.0% 的面积开销。
- 能量: 虽然 PGU-XOR 的单次矩阵-向量乘法(MVM)能耗略高(15.2%–48.9% 的开销),但其更快的收敛速度使得在等精度任务下的总扰动能量降至 PGU-Reuse 的 0.51 倍。
- 与 EPZO 的比较: 与传统的显式扰动 ZO (EPZO) 相比,在批大小 B=64 且时间步 T=4 的情况下,IPZO 配合 PGU-XOR 将扰动能量降低至 0.46×–0.83×。随着 BT 乘积的减小,这一优势愈发明显,使其特别适用于边缘设备。
重要性
本文声称 IPZO 为基于 IMC 的脉冲 Transformer 提供了一条高效的片上学习路径。通过将扰动转移到累加域,该架构解决了算法对独立随机噪声的需求与 IMC 硬件约束(特别是 RMW 操作的成本和 RNG 面积)之间的根本冲突。PGU-XOR 方案的引入证明,可以通过脉冲稀疏性来减少 RNG 硬件开销,同时不牺牲有效梯度估计所需的统计独立性。研究结果表明,这种方法通过使基于 ZO 的微调变得能量高效且硬件可行,为资源受限平台上的自适应、隐私保护型边缘智能提供了可能。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。