这篇论文讲述了一个关于如何让人工智能(AI)芯片变得更聪明、更省电、更灵活的故事。
想象一下,AI 芯片就像是一个巨大的超级厨房,里面有成千上万个厨师(处理器),他们正在疯狂地切菜、炒菜(进行数学计算),以制作出美味的菜肴(AI 的预测结果)。
1. 以前的痛点:只会做一道菜的厨师
在这个“厨房”里,大部分厨师都在做最基础的工作:把食材混合在一起(这叫乘法累加运算,MAC)。但是,AI 还需要一种特殊的“调味”步骤,叫做激活函数(Activation Function)。
- 以前的做法:就像厨房里有专门的“切菜工”和专门的“调味工”。
- 如果要做“切菜”(乘法),就用切菜工。
- 如果要做“调味”(激活函数,比如把数据变成 S 形曲线),就得换一套专门的工具。
- 问题:
- 太占地方:为了做各种复杂的调味(比如 SoftMax, Swish, GELU 等),厨房不得不堆满各种专用的调味瓶和工具,导致厨房空间(芯片面积)不够用了。
- 太死板:如果今天菜单变了,需要一种新的调味方法,以前的厨师可能不会,或者需要重新安装一套新设备,效率很低。
- 浪费电:很多工具平时闲置着,但还在占着地方,浪费电力。
2. 核心发明:DA-VINCI —— 一把“瑞士军刀”
这篇论文提出了一种名为 DA-VINCI 的新设计。
- 比喻:想象一下,我们不再给每个厨师配一把专用的刀或一个专用的调味勺,而是给他们每人发一把高科技的“瑞士军刀”。
- 工作原理(CORDIC 技术):这把“瑞士军刀”的核心技术叫 CORDIC。它非常神奇,不需要复杂的乘法器,只需要**“移位”和“加法”**(就像在二进制世界里,把数字往左移一位就是乘以 2,非常简单快速)就能算出各种复杂的曲线。
- 灵活性:
- 厨师想切 S 形曲线(Sigmoid)?按一下按钮,军刀变出 S 形刀片。
- 想切 Swish 或 GELU?再按一下,刀片瞬间变形。
- 不需要换人,也不需要换设备,同一把刀、同一个厨师,瞬间就能完成所有任务。
3. 新成果:NEURIC —— 超级智能厨房
基于这把“瑞士军刀”,作者们打造了一个叫 NEURIC 的神经元引擎。
- 它有多强?
- 全能:它不仅能做传统的“切菜”(乘法),还能做所有复杂的“调味”(激活函数),包括现在最流行的 Transformer 模型(像大语言模型)需要的各种复杂调味。
- 精准:虽然它用简单的加法代替了复杂的乘法,但它的味道(计算精度)依然非常准,达到了 98.5% 的相似度,几乎和顶级大厨做出来的没区别。
- 省地又省电:因为一把刀能顶十把刀用,厨房(芯片)里省下了巨大的空间。论文数据显示,它的面积比以前的设计小了 16 倍,耗电量也大幅降低。
4. 为什么这很重要?(现实世界的意义)
- 让 AI 跑在手机和汽车上:以前的 AI 芯片太大、太耗电,只能放在巨大的数据中心里。现在有了这种“瑞士军刀”设计,我们可以把强大的 AI 塞进手机、无人机、甚至智能手表里,而且电池还能撑很久。
- 适应未来:AI 的算法每天都在变(昨天流行 Sigmoid,明天流行 GELU)。以前的硬件一旦定型就很难改,但 DA-VINCI 是可重构的。就像你的厨房可以今天做中餐,明天做西餐,只要换个“刀法”设置就行,不用重建厨房。
总结
这篇论文就像是在说:
“我们发明了一种万能工具(DA-VINCI),它用简单的加减法就能搞定所有复杂的 AI 调味任务。基于这个工具,我们造出了一个超级高效的厨房(NEURIC)。它既省钱(省电),又省地(芯片面积小),还能随时变身适应各种新的 AI 菜谱。这让未来的 AI 设备能变得更小、更快、更聪明。”
这就好比从“每个厨师只带一把刀”进化到了“每个厨师都带一把能变形的魔法刀”,让整个 AI 世界运转得更流畅。
这是一篇关于基于 CORDIC(坐标旋转数字计算)的可配置激活函数(Activation Function, AF)设计的回顾性技术论文总结。该论文回顾了该领域的演进,并提出了名为 DA-VINCI 的新型激活函数核心及 NEURIC 神经元引擎,旨在解决 AI 加速器中非线性激活函数带来的硬件瓶颈问题。
以下是详细的技术总结:
1. 研究背景与问题 (Problem)
- AI 硬件瓶颈转移: 随着深度学习模型(DNN, RNN, LSTM, Transformers, ViTs 等)的快速发展,硬件优化的重点已从传统的矩阵乘法(GEMM/MAC)转向了非线性激活函数(AF)。AF 已成为执行复杂模型时的主要瓶颈。
- 现有方案的局限性:
- 查找表 (LUT) 方法: 存储值或参数,但在高精度下存储开销大、延迟高,且难以扩展精度。
- 分段线性 (PWL) 与泰勒级数: 存在插值误差、量化误差和步长伪影,影响模型精度。
- 专用硬件不足: 商业芯片(如 Google TPUv4)中,用于非线性函数的面积占比极低(<2%),但功能需求复杂,缺乏高效的可重构硬件实现。
- 灵活性缺失: 许多现有设计仅支持特定函数(如仅 Sigmoid/Tanh),难以适应从 DNN 到 Transformer 等不断演变的 AI 工作负载需求。
2. 方法论 (Methodology)
论文提出了一种基于 Shift-and-Add CORDIC 技术的动态可配置架构,核心包括 DA-VINCI 激活函数核和 NEURIC 神经元引擎。
- DA-VINCI 核心架构:
- 统一算法: 利用 CORDIC 算法的统一性,通过旋转(Rotational)和向量(Vector)模式,结合线性、圆形和双曲坐标,在一个硬件单元中实现多种函数。
- 支持的函数: 运行时可重构支持 Swish, SoftMax, SELU, GELU, Sigmoid, Tanh, ReLU。
- 硬件优化:
- 采用 HOAA (High-Order Adder Array) 启用的 CORDIC 架构,节省 21% 面积并降低 33% 功耗。
- 通过多路复用器(MUX)、缓冲区和 FIFO 管理不同函数的数据流(例如 SoftMax 需要 FIFO,GELU 需要额外乘法器)。
- 支持 8-bit 和 16-bit 定点(FxP)精度,并在 [−1, 1] 范围内进行归一化计算以确保收敛。
- NEURIC 神经元引擎:
- 基于 DA-VINCI 构建的可重构 MAC(乘加)+ AF 单元。
- 支持 SIMD(单指令多数据) 架构,可配置为迭代或流水线执行策略。
- 设计用于构建轻量级、层复用(Layer-multiplexed)的 AI 向量引擎,适用于资源受限的边缘设备。
3. 主要贡献 (Key Contributions)
- DA-VINCI 可编程 AF 核心: 提出了一个几乎无额外开销的可编程核心,支持在运行时动态切换多种主流激活函数,解决了传统专用硬件灵活性差的问题。
- NEURIC 神经元引擎: 设计了基于可重构迭代 CORDIC 核心的神经元引擎,集成了 8/16-bit 精度的 MAC 和 AF 单元,作为构建高效 AI 加速器的基础模块。
- 实证评估与优化: 通过 FPGA 和 ASIC 验证,证明了该设计在多种 AI 工作负载(DNN, RNN, Transformer)下的有效性,实现了 98.5% 的结果质量 (QoR)。
- 资源效率提升: 相比现有的最先进(SoTA)设计,显著降低了 LUT、触发器(FF)的使用量,并大幅减少了延迟和功耗。
4. 实验结果 (Results)
论文在 FPGA(Zybo, Virtex-7)和 ASIC(28nm/45nm 工艺)上进行了广泛评估:
- 资源利用率 (FPGA):
- 相比 SoTA 设计(如 ReAFM, AFB),LUT 资源减少了 4.5 倍,触发器减少了 3.2 倍。
- 关键路径延迟降低了 30%。
- 功耗降低了 4.2 倍至 5.4 倍。
- ASIC 性能:
- 在 28nm 工艺下,相比 SoTA 设计,面积减少了 16.2 倍,功耗降低了 2.1 倍。
- 相比 RECON 设计,面积减少 11.5 倍,功耗减少 17.3 倍。
- 精度与误差:
- 平均误差(Mean Error)和平均绝对误差(MAE)显著低于其他近似方法(如 PWL 或 LUT)。
- 在 VGG-16、ResNet-50、MobileViT 等模型上,保持了 98.5% 的模型精度(QoR)。
- 向量引擎性能:
- 在 64 个 NEURIC 单元组成的向量引擎中,实现了 52.3 GOPS 的吞吐量,推理延迟为 148ms。
- 在 Transformer 应用中,能量效率比 TRETA 提升 2.5 倍,比 SIGMA 提升 17.54 倍。
5. 意义与影响 (Significance)
- 通用性与适应性: DA-VINCI 打破了传统 AF 硬件只能处理单一函数的限制,能够灵活适应从传统 DNN 到现代 Transformer 架构的多样化需求。
- 边缘 AI 赋能: 通过极低的面积和功耗开销,使得在资源受限的边缘设备(如 IoT 节点、移动设备)上部署高性能、高精度的 AI 模型成为可能。
- 商业价值: 该设计已被证明可集成到 ASIC 和 FPGA IP 中,为未来的 AI 加速器(特别是针对 DNN、RNN/LSTM 和 Transformer 的加速器)提供了高效的硬件基础。
- 技术趋势引领: 验证了基于 CORDIC 的“移位 - 加法”架构在替代传统 LUT 和复杂乘法器方面的优越性,为未来低功耗、高能效的 AI 硬件设计指明了方向。
总结: 该论文不仅回顾了 CORDIC 在激活函数设计中的发展历程,更通过 DA-VINCI 和 NEURIC 提出了一种高效、可重构且高精度的硬件解决方案,显著解决了 AI 加速器中非线性计算部分的资源与性能瓶颈,为下一代 AI 硬件加速器的设计奠定了坚实基础。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。