← 最新论文
🤖 AI

Accelerating Vision Transformers on Brain Processing Unit

本文提出了一种在针对 CNN 优化的脑处理单元(BPU)上加速视觉 Transformer 的新方法,该方法通过重构模型以使用卷积算子替换线性层,从而在无需重新训练的情况下实现权重继承,并在仅造成极小精度损失的同时实现显著的推理加速。

原作者: Jinchi Tang, Yan Guo

发布于 2026-02-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Jinchi Tang, Yan Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一名超高效、专业化的工厂工人,被称为 BPU(脑处理单元)。这位工人是组装 4D 乐高积木(代表标准图像数据:高度、宽度、颜色通道和批次)的大师。在人工智能的世界里,他们是构建 CNN(卷积神经网络)的专家,而 CNN 是传统的“筑墙者”。

然而,一位全新的、革命性的建筑师——视觉 Transformer (ViT) 到来了。ViT 不再使用 4D 乐高积木进行建造,而是使用 3D 纸张堆叠(序列数据)进行工作。它非常聪明,且通常能产生更好的结果,但它说着一种不同的语言。当你试图雇佣 BPU 工人来建造 ViT 时,他们会感到困惑。该工人被设计为堆叠积木,而不是处理纸张堆叠。因此,ViT 必须由一个更慢的通用型工人(CPU)来构建,导致超快的 BPU 只能闲置。

纸张的解决方案:“变形”技巧

本文的作者 Jinchi Tang 和 Yan Guo 想出了一个聪明的变通方法。他们并没有尝试教 BPU 如何阅读纸张堆叠(这很难,且需要重新训练整个系统),而是将纸张堆叠重新排列,使其看起来像乐高积木。

以下是他们如何实现的,使用了简单的类比:

  1. 线性层问题: 在标准的 ViT 中,大脑使用“线性层”来处理信息。你可以把这些层想象成一个翻译员,他阅读一份单词列表并输出一份新的列表。BPU 看不懂列表;它只理解 4D 网格。

    • 修复方法: 作者将这个“翻译员”及其指令进行了重塑,使其看起来像一个 1x1 的乐高积木。在数学上,它做着完全相同的工作,但现在它完美地契合了 BPU 的工厂。这就像是将一张平面地图卷成圆柱体,仅仅是为了让它能塞进特定的管子里,而没有改变地图的内容。
  2. 层归一化问题: ViT 还使用了一个称为“层归一化”(Layer Normalization)的步骤,用以保持数据平衡(就像恒温器保持房间温度适中一样)。但 BPU 并没有内置恒温器。

    • 修复方法: 作者利用 BPU 现有的乐高积木搭建了一个“恒温器”。他们创建了一串特殊的微型积木(1x1 卷积),通过计算平均值和方差,有效地利用 BPU 已有的工具模拟出了恒温器的功能。

“无需重新训练”的魔力

通常,如果你改变了一座建筑的蓝图,你就必须拆除它并从头开始重建。但由于作者非常小心地确保他们的“乐高积木”在数学上与原始的“纸张堆叠”完全一致,因此原始蓝图(权重)仍然可以完美运行。

他们不需要重新训练模型或教它新知识。他们只是采用了预训练好的 “DeiT” 模型(一种流行的、高效的 ViT 版本),应用了他们的变形技巧,然后将其交给了 BPU。BPU 立即识别出了新的格式,并开始全速运转。

结果:速度 vs. 准确率

团队在两个不同的任务上进行了测试:识别数千种物体(ImageNet)和对花卉进行分类。

  • 权衡: 当你转换模型以在专门硬件上运行时,你通常会损失一点精度(就像从高清照片切换到略微压缩过的 JPEG 图片)。
    • 在大型 ImageNet 测试中,DeiT-Base 模型的准确率仅下降了 1.4%(从 81.8% 降至 80.4%)。
    • 在花卉测试中,下降幅度甚至更小,仅为 0.5%
  • 回报: 作为那微小精度损失的交换,模型变得快得多
    • 最大的模型(DeiT-Base)在 BPU 上的运行速度比在标准 CPU 上快了 3.8 倍
    • 较小的模型也看到了加速效果,增幅在 1.3 倍至 2.1 倍之间。

一个有趣的发现

在测试过程中,作者注意到了一些有趣的事情。有时,测试图像上的官方标签是错误的(例如,一张“狮子”的照片被标记成了“猴子”)。原始的 DeiT 模型正确识别出了狮子,但系统却将其标记为错误,因为标签不对。作者的新型快速模型同样正确识别出了狮子。这表明该模型实际上比官方得分所显示的更加聪明,因为它能够看穿测试数据中的“拼写错误”。

总结

本文首次成功地将视觉 Transformer(“纸张堆叠”建筑师)转化为可以在专门的脑处理单元(“乐高”工厂)上高效运行的模型,且无需从头重建架构。通过巧妙地重塑数学逻辑以适配硬件,他们在几乎不损失智能的情况下实现了 3.8 倍的加速,证明了这些先进的 AI 模型终于可以在专门的嵌入式芯片上高效运行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →