← 最新论文
💻 computer science

Transformer Accelerator (TFA): A Macro-Op INT8 Hardware Chip for Transformer Inference and Machine Translation

本文介绍了 Transformer 加速器 (TFA),这是一种可综合的 INT8 硬件引擎,它实现了位精确(bit-exact)的端到端 Transformer 推理,并实现了 100% 的功能验证,且与 CPU 基准相比在能效和速度提升方面具有显著的预期改进。

原作者: Shashank

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Shashank

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代人工智能通过使用一种被称为 Transformer 的特定类型的神经网络,学会了说话、翻译和推理。这些系统功能极其强大,但它们也非常“饥渴”。为了在句子中生成一个新词,Transformer 必须检索其学习到的所有事实记忆,这个过程需要移动海量的数据。对于依靠电池运行的设备(如智能手机或传感器)而言,这种信息的不断搬运是一个瓶ing颈。从内存中获取这些数字所需的能量,往往远超实际进行计算所需的能量。这产生了一个根本性的问题:如何构建一台能够高效运行这些复杂语言模型,且不损失理解细微差别能力的机器?

一位名叫 Shashank 的研究人员设计了一种专门用于解决这一问题的全新硬件芯片。他并没有构建一台试图处理一切任务的通用计算机,而是打造了一个专门处理语言翻译所需特定数学运算的专用工具。这种被称为“Transformer 加速器”的设计,并不将模型视为需要解释的程序,而是将其视为一种指令流,将数据直接从内存传输到计算引擎中并传回。其目标是创建一个设备,能够接收预训练的语言模型,完全在硅片上运行,并产生与原始高精度计算机版本在数学上完全一致的结果,但消耗的能量要少得多。

这项工作的核心是一个使用整数而非科学计算中通常使用的复杂小数进行运算的芯片。通过切换到这些更简单的整数,需要移动的数据量大幅减少。然而,这种切换通常会导致准确性的损失,因为数字中的微小差异会被舍入掉。研究人员发现,标准的舍入方式对于这种特定类型的语言模型会失效,导致翻译变得混乱。解决方案不在于改变芯片,而在于改变模型在加载到硬件之前的准备方式。通过在准备阶段对模型的内部权重应用精确的数学旋转,研究人员平滑了那些难以处理的数字。这使得这个简单、低功耗的芯片能够产生与复杂的原始版本在位(bit-for-bit)级别完全一致的结果,有效地将数学上的难度隐藏在软件之中,而非硬件之中。

为了证明其有效性,研究人员提取了一个完整的、具备将英语翻译成法语、德语和罗马尼亚语能力的预训练翻译模型,并将其编译为该芯片的一系列指令。随后,该芯片通过了一项严格的模拟测试,检查了过程中的每一个步骤。结果显示,该芯片可以执行整个翻译流水线,包括让模型能够聚焦于正确词汇的复杂注意力机制,且实现了零误差。当芯片生成十个具有挑战性的英语谚语的翻译时,它在底层数据方面与原始计算机的输出完美匹配。在半数情况下,最终生成的翻译单词与浮点参考值完全一致;在另外半数情况下,芯片产生了不同但同样有效的翻译,例如使用不同的词来表达同一个概念,或者使用不同的标点符号。这证明了该硬件不仅速度快,而且值得信赖。

性能提升非常显著。与标准的二十二线程计算机处理器相比,即使是在运行一个经过故意设计得缓慢且困难的模拟内存系统时,该芯片设计在最小配置下生成 Token 的速度也快了二十倍。研究人员预计,更大版本的该芯片速度将比计算机基准快近两百倍。更重要的是,其能效令人惊叹。据估计,该芯片每生成一个单词所消耗的能量仅为计算机处理器的约三千分之一。这种高效得益于芯片能够以内存允许的最大速度将权重流经其计算单元,而不是在等待计算完成后才去获取下一块数据。

这项工作并未止步于模拟。为了确保设计不仅仅是一个理论练习,研究人员将该芯片的数字描述通过了用于创建真实硅片的完整制造流程。这一过程将设计转换成了可以打印到芯片上的物理布局。最终的布局通过了制造所需的各项严格规则,证实了该设计在物理上是可实现的。虽然测试使用的特定版本采用了较旧、较大的制造技术,但成功的布局证明了该架构是稳健的,并且可以缩小到现代高速工艺中。一旦使用先进的存储组件构建,物理芯片预计会变得更小、更快。

这个项目凸显了我们构建未来人工智能的方式转变。与其试图让通用计算机变得更快,不如专注于构建能够完美完成单一任务的小型专用引擎。通过将处理不精确数字的复杂数学问题转移到软件准备阶段,硬件本身可以保持简单、快速且极其高效。该设计的成功表明,我们可以在边缘侧——即那些目前难以处理此类模型的设备上——运行复杂的语言模型,而不必牺牲使其发挥作用的准确性。未来的路径在于扩展该设计以处理更大的模型和更复杂的语言任务,但基础已经奠定:一个小型、经过验证且可制造的芯片,能够以超级计算机的精度和电池驱动设备的效率,翻译世界各地的语言。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →