← 最新论文
🤖 machine learning

Maia 200: A Software Defined Dataflow System for Large-scale AI Acceleration

本文介绍了 Maia 200,这是一款高性能、高能效的 AI 加速器,它利用一种新颖的软件定义本地访问数据流架构(SDLA),从以线程为中心转向以数据移动为中心计算,从而为大规模 AI 推理工作负载提供海量并行性并实现显著的成本节约。

原作者: Sherry Xu, Marco Heddes, Jackson Peng, Tom Savell, Monica Tang, Prashant Ranjan, Jesse Benson, Ofer Dekel, Saurabh Dighe, Anupama Kurpad, Artour Levin, Matthew Mattina, George Petre, Cheng Tang, Yuan
发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Sherry Xu, Marco Heddes, Jackson Peng, Tom Savell, Monica Tang, Prashant Ranjan, Jesse Benson, Ofer Dekel, Saurabh Dighe, Anupama Kurpad, Artour Levin, Matthew Mattina, George Petre, Cheng Tang, Yuan Yu, Li Zhang, Torsten Hoefler

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

计算世界目前正在经历一场巨大的变革,这种变革是由一种新型软件驱动的,这种软件能够撰写诗歌、解决复杂的数学问题,并根据简单的描述生成图像。这些被称为大型语言模型的系统,需要极其庞大的计算能力来运行。多年来,业界一直依赖于一种特定的计算机芯片组织方式,即把数据视为等待中央大脑处理的指令流。然而,随着这些模型变得越来越大且越来越复杂,这种传统方法正面临瓶颈。芯片在实际进行数学运算方面花费的时间太少,而是在等待数据到达方面花费了太多时间,导致构建和运行这些系统极其昂贵,并且消耗大量的电力。核心挑战不再仅仅是如何让数学运算更快,而是如何更高效地移动数据本身。

微软的研究团队推出了一种解决这一问题的新方法,他们开发了一款名为 Maia 200 的芯片。他们没有试图让旧的思维方式更加努力地工作,而是设计了一个改变计算机芯片处理信息基本规则的系统。他们将这种新设计称为“软件定义局部访问数据流”(Software Defined Locally Accessed Dataflow)架构。用通俗的话说,这意味着该芯片的设计初衷是让数据在不需要中央指令告诉它下一步做什么的情况下,就能精确地在需要的时候被移动到需要的地方。研究人员已经证明,这种方法使芯片能够以比以往设计更高的速度和能效执行计算,为下一代人工智能提供动力,同时避免了目前限制行业的巨大成本和能源惩罚。

要理解为什么这很重要,必须了解现代计算机通常是如何工作的。几十年来,标准设计一直是拥有一个中央处理器,从一个大型共享存储库中提取数据,对其进行处理,然后将其发回。这对于许多任务来说效果很好,但对于人工智能所需的庞大、重复性计算,这会产生瓶颈。处理器经常处于闲置状态,等待数据在芯片上移动。微软团队意识到,对于这类特定的工作负载,最有效的方法不是拥有一个单一的中央指挥官,而是赋予数据自己的指令。他们创建了一个系统,其中数据的移动是被明确编程的,允许芯片的不同部分独立且并行地工作。这使关注点从管理执行线程转向了管理信息本身的流动。

Maia 200 芯片是这一理念的物理体现。它是一块巨大的硅片,包含超过 1400 亿个晶体管,专门用于处理人工智能推理(即使用训练好的模型生成答案的过程)中的繁重任务。该芯片采用了独特的内部结构,将其内存划分为许多位于数学运算部分旁边的微小、专门的存储单元。这是对传统设计(即拥有一个巨大的内存池)的有意识偏离。通过将数据保留在被使用的位置附近,该芯片避免了与长距离跨硅片传输相关的能量浪费和时间延迟。研究人员发现,这种设计使芯片能够在其功率限制内实现此前被认为不可能实现的性能水平,在保持 750 瓦能耗预算的同时,提供了巨大的计算能力。

Maia 200 真正独特之处在于它如何处理数据的移动。在旧系统中,计算机通常依赖于“缓存”(cache),这是一种自动存储它认为处理器可能在下一步需要的数据的快速小容量内存。虽然这在通用计算中表现良好,但微软团队发现,对于人工智能那种可预测的、重复性的模式,自动缓存实际上是低效的。它增加了复杂性和开销,从而降低了速度。相反,Maia 200 使用了一个系统,由程序员明确告知芯片何时以及如何移动数据。这听起来可能会让编程变得更难,但研究人员设计了一个新的软件层,允许专家在需要最高速度时完全控制数据移动,同时仍为通用任务提供更简单的工具。这种方法赋予了该芯片自动系统无法比拟的精准度,使其能够让处理器的每个部分都保持忙碌并满负荷工作。

该芯片还旨在与其他芯片在大型集群中无缝协作。人工智能模型通常规模巨大,单个芯片无法容纳,需要数千个芯片协同工作。Maia 200 内置了一个复杂的网络,使其在芯片之间传输和接收数据就像在芯片内部移动数据一样容易。研究人员展示了该系统可以连接数千个芯片,创建一个每秒能进行极大量次(quintillions)计算的超级计算机。他们使用现实世界的 AI 模型(包括一个拥有数十亿参数的大型语言模型)测试了这个系统,发现它生成的文本速度可以达到硬件理论最大值的 70% 以上。这是一个显著的成就,因为它表明这种新架构不仅在理论上可行,而且在实际、复杂的场景中也能有效运行。

该研究最重要的发现之一是其对成本和能源的影响。团队计算出,通过使用这种新设计,与现有的其他加速器相比,可以将大规模人工智能系统的总拥有成本降低 30%,并将能耗降低 15%。在能源账单正成为主要担忧、且计算需求呈指数级增长的行业中,这些节省是非常可观的。研究人员实现这一点并非通过使芯片变得更小或制造得更便宜,而是通过使整个系统在执行任务时更加高效。通过消除在不必要的数据移动上浪费的时间和能量,该芯片能以更少的功耗完成更多的工作。

Maia 200 代表了我们构建未来计算机方式的一次重大飞跃。它背离了单一中央大脑管理一切的旧观念,转而拥抱一个数据通过专业化工作者网络自由且高效流动的模型。研究人员已经证明,通过控制数据移动并将内存精确放置在需要的地方,我们可以构建出更快、更便宜且更节能的系统。随着人工智能的不断演进并对更多动力提出需求,像 Maia 200 这样的设计为可持续且可扩展的未来提供了路径。这项工作表明,高性能计算的未来不仅在于让数学运算更快,还在于重新思考如何管理和移动数据本身。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →