← 最新论文
💻 computer science

Triton for MTIA: Bridging the Programming Model Gaps for Custom AI Accelerators

本文介绍了 Triton 在 Meta 自研 MTIA-2i 加速器上的首次生产级部署,证明了高级领域特定语言(DSL)能够有效地弥合编程模型差距,在实现与专家调优的 C++ 相当的性能的同时,推动其在多种 AI 模型中的高效、大规模应用。

原作者: Haishan Zhu, Domi Yan, Michael Levesque-Dion, Changxu Zhang, Mitch Gamburg, Kirsten Lee, Giancarlo Colmenares, Aditya Bhagwat, Arnab De, Markus Le Roux, Victor Perez Carrasco, Xin Tong, Will Cromar, S
发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Haishan Zhu, Domi Yan, Michael Levesque-Dion, Changxu Zhang, Mitch Gamburg, Kirsten Lee, Giancarlo Colmenares, Aditya Bhagwat, Arnab De, Markus Le Roux, Victor Perez Carrasco, Xin Tong, Will Cromar, Simran Barnwal, Andrew Uderian, Sridhar Gopinath, Jan Szczepaniec, Daniel Neilson, Blaine Burton Rister, Jordan Fix, Jazlyn Li, Zejun Huang, Lite Ye, Nan Zhang, Xinchen Guo, Andiry Xu, Michael Roberts, Kunming Ho, Site Cao, Suryadev Sahadevan Rajesh, Tristan Trouwen, Mike Tsai, Jake Lee, Wayne Su, Yuhan Chen, Xiaolong Xie, David Eklov, Aaron Barnes, Max Bremer, Adam Belay, Shintaro Iwasaki, Roman Levenstein, Ajit Mathews

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图建造一个庞大的高速列车系统,通过城市来运送数百万乘客(数据)。多年来,市面上只有由几家大公司制造的列车,而且它们都在相同的轨道和规则下运行。但现在,一座全新的城市正在被建造,它拥有自己独特的、定制化的轨道和一种完全不同的火车引擎。问题在于?旧的列车时刻表和票务系统(编程语言)无法在这些新轨道上运行。如果你想在这些新系统上运行一列火车,你必须雇佣一个工程师团队,为每一次行程手工打造一份全新的时刻表,这既耗时又极其昂贵。这就是当前人工智能(AI)硬件的现状:各家公司都在制造定制化的“芯片”以提升 AI 的速度,但这些芯片使用的语言与标准芯片不同,导致很难高效地使用它们。

你即将阅读的论文正是针对这一痛点。它提出了一个大问题:我们能否教会那个易于使用的旧列车时刻表系统,在不损失速度的前提下,在这些全新的、奇特的轨道上运行?来自 Meta 的作者们决定通过测试一种名为“Triton”的流行且用户友好的语言(它最初是为标准显卡设计的),尝试将其运行在他们自己的定制芯片 MTIA-2i 上,以此来验证这个想法。他们想看看是否能在保持“简单模式”编程体验的同时,依然获得定制芯片所应具备的“硬核性能”。

魔术翻译官的故事

那么,Meta 团队究竟做了什么?他们构建了一个超级聪明的翻译官。把 Triton 想象成一个可以切换电视频道的万能遥控器。起初,这个遥控器只能控制大型的标准电视(如 NVIDIA 和 AMD 的显卡)。Meta 团队想要用这个同样的遥控器去控制一台非常奇怪的、定制化制造的电视(他们的 MTIA-2i 芯片),而这台电视的按钮和旋钮位置完全不同。

挑战在于,这款定制芯片不仅按钮不同,其运作逻辑也完全不同。在标准电视上,遥控器向屏幕内的一个微型工人发送指令,让其一次只做一件事。而在 Meta 的定制芯片上,遥型的指令会发送给一整支工人团队,他们同时处理大块的数据,而且这些工人必须手动管理自己的存储箱(内存),就像一场音乐椅游戏,你必须精准记住自己的杯子在哪里。

为了解决这个问题,团队并没有仅仅强行让旧遥控器工作,而是为这个遥控器构建了一个新的“后端”。这个系统的全新部分就像一个精明的口译员。当你在 Triton 遥控器上按下按钮(编写一行代码)时,口译员会观察定制芯片那些奇特的规则,并计算出如何精确地将这个简单的指令转化为该芯片能理解的复杂、基于块(block-based)的指令。他们甚至在遥控器中添加了一些特殊的“魔法词汇”(语言扩展),允许专家用户在需要榨取额外速度时微调设置,但同时保持主界面对其他人来说依然简单易用。

结果:快速、灵活且真实

团队并不仅仅是在实验室里构建这个翻译官;他们将其投入到了现实世界中。他们在约 60 种不同类型的 AI 模型上进行了测试,涵盖了从推荐系统(即那种会建议你接下来看什么电影的系统)到生成式模型(即那些创作艺术或文本的模型)。

结果令人印象深刻。他们发现,在这种易用的高级语言中编写的代码,其运行速度几乎与那些由专家使用极其困难的低级语言(C++)精心手写的代码一样快。事实上,对于这些模型中非重型计算的部分,他们的新方法处理了大约一半的层数以及近一半的总运行时间。

最关键的一点是:在短短一个季度(三个月)内,他们成功地将能够使用这一新系统的模型类型数量增加了三倍,并将系统在定制芯片上的运行时间翻了一番。这证明了你不需要为了获得易用性而牺牲速度。通过使用像 Triton 这样灵活的语言,他们弥合了复杂定制硬件与需要快速构建 AI 模型的开发者之间的鸿沟。

为什么这很重要

这项工作表明,我们并不需要每当一家公司制造出新的定制 AI 芯片时就重新发明轮子。与其强迫每个开发者为每一个新硬件学习一种新的、困难的语言,我们可以使用一种单一的、可适应的语言,它能根据底层的芯片进行自我翻译。论文证明了这种方法不仅仅是一个理论;它在生产环境中是行之有效的,它节省了时间,并加速了人工智能领域的创新。这就像是证明了一个万能遥控器不仅可以控制你的电视,还可以控制你的定制款机器人吸尘器,而你甚至不需要学习如何为吸尘器接线。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →