← 最新论文
💬 NLP

Rigel: Reverse-Engineering the Metal 4.1 Tensor Compute Path on the Apple M4 Max GPU

本文介绍了 Rigel,这是一项通过逆向工程 Apple M4 Max Metal 4.1 张量计算路径的实证研究,揭示了其 fp8 matmul2d 操作是受限于内存且由模拟而非硬件加速实现的,同时还发现了隐藏的执行细节,并实现了一个手写融合算子,其性能比标准的分解路径高出多达 12.9%。

原作者: Ramchand Kumaresan

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Ramchand Kumaresan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下苹果公司全新的 M4 Max 芯片是一间规模宏大、高科技的厨房。多年来,开发者们(厨师们)一直被告知,这间厨房有一个特殊的、超高速的“张量烤箱”(Tensor Oven),专门用于以闪电般的速度烘焙复杂的 AI 食谱(如大语言模型)。官方说明书(Metal 4.1 规范)写道:“是的,我们拥有这个烤箱,并且它支持这些特定的食材。”但这份手册极其含糊:它既没说这个烤箱是如何工作的,也没说它位于何处,甚至没说它是否真的比标准的炉灶更快。

RIGEL 这篇论文就像是一支决定不再阅读说明书,而是通过品尝食物来弄清楚厨房里到底发生了什么的食品科学家团队。他们构建了一套超精密的测量工具,对 M4 Max 的行为进行了逆向工程。

以下是他们的发现,已转化为日常类比:

1. “特殊烤箱”其实只是一个普通的炉灶

其声称: 论文证明了 M4 Max 并不具备 专用的“张量核心”(一种专门用于 AI 数学运算的硬件单元)。
类比: 把“张量”运算想象成一种特定的蛋糕。说明书暗示这里有一条专门为这些蛋糕设计的超高速传送带。RIGEL 发现,在 M4 Max 上,并没有这条传送带。相反,厨房工作人员(GPU 着色器核心)只是在普通的炉灶上用处理其他所有东西的相同工具来手工制作这些蛋糕。他们做得非常高效,但并没有使用某种秘密的专用机器。

2. “神奇食材”(FP8)是一个骗局,而非超能力

其声称: 论文测试了一种名为 FP8 的低精度数据格式(它使用的内存仅为标准 FP16 格式的一半)。规范暗示这可能会更快,因为数据更小。RIGEL 发现它并不更快;实际上反而稍微慢了一些。
类比: 想象你正在搬运水桶。FP16 格式是大水桶;FP8 格式是小水桶。你可能会想:“如果我用小水桶,我能在同样的时间内多跑几趟!”但科学家们发现,在 M 4 Max 上,工人们在可以使用水之前,必须先停下来把小水里的水倒入一个大桶中。这种“倾倒”(解包)过程耗费了时间。

  • 结果: 使用小水桶(FP8)并不会让工作变快。它只能让你不必一次性搬运那么多沉重的水桶(节省内存空间)。它是一个空间节省器,而不是速度提升器。论文称之为“内存占用特性,而非性能特性”。

3. “秘密食谱”的布局

其声称: 手册说“张量”内存中的数据排列方式是“不透明的”(隐藏的)且“特定于设备的”。RIGEL 弄清楚了它是如何排列的。
类比: 想象厨房工作人员被要求将食材排列成网格,但手册只说:“按某种秘密模式排列。”RIGEL 通过观察工作人员,意识到他们是以一种非常特定的 8x8 正方形模式 来排列食材的。一旦科学家们弄清了这个秘密网格,他们就能重新排列食材,使烹饪过程更加顺畅。

4. “版本门槛”(保安)

其声称: 手册说你可以使用这些功能(需要 Xcode 26.1+),但 RIGEL 发现这是谎言。
类比: 手册说:“任何戴红帽子的人都可以进入 VIP 室。”但当 RIGEL 带着去年的红帽子(Xcode 26.5)尝试进入时,保安把他们踢了出来。你实际上需要一个全新的红帽子(Xcode 27)和一张特定的身份证(macOS 27.0)才能让门打开。手册对于谁能进入的描述完全是错误的。

5. “超级大厨”优化

其声称: 由于科学家们现在完全了解了厨房的工作原理(没有秘密烤箱、8x8 网格、FP8 很慢),他们编写了一个新的自定义食谱。
类比: 与其遵循标准的、分步骤的指令(烘焙蛋糕 -> 添加糖霜 -> 添加水果),这涉及三次往返于储藏室之间,科学家们编写了一个“融合”食谱。他们将烘焙、加糖霜和加水果的步骤合并成了在炉灶旁的一个流畅动作。

  • 结果: 对于那些适合在厨房即时工作区(缓存驻留)完成的任务,这个自定义食谱快了 6.5% 到 12.9%。然而,对于需要频繁往返于仓库(主内存)的大型任务,这种提速效果就消失了,因为往返的时间占据了主导地位。

“重大揭秘”总结

论文得出结论,在 Apple M4 Max 上:

  • 没有魔法硬件: 没有专门的 AI 引擎;一切都是运行在标准的图形核心上。
  • FP8 是为了存储,而非速度: 使用较小的数字可以节省空间,但不会让计算变得更快。
  • 手册是不完整的: 官方文档隐藏了硬件的真实情况、精确的内存布局以及真实的软件要求。
  • 自定义代码胜出: 如果你知道秘密布局,你可以编写一个自定义程序,其性能能微弱但可衡量的超越标准的 Apple 工具。

作者强调,这些发现是基于运行在特定 Beta 版操作系统上的单颗 M4 Max 芯片的硬性数据,并且他们已经发布了所有代码,以便任何人都可以验证这些结果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →