BaseRT: Best-in-Class LLM Inference on Apple Silicon via Native Metal
该论文介绍了 BaseRT,这是一个针对 Apple Silicon 的原生 Metal 推理运行时,它利用芯片特定的优化技术来实现大语言模型的突破性吞吐量,其性能超越了 llama.cpp 和 MLX 等现有框架,最高可达 1.56 倍。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:打造一辆定制赛车
想象一下,你想在一场特定的赛道(如 Apple Silicon 芯片,如 M3 或 M4)上驾驶一辆赛车(大语言模型,即 LLM)。
目前,大多数人使用“通用适配器”或“租赁车套件”(现有的软件,如 llama.cpp 或 MLX)来驾驶这些赛车。这些套件很棒,因为它们可以在许多不同的赛道上运行,但它们并非专门为这条特定的 Apple 赛道而调优。它们带有额外的重量、不必要的步骤,且配备了一位并不了解捷径的驾驶员。
BaseRT 是一辆全新的、专为 Apple 赛道量身定制的赛车。Base Compute 的团队剥离了沉重的适配器,从零开始构建了一辆能够完美匹配该赛道独特曲线与规则的赛车。结果是?它的行驶速度显著提升。
问题所在:为什么现有软件“慢”?
论文指出,在 Mac 上运行 AI 的现有软件就像是一辆停靠站过多的送货卡车。
- “中间人”问题: 大多数软件使用一个“框架”(类似于中间人)来与计算机的图形芯片(GPU)进行通信。这个中间人增加了额外的步骤,就像每项任务开始前都要先检查一遍剪贴板的经理一样。
- “内存”问题: Apple 电脑有一个特殊功能叫做“统一内存”(Unified Memory),即 CPU 和 GPU 共享同一个巨大的 RAM 池。现有的软件通常将它们视为处于不同房间的个体,迫使数据进行不必要的往返奔波。
解决方案:BaseRT 如何运作
BaseRT 砍掉了中间人,在“大脑”与“肌肉”之间建立了一条直达高速公路。以下是他们使用的四个主要技巧:
“数据驱动”蓝图:
BaseRT 并没有为每种不同的 AI 模型(如 Qwen、Llama 或 Gemma)编写一套新的指令,而是使用了一个单一且灵活的蓝图。这就像是一个万能遥控器,它能自动检测你正对着哪台电视并瞬间切换按键,而不是为每个品牌都需要一个不同的遥控器。这保证了引擎在无需停下来重新配置的情况下持续平稳运行。“零停顿”循环:
当你要求 AI 写一个句子时,它会逐个生成单词。在旧软件中,计算机必须为生成的每一个新单词寻找一个“停车位”(内存分配)。BaseRT 则会在比赛开始前预先停好所有的位置。一旦 AI 开始说话,它就永远不会停下来找停车位;它只会一直向前疾驰。这消除了由内存管理引起的“交通拥堵”。“融合”厨房:
通常情况下,AI 需要在不同的锅里烹饪食材(矩阵乘法、注意力机制、归一化),并在这些锅之间移动食物。BaseRT 将这些步骤融合进了一个巨大的锅中。它在一个动作中完成所有食材的烹饪,节省了移动食物的时间。“定制驾驶员”:
该软件完全了解自己运行在哪个 Apple 芯片上(M1、M2、M3 等)。它会根据具体的引擎大小调整驾驶风格,确保从每一滴燃料中榨取最大的动力。
结果:谁赢得了比赛?
团队将 BaseRT 与两个最大的竞争对手进行了测试:llama.cpp(最流行的开源运行器)和 MLX(Apple 官方框架)。
- 速度: BaseRT 在几乎所有的测试中都是最快的。
- 在小型模型上,它比
llama.cpp快了高达 1.56 倍。 - 在大型“混合专家”(Mixture-of-Experts)模型(复杂的 AI 大脑)上,它处理初始提示词的速度快了高达 1.78 倍。
- 在小型模型上,它比
- “小模型”甜点区: 最大的提升发生在较小的模型上。这是因为在小型模型上,“开销”(用于行政管理任务的时间)占了总时间的很大一部分。通过削减这些浪费,BaseRT 带来了巨大的改变。
- “大模型”现实: 在非常大的模型上,速度主要受限于数据通过内存的速度(带宽)。即使拥有完美的引擎,你也无法超过道路的限速。然而,BaseRT 仍然设法在这里挤出了额外的速度,证明了之前的软件并没有高效地利用这条路。
为什么这很重要?(“边缘”的转移)
论文表明,我们正在向 AI 在你的设备上(你的笔记本电脑或手机)而非远程云端服务器上运行的未来迈进。
- 隐私: 你的数据永远不会离开你的电脑。
- 速度: 无需等待互联网将你的请求传回。
- 成本: 你不需要按字数支付月费;你只需为硬件支付一次费用。
BaseRT 证明了,如果使用专门为此构建的软件,Apple Silicon 在运行本地 AI 方面的能力远比我们想象的要强大。
BaseRT 目前还做不到什么(局限性)
论文坦诚地说明了该工具目前的局限:
- 仅限单用户: 它是为同时使用 AI 的单人设计的。它无法处理数百人同时提问的情况(服务器负载)。
- 仅限 Apple: 它目前仅适用于 Mac 和 iPad。它还不能在 Windows、Android 或 NVIDIA 显卡上运行。
- 暂无“视觉”功能: 它目前处理的是文本模型,而非能够“看”图像的模型。
总结
作者构建了一个定制引擎(BaseRT),它移除了在 Apple 电脑上运行 AI 时所有不必要的负担。通过这样做,他们释放了硬件的全部速度潜力,使本地 AI 比以往任何时候都更快、更私密、更高效。你可以通过 GitHub 亲自尝试。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。