← 最新论文
🤖 machine learning

LLMForge: Multi-Backend Hardware-Aware Neural Architecture Search with Infinite-Head Attention for Edge Language Models

LLMForge 是一个硬件感知的神经架构搜索框架,它利用无限头注意力机制和多后端成本模型,自动生成针对特定边缘设备约束优化的十亿参数以下语言模型,与现有基线相比,在能效、延迟和模型准确性方面实现了显著提升。

原作者: Xinting Jiang, Junyi Luo, Ruichen Qi, Kauna Lei, Ben Laurie, Gregory Kielian, Mehdi Saligane

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinting Jiang, Junyi Luo, Ruichen Qi, Kauna Lei, Ben Laurie, Gregory Kielian, Mehdi Saligane

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试构建一个完美的微型机器人“大脑”,它能在智能手机或智能手表上运行。你希望它足够智能,能够理解语言,同时又足够小巧,能放进口袋,且不会耗尽电池或让手机发烫。

问题在于,这些“大脑”的标准“蓝图”(称为 Transformer)是为庞大的超级计算机设计的。当你试图将它们缩小以适应边缘设备时,它们往往会陷入“交通拥堵”,耗尽内存,或消耗过多能量。

LLMForge 是研究人员为解决这一问题而开发的新工具。你可以把它想象成一位超级智能、具备硬件感知能力的建筑师,它不仅仅会缩小“大脑”,而是根据该“大脑”将要运行的设备的具体“地形”,彻底重新设计其蓝图。

以下是 LLMForge 的工作原理,分为三个简单部分:

1. 无限头注意力(IHA):打破规则

传统的机器人“大脑”遵循一套僵硬的规则书。如果你想增加“思考头”(即查看句子不同部分的处理器)的数量,你就被迫让每个头变得更小。这就像切披萨:如果你切得更多,每一片就会变小。这限制了“大脑”能达到的智能程度。

LLMForge 的创新:它摒弃了僵硬的规则书。通过无限头注意力,建筑师可以为“大脑”的每一层独立地改变“切片”的数量、“切片”的大小以及“配料”的类型。

  • 类比:想象一支通常必须建造相同尺寸房间的建筑队。LLMForge 给了他们一个魔法工具,让他们能在同一张平面图中,在巨大的舞厅旁边建造一个微型壁橱,然后再建造一个中等大小的办公室。这将可能的蓝图数量扩展了400 倍,使他们能够找到一种形状,完美契合特定设备的限制条件。

2. Forge-Former:水晶球

从头开始构建和测试新的“大脑”蓝图既昂贵又缓慢。这就像为了验证食谱是否可行而烤一个蛋糕,然后把它扔掉。如果你有数千种食谱要测试,你会破产的。

LLMForge 的解决方案:他们构建了一个名为 Forge-Former水晶球

  • 工作原理:水晶球不需要烤每一个蛋糕,而是查看食谱(即蓝图),并准确预测蛋糕的味道会有多好(即模型的智能程度)以及它将消耗多少能量。
  • 结果:这个水晶球比以往的“猜测”工具准确得多。它允许系统在原本仅能测试少数几个设计所需的时间内,测试数千种设计,从而节省大量的时间和能量。

3. Forge-DSE:多工具导航仪

不同的设备面临不同的问题。高端图形处理器(GPU)可能受限于数据传输速度,而智能手表中的微型芯片可能受限于其能承受的发热量。对一种设备完美的设计,对另一种设备可能糟糕透顶。

LLMForge 的方法Forge-DSE 引擎充当一个带有多种工具的导航仪

  • 它不仅仅寻找“最智能”的模型,而是寻找智能、速度和能效之间的最佳权衡(即“帕累托前沿”)。
  • 它将设计与四种不同类型的硬件(如高速 GPU、专用芯片和环形芯片)进行测试对比。
  • 结果:系统认识到“一种尺寸无法适合所有情况”。它为每种设备生成不同的、独特的蓝图。
    • 对于注重速度的设备,它构建一个宽而浅的“大脑”。
    • 对于注重能效的设备,它构建一个深而窄的“大脑”。

结果:现实世界的胜利

研究人员在两种规模的模型(约 1 亿和 3 亿参数)上测试了该系统,并将其与现有的流行模型(如 SmolLM2 和 Qwen)进行了比较。

  • “准确性”模型:他们的新设计之一比竞争对手更智能(错误率更低),尽管它的参数更少(即体积更小)。
  • “能效”模型:另一个设计每生成一个单词所消耗的能源比标准模型减少了 40%
  • “速度”模型:第三个设计在开始说话(首词时间)和完成句子方面的速度快了 43%

总结

LLMForge 是一个不再试图将“一种尺寸适合所有”的“大脑”强加给每个设备的系统。相反,它利用灵活的设计语言、快速预测的水晶球以及智能导航仪,为每一块特定的硬件工程化定制一个专属的“大脑”。其结果是更小、更快、更节能的人工智能,真正能够放入口袋。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →