← 最新论文
💬 NLP

Hardware Co-Design Scaling Laws via Roofline Modelling for On-Device LLMs

本文提出了一种通过结合模型训练损失缩放定律(Scaling Laws)与 Roofline 模型推理延迟建模的硬件协同设计框架,能够针对特定端侧硬件(如 NVIDIA Jetson Orin)快速搜索并识别出精度与延迟最优的帕累托前沿架构,显著提升了端侧大模型部署的效率与性能。

原作者: Luoyang Sun, Jiwen Jiang, Yifeng Ding, Fengfa Li, Yan Song, Haifeng Zhang, Jian Ying, Lei Ren, Kun Zhan, Wei Chen, Yan Xie, Cheng Deng

发布于 2026-02-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Luoyang Sun, Jiwen Jiang, Yifeng Ding, Fengfa Li, Yan Song, Haifeng Zhang, Jian Ying, Lei Ren, Kun Zhan, Wei Chen, Yan Xie, Cheng Deng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

1. 核心矛盾:大胃王 vs. 小口袋

现在的 AI 模型(LLM)就像是一个**“超级大胃王”**,它非常聪明,但它需要消耗海量的“食物”(内存、算力、带宽)。

而我们的手机、汽车芯片,就像是一个**“小口袋”**。如果你把一个超级大胃王塞进小口袋,结果只有两个:要么它因为吃不下而“罢工”(运行太慢,卡顿);要么它因为吃得太少而“变傻”(智商下降)。

以前的做法: 工程师们像是在“盲目试错”。先做一个模型,发现太慢了,再改改参数;发现太笨了,再加点参数。这就像是在旅行时,不停地装行李、发现超重、再扔东西、再装,非常浪费时间。

2. 这篇论文做了什么?(发明了“旅行规划公式”)

这篇论文不再让工程师“瞎试”,而是发明了一套**“硬件-软件协同设计定律”**。

他们做了一件非常硬核的事:

  1. 建立“智商公式”:通过训练大量的模型,总结出模型长什么样(深度、宽度、专家数量)和它有多聪明之间的数学关系。
  2. 建立“体力公式”(Roofline Model):通过研究芯片的极限,总结出模型长什么样和它跑得有多快之间的数学关系。

把这两个公式合在一起,就变成了一个“超级规划器”。 你只要告诉它:“我有一个 4GB 内存的手机,我希望 AI 说话的速度每秒钟要达到 20 个字。”这个规划器就能直接算出:“你应该做一个多深、多宽、有多少个‘专家’的模型,才能在不超重的前提下,让智商达到最高。”

3. 论文里的“神级发现”:打破常规

通过这套公式,研究人员发现了一些颠覆直觉的规律,我们可以用**“厨师与食材”**来打比方:

  • 发现一:不要“深而瘦”,要“宽而浅”
    • 传统观念:觉得模型层数越多(越深)越聪明。
    • 新发现:在小设备上,与其做一个“层数极多、但每层都很窄”的瘦长模型,不如做一个“层数适中、但每层都很宽”的模型。这就像与其请一个“读了 100 本书但每本只看了一页”的学者,不如请一个“读了 10 本书但每本都读得很透”的专家。
  • 发现二:MoE(专家混合)是“省钱神器”
    • 类比:以前的模型像是一个“全能厨师”,无论炒什么菜都要动用全身力气。而 MoE 模型像是一个“专家团队”,炒菜时只叫“炒菜专家”出场,不需要动用“烘焙专家”。
    • 结论:在小设备上,用这种“按需叫人”的专家模式,能用极小的代价换取极大的智商。
  • 发现三:量化(精度)的“边际效应”
    • 类比:把模型从“高清”压缩到“标清”(量化),虽然文件变小了,速度快了,但并不是文件减半,速度就翻倍。因为有些“核心零件”还是得用高清的,否则模型会直接变傻。

4. 总结:它有什么用?

这篇论文把原本需要**“几个月”才能完成的模型设计工作,缩短到了“几天”**。

它给未来的意义在于:
以后当你买到一个搭载了“端侧大模型”的智能机器人或自动驾驶汽车时,你不需要担心它是一个“笨拙的巨人”或“聪明的废柴”。因为在它出厂前,工程师已经用这套“数学规划法”,为它量身定制了一套**“既能装进小口袋,又能保持高智商”**的最优大脑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →