← 最新论文
🤖 machine learning

Lever: Speculative LLM Inference on Smartphones

本文提出了 Lever,这是一个端到端系统,通过利用闪存和移动硬件的约束,在草稿生成、验证和执行阶段优化推测解码,从而在智能手机上实现高效、低延迟的大语言模型推理。

原作者: Tuowei Wang, Fengzu Li, Yanfan Sun, Wei Gao, Ju Ren

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Tuowei Wang, Fengzu Li, Yanfan Sun, Wei Gao, Ju Ren

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和日常类比对论文《Lever:智能手机上的推测式大语言模型推理》的解释。

核心难题:自行车上的“沉重行李箱”

想象一下,你想骑着一辆自行车(你的智能手机)穿越一个国家。你有一个非常沉重且高品质的行李箱(一个功能强大的大语言模型,即 LLM),里面装有你所需的所有知识。

  • 问题所在: 自行车的篮子很小(手机的快速内存,即 DRAM),无法装下整个行李箱。
  • 目前的权宜之计: 你不得不把行李箱放在后备箱里(手机的慢速闪存)。每次你需要迈进一步(生成一个词)时,都必须停下来,打开后备箱,取出你需要的那一页,阅读后,再把它放回去。这种“走走停停”的方式极其缓慢。这就像试图在不停地停下来翻找后备箱的情况下骑自行车。

核心思路:通过“猜测”来节省时间

这篇论文介绍了一个名为 Lever 的系统。它使用了一种称为 推测解码 的技巧。

把它想象成一个 猜谜游戏

  1. 小助手(草稿模型): 你有一个坐在自行车篮子里(位于快速内存中)的小而快的助手。这位助手擅长猜测接下来会发生什么。
  2. 大老板(目标模型): 放在后备箱里的那个沉重行李箱就是“大老板”。它非常聪明,但访问速度很慢。
  3. 策略: 不再每次只向大老板索要 一个 词,而是让小助手快速猜出一整句话(或一棵可能的句子树)。然后,你只打开后备箱 一次,问大老板:“我猜的这些对吗?”

如果大老板说:“是的,前三个词猜对了”,那么你就用一次去后备箱的行程换来了三个词。这节省了巨大的时间。

三大障碍(以及 Lever 如何解决它们)

作者们意识到,虽然这种“猜测”的想法在强大的服务器上效果很好,但在手机上却因三个具体原因而失效。以下是 Lever 解决这些问题的方法:

1. “树的大小”困境(草稿生成)

  • 问题: 如果小助手猜的词太少,你仍然不得不过于频繁地打开后备箱。如果猜得太多,手机的“大脑”在尝试检查所有这些猜测时会不堪重负,导致速度变慢。
  • Lever 的解决方案: Lever 就像一个 聪明的园丁。它不会随意生长出一丛猜测的灌木。它会仔细计算:“这一枝猜测值得花费精力吗?”它只生长那些可能被接受且检查成本不会过高的分支。它构建了一棵“大小完美”的猜测树,在速度和准确性之间取得平衡。

2. “徒劳无功”的问题(验证)

  • 问题: 即使有一棵不错的树,大老板也可能不得不检查一条最终被证明是错误的分支。在手机上,检查错误的分支是对宝贵电池和时间的浪费。
  • Lever 的解决方案: Lever 在大老板的思考过程中半路安装了一个 交通指挥员(一个轻量级预测器)。在大老板读完整句话之前,交通指挥员会观察线索并说:“嘿,这一枝看起来不对;停止检查它!”这避免了手机做不必要的工作,但它足够谨慎,绝不会丢弃正确的答案。

3. “工具不匹配”的问题(执行)

  • 问题: 智能手机拥有不同类型的“大脑”(CPU 和 NPU)。NPU 擅长同时为许多事物进行数学运算,但它讨厌处理奇怪、不规则的任务。猜谜游戏往往是不规则的。
  • Lever 的解决方案: Lever 就像一个 聪明的项目经理。它知道何时使用快速的 NPU,何时使用灵活的 CPU。
    • 它将相似的猜测分组,以便 NPU 能高效地处理它们(就像工厂的流水线)。
    • 它将最终的“决策”(确定实际选择哪个词)留给 CPU,这样 NPU 就不会浪费能量去计算那些永远不会被使用的路径的答案。

结果

该论文在真实的智能手机(如一加 12)上对各种 AI 模型测试了 Lever。

  • 与旧方法相比(为每个词都打开一次后备箱):Lever 的速度快了 2.93 倍
  • 与其他专为服务器设计的猜测方法相比:Lever 的速度快了 1.50 倍

总结

Lever 是一个能让你的手机运行巨大、智能的 AI 模型而不会卡死的系统。它通过利用一个小型、快速的“猜测”模型来承担繁重的工作,同时精心管理那个缓慢、沉重的“检查”模型,使其不浪费时间和电池,从而实现这一目标。它将一个缓慢、走走停停的过程转变为了平稳、高效的骑行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →