← 最新论文
💬 NLP

EntMTP: Accelerating LLM Inference with Entropy Guided Multi Token Prediction

EntMTP 是一种无需训练的调度器,它根据局部生成的熵动态调整多 Token 预测深度,旨在最大化推理吞吐量并保持输出质量,实现了相比现有基准高达 1.36 倍的加速。

原作者: Carrie Chen

发布于 2026-06-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Carrie Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图写一个故事,但你有一个非常严格的规则:你一次只能写一个词,并且在写完每一个词之后,你都必须停下来,重新检查你的全部心血以确保这个词是完美的,然后再继续。这就是目前的语言大模型(LLMs)通常的工作方式。这种方式非常精准,但因为你不断地停下来检查工作,所以速度极其缓慢。

为了提高速度,研究人员发明了一个技巧,叫做多 Token 预测(Multi-Token Prediction, MTP)。与其写一个词再检查一次,不如尝试一次性猜出接下来的三个四个词,就像写草稿一样。然后,它进行一次大检查,看看猜对了多少个词。如果它猜对了三个词,就会节省很多时间。

然而,论文 EntMTP 指出了目前使用这种技巧时的一个缺陷。

问题:“一刀切”的错误

目前的模型使用的是一种静态策略。想象一下你正在开车。当前的方法说:“无论你是在平坦的高速公路上行驶,还是在颠簸的土路上行驶,你都必须始终保持脚踩油门的力度和速度完全一致,并且目光始终看向前方 100 英尺处。”

  • 在平坦的高速公路上(低熵): 路况很可预测。你可以安全地看向前方 100 英尺,并完美地预测接下来的几次转弯。
  • 在颠簸的土路上(高熵): 路况很混乱。看向前方 100 英尺是浪费时间,因为你可能会撞到坑洼或突然出现的动物。你应该只看前方几英尺,谨慎驾驶。

现有的模型(如 Hydra 和 Medusa)在开始之前会选择一个“前瞻距离”(即特定的树状结构),然后就一直沿用下去。这是低效的。有时它们猜得太远,浪费了精力;有时它们猜得太少,错失了加速的机会。

解决方案:EntMTP(智能副驾驶)

研究人员提出了 EntMTP(熵引导的多 Token 预测)。把它想象成一个智能副驾驶,它不断观察路况,并告诉驾驶员应该看多远。

  1. 读取“熵”(路况):
    模型不断测量下一个词出现的“惊喜程度”。

    • 低熵(可预测): 文本流动得很顺畅(例如,“太阳从……升起”)。副驾驶说:“很简单!让我们预测接下来的 4 个词!”
    • 高熵(混乱): 文本变得困难或复杂(例如,一道很难的数学题或突然的剧情转折)。副驾驶说:“喔,这有点冒险。我们只预测接下来的 1 个词以确保安全。”
  2. “树库”(工具箱):
    在模型开始写作之前,研究人员准备了一个小的不同猜测策略(树)的“银行”。有些是规模大且激进的(预测很多词),有些是规模小且保守的(预测较少的词)。

    • 至关重要的是,它们不仅仅是选择其中之一。它们创建了一个针对不同情况的最佳选项菜单。
  3. 切换(换挡):
    在写作过程中,EntMTP 充当了换挡器的角色。

    • 如果文本很简单,它会切换到高档位(大树),从而快速前进。
    • 如果文本变得困难,它会立即切换到低档位(小树),以避免出错。
    • 神奇之处在于: 切换档位几乎不耗时。它只是计算机内存中一个快速的指针交换,而不是沉重的重建。

结果:更快速且不失质量

论文在三种完全不同的任务上测试了这个新的“智能副驾驶”:

  • 编程 (HumanEval): 编写计算机程序。
  • 数学 (GSM8K): 解决小学数学问题。
  • 聊天 (ShareGPT): 进行对话。

结果:

  • 速度: EntMTP 比之前的最佳方法(Hydra)稳定快了 9% 到 15%。在某些情况下,它比旧方法快了 36%
  • 质量: 因为模型仍然会完美地检查其工作,所以写作质量完全没有下降。这就像是在开车时开得更快,但到达的是完全相同的目的地,安全性也未改变。
  • 效率: 它实现这种提速并不是通过增强计算机的性能,而是通过让计算机更聪明地判断何时该大胆预测,以及何时该谨慎行事。

核心结论

把旧的方法想象成一名跑步者,无论赛道是平坦的还是布满障碍物的,他都会在跑完 100 米后停下来系鞋带,然后冲刺 100 米,再停下来,如此循环。

EntMTP 则是那个观察赛道的跑步者。如果赛道平坦,他就会全力冲刺。如果他看到障碍物,他会适度减速以确保安全跨越,然后立即再次冲刺。这使他能更快地完成比赛,而不会被绊倒。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →