N-vium: Mixture-of-Exits Transformer for Accelerated Exact Generation
本文介绍了 N-vium,这是一种混合退出 Transformer,通过利用令牌自适应路由来混合来自不同深度的预测并推迟上层计算,在不牺牲模型质量的前提下,实现了相比标准 Transformer 高达 57.9% 的挂钟时间加速。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你正在阅读一本冗长而复杂的书,需要预测句子中的下一个词。
在标准 AI 模型(即"Transformer")中,这个过程就像一条拥有 48 名工人的工厂流水线,他们排成单列。你输入的每一个词都必须依次经过每一位工人,在每个站点获得一点处理。只有当一个词访问完所有 48 名工人后,最后一名工人才能喊出预测结果。
问题在于:许多词很简单。像"the"或"cat"这样的词并不需要 48 名工人来判断下一个词是什么。但标准模型为了保险起见,仍强制它们访问所有人。这既缓慢又浪费能源。
旧方案:“提前退出”(捷径)
以往的方法试图通过让简单的词“提前”离开流水线来解决这个问题。如果某位工人认为“我知道这个”,他们就会让该词离开。
- 缺陷:这就像工人在未检查最终主管的情况下就猜测答案。有时他们会猜错。此外,由于词提前离开,工厂失去了未来词所需的“记忆”(KV 缓存),迫使系统要么伪造数据,要么重新计算,从而破坏了答案的质量。
新方案:N-vium(智能混合)
这篇论文提出了N-vium,它彻底改变了游戏规则。不再是单列流水线,想象工厂在流水线的不同位置设有四个不同的出口。
以下是 N-vium 的工作原理,借助几个类比:
1. “智能交通灯”(学习路由)
在四个出口中的每一个处,都设有一盏智能交通灯(即“路由器”)。它会观察该词并决定:
- “这个词很简单。让我们让它从 1 号出口离开。”
- “这个词很棘手。让它继续前进到 3 号出口。”
- “这个词非常复杂。将它一直发送到 4 号出口。”
关键在于,AI 在训练过程中学会如何控制这些交通灯。它不是随意猜测,而是确切知道哪个出口能为该特定词提供最佳答案。
2. “完美融合”(精确混合)
在旧的“提前退出”方法中,AI 必须选择一个出口并希望它是正确的。而在 N-vium 中,AI 会将所有可能的答案混合成一杯完美的冰沙。
- 它从 1 号出口取一点答案。
- 它混合一点来自 3 号出口的答案。
- 它再添加一点来自 4 号出口的答案。
- 结果:最终答案在数学上是精确的。它的质量等同于该词访问了所有 48 名工人,但它到达得更快,因为“简单”的计算部分由早期出口处理了。
3. “搭便车”技巧(无记忆丢失)
这是该论文最大的魔法。通常,如果一个词提前离开,工厂就会忘记为下一个词所需的工作。
- N-vium 的修复:当一个词提前离开时,工厂不会丢弃该工作。相反,它会说:“好吧,我们稍后再完成该词剩余的处理。”
- 当下一个词来到流水线时,工厂会同时做两件事:它处理新词,并搭便车处理前一个词未完成的工作。
- 类比:想象一位公交车司机。通常,司机在每个站点停车让乘客下车。有了 N-vium,司机让容易处理的乘客提前下车,然后在前往下一站的途中,把上一站“未完成”的乘客接上并让他们下车,整个过程公交车无需停车或减速。
结果
研究人员构建了拥有高达 15 亿名“工人”(参数)的模型。
- 速度:他们最大的模型比同等大小的标准模型快 57.9%。
- 质量:尽管速度更快,但答案同样好(质量无损)。
- 硬件:这可以在标准计算机芯片(GPU)上运行,无需特殊的新硬件。
总结
请将 N-vium 视为一种智能重组,而非走捷径的偷工减料。它认识到并非每个词都需要完整的工厂之旅。它让简单的词提前离开,将其答案与复杂的词完美混合,并利用“搭便车”机制确保没有任何工作被浪费。其结果是一个思考更快但并未减少思考深度的 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。