Fast and Expressive Multi-Byte Prediction with Probabilistic Circuits
本文介绍了 MTPC,这是一个基于概率电路的多 Token 预测框架,它通过对未来 Token 的联合分布进行编码,优化了表达能力与延迟之间的权衡,从而在保持原模型性能的同时,显著加速了字节级和子词级大语言模型的生成。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试写一个故事,但你有一个非常严格的规则:你一次只能写一个字母。每当你输入一个字母时,你都必须停下来,思考一下,并询问你超级聪明的脑子(AI)下一步该写什么。这就是目前大多数大语言模型(LLMs)的工作方式。这种方式很准确,但速度极慢,尤其是当你以“字节”(文本的原始构建模块)而不是整个单词进行写作时,因为你需要输入数千个字母才能写出一个句子。
这篇论文介绍了一种名为 MTPC(多 Token 预测电路)的新方法,旨在解决这个速度问题,同时又不损失故事的质量。
以下是它的工作原理,使用了日常类比:
1. 问题:“猜谜游戏” vs. “水晶球”
为了提高速度,研究人员尝试了一个叫做**多 Token 预测(Multi-Token Prediction, MTP)**的技巧。与其猜测一个字母,不如尝试一次猜测一整块字母(比如猜测一个单词接下来的 8 个字母)。
旧方法(独立性假设): 想象你在猜测一个单词接下来的 8 个字母,但你把每个字母都当作与其他字母无关的个体。你猜第一个字母,然后是第二个,然后是第三个,完全忽略了如果第一个字母是“C”,第二个字母不太可能是“Z”。
- 结果: 这种方法很快,但会导致胡言乱语。你可能会得到“Cretoria”而不是“Pretoria”或“Craporia”,因为模型没有意识到这些字母应该如何相互契合。这就像是在盖房子时随机挑选砖块,而不检查它们是否匹配一样。
新方法 (MTPC): 作者说:“让我们停止孤立地猜测字母。让我们把整块内容作为一个连接的整体来猜测。”他们使用了一种叫做**概率电路(Probabilistic Circuit)**的数学工具。
- 类比: 把旧方法想象成一排人传递纸条,每个人都低声说出一个随机的词。而新方法则像是指挥家带领管弦乐队。指挥家(电路)知道,如果第一个乐器演奏的是 C 大调和弦,那么接下来的乐器必须演奏符合该和弦的音符。它理解字母之间的依赖关系。
2. 工具箱:“电路架构师”
论文提出了一个灵活的框架(MTPC),让你能够选择字母之间的“连接程度”。他们提供了不同的“架构”(电路的形状)来平衡速度与智能:
- FF (完全分解型): “随机猜测”模式。快,但很笨。(乐队成员各自演奏)。
- CP (典型张量分解/Canonical Polyadic): “分组猜测”。他们猜测几个主要主题,并围绕这些主题构建字母。稍微聪明一点。
- HMM (隐马尔可夫模型): “连锁反应”。第一个字母影响第二个,第二个影响第三个,依此类推。这非常聪明,但很慢,因为你必须等待一个字母完成后才能开始下一个。
- BTree (二叉树): 这是论文中的明星。想象将 8 个字母分成两组,每组 4 个。模型同时猜测第一组和第二组,但它们通过一个“团队领导”(隐藏变量)联系在一起,以确保它们在整体主题上达成一致。
- 为什么它很棒: 它既拥有“连锁反应”的智能,又拥有“随机猜测”的速度,因为它能同时进行两件事。
3. 安全网:“投机采样”(Speculative Decoding)
你可能会担心:“如果 AI 一次猜测一整块内容,万一它猜错了怎么办?”
论文使用了一种叫做**投机采样(Speculative Decoding)**的技术。
- 类比: 想象一名快速的跑者(草稿模型)和一位缓慢但极其精准的裁判(验证器)。
- 快速跑者向前冲刺,猜测接下来的 8 个字母。
- 缓慢的裁判逐一检查这些字母。
- 如果裁判同意跑者的猜测,太好了!我们保留这些字母。
- 如果裁判不同意,我们就停在那里,丢弃错误的猜测,只保留裁判批准的部分。
由于草稿模型(MTPC)非常擅长理解字母是如何连接的(得益于 BTree 电路),裁判同意跑者猜测的次数比以前更多了。这意味着我们能够保留更多的快速猜测,从而加快整个过程。
4. 结果:在不破坏质量的前提下提升速度
作者在两个特定的 AI 模型上测试了该方法:
- EvaByte: 一个已经以字节进行写作的模型。
- Llama 3.2 3B (Byte): 一个转换为以字节进行写作的流行模型。
研究结果:
- 巨大的加速: 与旧的“一次一个字母”的方法相比,MTPC 使 EvaByte 快了 5.15 倍,使 Llama 快了 2.24 倍。
- 优于“独立性”技巧: 即使与通过单纯独立猜测字母的其他快速方法相比,MTPC 也快了 1.17 倍。
- 无质量损失: 至关重要的一点是,由于有了“安全网”(投机采样),最终输出的质量与 AI 一个字母一个字母编写的质量完全相同。你不会为了速度而牺牲准确性。
总结
这篇论文提出了一种让 AI 文本生成更快的新方法,其原理是教 AI 将文本块作为一个连接的整体进行猜测,而不是孤立的字母。通过使用一种智能的“二叉树”(BTree)结构来组织这些猜测,并使用一个“裁判”来进行验证,他们实现了巨大的速度提升(高达 5 倍),同时保证了文本的完美。这就像是教打字员一次输入整个单词,同时还配备了一个能瞬间捕捉错别字的保险机制。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。