← 最新论文
💬 NLP

Efficient Diffusion LLMs via Temporal-Spatial Parallel Decoding and Confidence Extrapolation

本文提出了一种结合时空并行解码与置信度外推的轨迹感知解码框架,通过动态识别收敛标记并预测未来趋势,从而在保持输出质量的同时,显著降低基于扩散的大语言模型的延迟。

原作者: Zekai Li, Ji Liu, Yiqing Huang, Ziqiong Liu, Dong Li, Emad Barsoum

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Zekai Li, Ji Liu, Yiqing Huang, Ziqiong Liu, Dong Li, Emad Barsoum

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试解决一个复杂的谜题,比如填字游戏或拼图,但你必须用一种非常特殊、不寻常的方式来完成。你不是从左到右一个接一个地放置碎片(像标准 AI 那样),而是从一个充满空白、被遮盖的正方形的棋盘开始。你的目标是一次性填满它们。

然而,这里有一个陷阱:你并不能立即知道最终答案。你必须做出一个“猜测”,检查你的信心程度,如果你不确定,你就必须擦掉你的猜测并重新尝试。你不断重复这个“猜测并擦除”的整个过程,覆盖整个棋盘,一遍又一遍,直到每一个方格都完美无缺。

问题:在已完成的部分上浪费时间
文中指出,这个过程中存在一个巨大的效率低下问题。想象一下你正在填写一份表格。你写下了你的名字,并且 100% 确定它是正确的。但因为系统要求你“重新检查”整份表格 50 次,你即便名字没变,也还是要把名字重写 49 次。这浪费了大量的时间和精力。

目前的 AI 模型(称为 Diffusion LLMs)正是这样做。它们不断对已经完成的单词进行“去噪”(重新检查),仅仅是为了以防万一。此外,它们依赖于简单的规则,比如:“如果置信度分数高于 90%,则停止。” 但研究表明,这种规则过于僵化。有时一个单词已经稳定了,但其分数还没达到 90%;有时一个单词看起来很稳定,但实际上即将发生变化。

解决方案:智能交通控制器
作者提出了一个包含两个主要工具的新系统来解决这些浪费问题:TSPDCE

1. TSPD: “交通控制器”(时空并行解码)

把 AI 的生成过程想象成一条繁忙的高速公路,许多车辆(单词)正试图到达目的地。

  • 旧方法: 每个出口都有一个交警,使用秒表逐一检查每一辆车。如果一辆车在那里停留了 5 秒,交警会说:“好了,你可以离开了。” 这很慢,而且没有考虑到不同车辆实际移动的速度。
  • TSPD 方法: 这个新的控制器就像一个智能交通系统,它会观察每辆车的“历史轨迹”。
    • 时间维度 (Temporal): 它会问:“这个单词是否已经稳定了一段时间?它是正在加速趋向最终答案,还是在前后摇摆?”
    • 空间维度 (Spatial): 它知道句子末尾的单词通常比句子开头的单词需要更长的时间才能稳定下来。它会根据单词所处的位置来调整规则。
    • 结果: 控制器可以判断:“这个单词已经稳定了三步,并且正沿着直线移动。尽管置信度分数还没有达到完美的水平,但我现在就要锁定它。” 这阻止了 AI 在已经完成的单词上浪费时间进行重复检查。

2. CE: “水晶球”(置信度外推)

有时,一个单词正处于通往正确答案的清晰路径上,但它还没有到达“终点线”(高置信度分数)。

  • 旧方法: AI 被动地等待。它继续运行完整的逐步过程,希望分数最终能上升。
  • CE 方法: 这是一个“水晶球”模块。它观察一个单词置信度的近期趋势。如果它看到置信度正在稳定且可预测地上升,它会说:“我能预见未来。再过两步,这个单词一定会达到 95% 的置信度。让我们跳过等待,现在就锁定它。”
  • 安全检查: 这不是一种盲目的猜测。它会计算预测的“不确定性”。如果趋势不稳定或者历史数据太短,水晶球就会保持沉默,AI 则会照常等待。这确保了它不会为了追求速度而犯错。

结果:更快,而非更笨
作者在一个大型 AI 模型(LLaDA-8B)上针对数学问题和编程任务进行了测试。

  • 速度: 他们发现,通过使用这两个工具,AI 的速度提升了 5 到 58 倍,具体取决于文本长度。
  • 质量: 尽管速度大幅提升,但答案的质量(准确性)与缓慢的原始版本几乎完全一致。
  • 兼容性: 该系统可以像插件一样工作。它不会破坏现有的 AI,只是叠加在其之上并告知何时停止工作。它甚至在与其他加速技巧(如 KV 缓存)结合使用时效果更好。

总结
这篇论文介绍了一种让“扩散”型 AI 模型(即通过迭代优化猜测来生成文本的模型)变得更快的方法。与其盲目地重新检查每个单词直到一个僵化的计时器结束,不如使用一个观察每个单词“历史”的智能控制器,以及一个预测单词何时即将完成的“预测器”。这使得 AI 能够提前停止处理已完成的任务,从而在不损失准确性的情况下节省大量时间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →