← 最新论文
🤖 machine learning

D-PACE: Dynamic Position-Aware Cross-Entropy for Parallel Speculative Drafting

本文介绍了 D-PACE,一种动态位置感知交叉熵损失函数,它根据预期的接受草稿长度自适应地调整训练权重,从而在不改变模型架构或推理流程的情况下提升并行推测解码的效率和加速比。

原作者: Tianyu Wu, Yu Yao, Zhenting Qi, Han Zheng, Zhuohan Wang, Haoran Ma, Lawrence Liao, Himabindu Lakkaraju, Ju Li, Yilun Du

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianyu Wu, Yu Yao, Zhenting Qi, Han Zheng, Zhuohan Wang, Haoran Ma, Lawrence Liao, Himabindu Lakkaraju, Ju Li, Yilun Du

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试写一个长篇故事,但有一条严格的规则:你每次只能写一个词,而且必须等待一位“老板”(一台非常聪明但速度很慢的计算机)检查完这个词后,才能写下一个词。这就是目前大多数人工智能模型的工作方式。它很准确,但极其缓慢,因为老板总是让你等待。

捷径:推测解码
为了加快速度,研究人员发明了一种“草稿”系统。他们使用一个小型、快速的助手(草稿模型)来一次性猜测接下来的几个词(比如一次猜 16 个词)。然后,大老板一次性检查这 16 个词。

  • 如果助手猜对了第一个词,老板就接受它。
  • 如果助手猜对了第二个词,老板也接受它。
  • 关键点:一旦助手犯了一个错误,老板就会立即停止检查。即使助手完美地猜对了第 15 个词,该错误之后的所有内容都会被丢弃。

旧方法(DFlash)的问题
这篇论文讨论了一种称为DFlash的方法,它是一个非常优秀的助手,能一次性猜测所有 16 个词。然而,在训练这个助手时,旧方法使用了一条固定规则来决定对错误的重视程度。

  • 旧规则:“我们非常关注第一个词,对第二个词的关注稍少一些,对第三个词的关注更少,而对第 16 个词几乎不关注。”
  • 为何失效:想象一下,助手在第一个词上变得非常擅长。现在,第一个词很少出错。真正的瓶颈(阻碍老板接受整个词块的因素)已经转移到了第 10 个或第 12 个词上。但旧规则仍然忽略第 12 个词,因为它在序列中“靠后”。助手继续浪费精力试图在第一个词上做到完美(它已经做到了),却忽视了实际上导致失败的后面的词。

解决方案:D-PACE(智能教练)
作者提出了D-PACE,它就像一个智能、动态的教练。教练不使用固定规则,而是实时观察助手,并问道:“在这个词块中,具体是哪个词目前导致了最多的拒绝?”

以下是 D-PACE 如何工作的简单类比:

  1. “信任链”:将这 16 个词想象成一条链条。为了让老板接受整条链条,每一个链接都必须牢固。如果链接 #1 断裂,整条链条就毫无用处。如果链接 #1 保持完好但链接 #5 断裂,那么链接 6 到 16 也同样无用。
  2. “代理”(水晶球):论文创建了一个数学上的“水晶球”(称为代理),它根据助手对每个词的置信度,来估计被接受的词链会有多长。
  3. 动态加权
    • 如果助手在第 #1 个词上表现不稳,教练就会喊道:“专注于第 #1 个词!”因为那是薄弱环节。
    • 如果助手在第 #1 个词上表现很棒,但在第 #10 个词上表现不稳,教练会立即转移焦点:“第 #1 个词做得很好!现在,修复第 #10 个词,因为那是阻碍我们获得完整词块的原因!”
    • 教练将**更多的训练点数(权重)**分配给当前成为瓶颈的那个特定词。

D-PACE 的关键特性

  • 无需新硬件:它不需要更大的计算机或新型人工智能模型。它只是改变了模型在训练期间学习的方式
  • 非对称平滑:为了防止当助手非常不确定时数学计算崩溃(这会导致“信任链”归零),教练使用了一张安全网。它适度平滑置信度分数以保持数学稳定性,但不改变实际的学习目标。
  • 快速:它几乎不会给训练过程增加额外时间(仅慢了约 2.3%)。

结果
论文在多种不同的人工智能模型和基准测试(如数学问题、编程和聊天)上测试了这种方法。

  • 更快的速度:使用 D-PACE 的人工智能模型生成文本的速度比之前的最佳方法快 8% 到 12%
  • 更长的链条:“接受长度”(老板一次性接受的词数)显著增加。老板不再在 4 个词后停止,而是经常接受 5 个或 6 个词。
  • 通用性:它在不同类型的人工智能模型(Qwen 和 Llama)上表现良好,证明这是一种通用的改进,而不仅仅是针对特定模型的技巧。

总结
D-PACE 不再根据位置将序列中的所有词视为具有同等重要性。相反,它动态地识别出接受链中当前哪个词是“薄弱环节”,并指示人工智能将学习精力集中在那里。这种策略上的简单转变,使得人工智能在无需任何新硬件的情况下,显著变得更快、更高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →