← 最新论文
💬 NLP

Prefilling-dLLM: Predictive Prefilling for Long-Context Inference in Diffusion Language Models

该论文介绍了 Prefilling-dLLM,这是一个无需训练的框架,通过缓存并稀疏选择相关的前缀块,将扩散语言模型长上下文推理的计算复杂度从全序列长度的平方级降低到解码长度的平方级,从而加速推理过程,并实现了最先进的加速效果并缓解了“迷失在中部”现象。

原作者: Jing Xiong, Qi Han, Shansan Gong, Yunta Hsieh, Chengyue Wu, Chaofan Tao, Chenyang Zhao, Ngai Wong

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Jing Xiong, Qi Han, Shansan Gong, Yunta Hsieh, Chengyue Wu, Chaofan Tao, Chenyang Zhao, Ngai Wong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试拼凑一个巨大的拼图,但你不是一次观察整幅画,而是每当你放置一个新碎片时,都必须重新检查整个拼图盒。

这本质上就是 扩散大语言模型 (Diffusion Large Language Models, dLLMs) 在处理长篇故事或文档时目前的工作方式。每当模型尝试生成一个新的词时,它都会从头开始重新阅读并处理对话的整个历史。随着故事变得越来越长,这种“重读”过程变得如此缓慢且昂贵,就像是在跑马拉松时背着一个随着每一步都在变重的沉重背包。

这篇论文介绍了一种名为 Prefilling-dLLM 的新方法来解决这个问题。以下是它的工作原理,我将使用一些日常类比来解释:

1. 问题所在:“重读”陷阱

在传统的 AI 模型中,一旦你读完了一页书,你会记住它,并只关注你正在读的新页面。但在这些扩散模型中,计算机在写每一个新词时,都会从第 1 页到第 1,000 页把整本书重新读一遍。

  • 结果: 如果书很短,没问题。如果这本书有 32,000 页,计算机 99% 的时间都花在重读旧页面上,只有 1% 的时间在编写新内容。

2. 解决方案:“聪明图书管理员”系统

作者提出了一个名为 Prefilling-dLLM 的系统,它就像一个极其高效的图书管理员。与其每次都重读整个图书馆,这位图书管理员会做两件事:

步骤 A:预填充(整理图书馆)

在开始写作之前,图书管理员会将大量的输入文本(“前缀”)切分成若干个(就像书中的章节)。

  • 诀窍: 图书管理员只需将每个章节阅读一次,为它创建一个“摘要卡”(称为 KV cache),然后将其放在书架上。
  • 创新点: 图书管理员并不会阅读每个章节里的每一个字。他们使用一种特殊的技巧,只保留每个章节中最重要的句子,丢弃掉那些冗余的内容。这使得摘要卡变得更小,处理起来也更快。

步骤 B:解码(编写故事)

现在,当模型需要写下一个词时,它不需要重读整个图书馆。

  • 筛选: 模型会询问:“哪些章节与我正在写的这段内容真正相关?”它使用一套智能评分系统,仅挑选出书架上前几个章节(最相关的块)。
  • 效率: 它忽略了对于当前这个特定句子而言不需要的其他 90% 的图书馆内容。它只查看之前制作的那些相关的“摘要卡”。

3. 为什么这是一个游戏规则的改变者

论文声称这种方法带来了巨大的速度提升,因为:

  • 不再重读: 处理长文本的繁重工作在开始时只进行一次
  • 智能跳过: 在实际写作阶段,模型只看极小一部分文本(最相关的块),而不是全部内容。
  • 速度: 在长上下文(8,000 到 32,000 个词)中,这种方法比以往的方法快 9 到 28 倍,同时仍能保证答案的准确性。

4. 解决“迷失在中部”之谜

长文本 AI 模型存在一个已知问题,叫做“迷失在中部 (Lost in the Middle)”。想象一个人在读一份很长的资料列表;他能完美记住开头和结尾,但会完全忘记中间的内容。

  • 论文的对策: 作者发现,通过将文本切分成块,并在每个块的开头添加一个特殊的“锚点”标记(就像章节标题一样),模型就可以在文本的任何位置找到信息,即使是在中间。这就像拥有一个完美的目录,让模型无论故事多长都不会迷失方向。

5. “块大小”的平衡

论文还测试了这些“章节”应该有多大。

  • 太大: 如果块太大,模型可能会错过文本中间的重要细节。
  • 太小: 如果块太小,计算机会在管理块列表上花费过多时间。
  • 黄金分割点: 他们发现,对于非常长的文本,使用许多较小的块效果最好,可以保持高准确度。

总结

Prefilling-dLLM 就像是从一个每次回答测验题都要重读一遍 500 页教科书的学生,转变为一个先制作一份精简的智能学习指南,然后在回答问题时只需翻阅特定页面的学生。

结果如何?AI 可以处理更长的对话和文档,而不会减速到爬行,并且不会忘记隐藏在文本中间的重要细节。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →