← 最新论文
💬 NLP

EntropyCache: Decoded Token Entropy Guided KV Caching for Diffusion Language Models

EntropyCache 提出了一种无需训练的 KV 缓存方法,通过利用解码 token 分布的最大熵作为低成本信号来动态决定缓存更新时机,从而在扩散语言模型推理中实现了高达 26.4 倍的速度提升,同时保持了竞争力精度且决策开销极低。

原作者: Minsoo Cheong, Donghyun Son, Woosang Lim, Sungjoo Yoo

发布于 2026-03-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Minsoo Cheong, Donghyun Son, Woosang Lim, Sungjoo Yoo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 EntropyCache 的新方法,旨在让一种叫做“扩散语言模型”(Diffusion Language Models, dLLMs)的 AI 生成文本时变得更快、更省资源,同时还能保持很高的准确性。

为了让你轻松理解,我们可以把 AI 写文章的过程想象成在黑暗中拼一幅巨大的拼图

1. 背景:AI 写作的“慢动作”难题

  • 传统的 AI(自回归模型): 就像一个人按顺序拼拼图。拼好第一块,再拼第二块,再拼第三块……每拼一块,他都知道前面已经拼好的部分是什么,所以可以很轻松地记住(缓存)前面的信息,不用每次都重新看一遍。
  • 扩散模型(dLLMs): 这种 AI 很特别,它喜欢同时处理整幅拼图。一开始,整幅图都是模糊的(全是马赛克/乱码)。它需要反复“去噪”,一步步把模糊的方块变成清晰的图像。
    • 问题所在: 因为它是同时看整幅图的,只要它修正了其中任何一块拼图(哪怕只是一个字),整幅图的“关系”都会发生微妙的变化
    • 后果: 为了保持准确,传统的扩散模型在每一步去噪时,都必须重新计算整幅图的所有关系。这就像每拼好一块新拼图,都要把之前拼好的几千块全部重新看一遍、重新算一遍,效率极低,速度慢得像蜗牛。

2. 现有的解决方案:有点“笨”的缓存

以前的研究人员想:“既然大部分拼图块的变化很小,我们能不能只重新计算那些变化大的,其他的直接‘偷懒’用之前的记忆(缓存)?”

  • 旧方法: 它们会计算每个拼图块受影响的程度,或者比较复杂的数学指标来决定要不要重算。
  • 缺点: 这些计算本身就很复杂,而且随着文章变长(拼图变大),计算量会爆炸式增长。这就好比为了决定要不要偷懒,先要跑个马拉松来测量距离,结果还没开始干活,时间就花光了。

3. EntropyCache 的创意:用“犹豫程度”来判断

作者发现了一个非常聪明的规律,并提出了 EntropyCache

核心比喻:AI 的“犹豫”就是“变化”的信号

想象一下 AI 在决定下一个字是什么时,它心里有两种状态:

  1. 非常确定(低熵): 比如它想写“太阳”,它心里 99% 确定是“太”字。这时候,它把这个字填上去,对整幅图的影响很小,之前的记忆(缓存)依然很准。
  2. 非常犹豫(高熵): 比如它想写一个复杂的逻辑词,它在“但是”、“然而”、“不过”之间摇摆不定。这时候,它把这个字填上去,就像往平静的湖面扔了一块大石头,整个画面的波纹(KV Cache 状态)都会剧烈震荡

EntropyCache 的秘诀就是:

  • 不看复杂的数学公式,只看 AI 有多“犹豫”。
  • 如果 AI 对刚写出的字非常犹豫(熵很高),说明这个字很重要,可能会改变整篇文章的走向。这时候,立刻触发“全量重算”,把之前的记忆全部刷新,确保准确。
  • 如果 AI非常确定(熵很低),说明这个字很稳,直接跳过重算,继续用之前的缓存。

第二个发现:惯性效应

作者还发现,一旦 AI 写出了一个“犹豫”的字,这种不稳定的状态会持续好几步。就像扔石头后,水波会荡漾好几圈。

  • 旧方法: 只重算当前这一步。
  • EntropyCache: 不仅重算当前,还会把最近刚写出的几个字(比如最近 64 个)也重新算一遍,确保把那些还没平息的水波都抚平。

4. 为什么这个方法很厉害?

  1. 计算成本极低(Constant Cost):

    • 旧方法判断要不要重算,需要看文章有多长、模型有多深,计算量像滚雪球一样变大。
    • EntropyCache 只需要看一眼 AI 刚才那个字的“犹豫程度”(一个数字)。无论文章是 100 字还是 100 万字,这个判断动作永远只花一点点时间,就像看红绿灯一样快。
  2. 速度提升惊人:

    • 在标准测试中,它比原来的方法快了 15 到 26 倍
    • 在需要复杂推理(比如做数学题、写代码)的任务中,甚至能快 20 多倍
  3. 不牺牲质量:

    • 因为它只在“关键时刻”(AI 犹豫时)才重算,而在“平稳时刻”(AI 确定时)才偷懒,所以它既快又准。实验证明,它的准确率几乎和完全不偷懒的“笨办法”一样高。

5. 总结

EntropyCache 就像是一个聪明的交通指挥官

  • 以前的指挥官(旧方法)会花大量时间计算每辆车的速度、重量、距离,来决定是否放行,结果自己累得半死,路还是堵。
  • EntropyCache 指挥官只看一个信号:“这辆车是不是在急刹车或犹豫?”
    • 如果车在犹豫(高熵),立刻让所有车停下来重新规划路线(全量重算)。
    • 如果车开得稳稳当当(低熵),直接放行,不用管它。

这种方法让 AI 写作的速度飞起,同时保证了写出来的东西逻辑严密、准确无误。这对于未来让 AI 在手机上、或者在资源有限的设备上流畅运行具有巨大的意义。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →