← 最新论文
💬 NLP

Polestar: Drift-Aware Cache Calibration and Token Commitment for Efficient Inference of Diffusion LLMs

Polestar 是一个无需训练的推理框架,它利用 Token 表示漂移作为统一信号,以实现高效的 KV 缓存复用和可靠的 Token 提交,从而显著提高扩散大语言模型的准确性和吞吐量。

原作者: Mingyu Lee, Akshat Ramachandran, Souvik Kundu, Tushar Krishna

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingyu Lee, Akshat Ramachandran, Souvik Kundu, Tushar Krishna

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图解决一个巨大的拼图,但你不能一次看全整个画面,而是被迫一次只能放一块碎片,必须等前一块碎片固定下来后,才能看下一块。这就是当今大多数现代 AI 聊天机器人工作的方式;它们非常聪明,但因为过于谨慎而行动缓慢。一种更新、更快的 AI 类型——“扩散模型”(diffusion model)——则试图通过一次性猜测许多碎片来解决拼图,就像画家用一笔涂满整块画布的一个区域一样。然而,这种新方法有一个棘手的问题:随着 AI 填补的图像越来越多,整个图像的语境(context)也会发生变化,导致它之前对其他碎片的猜测突然变得过时了。这就像是你正在画一幅日落图,每当你增加一朵云时,你五分钟前画的海水的颜色突然看起来就不对了。为了解决这个问题,AI 通常不得不停止工作,并在每次添加云朵时重新绘制整个海洋,这极其缓慢且浪费资源。

科学家们一直试图找出如何让这些快速的 AI 模型在不犯错的情况下保持速度。核心问题在于:我们如何告诉 AI 何时可以安全地锁定一块拼图并继续前进,以及何时需要回头修正它之前的错误?如果我们判断失误,AI 要么会陷入重复重绘同一部分的死循环(变慢),要么会锁定错误的碎片,导致最终画面看起来很奇怪(不准确)。这正是佐治亚理工学院和英特尔的研究人员试图通过一种名为“Polestar”的新方法来解决的挑战。

漂移的指南针

研究人员发现,解决这个问题的秘诀在于他们称之为“标记表示漂移”(token representation drift)的东西。用通俗的话说,想象 AI 对一个词的理解就像一个微小的、发光的指南针指针。当 AI 第一次猜测一个词时,指针指向某个方向。但随着 AI 理解周围更多的词,语境发生了偏移,那个指针就会开始摇晃或“漂移”到一个新的方向。团队意识到,这种漂移不仅仅是一个错误,它还是一个信号。

以往的方法试图通过静态规则来预测何时更新 AI 的记忆,比如“每 10 步更新一次”或“如果置信度分数很高则更新”。Polestar 团队发现,这些方法就像是仅通过观察时速表来驾驶汽车;它们忽略了路面本身正在发生变化的事实。相反,Polestar 直接观察指南针指针。如果一个指针开始剧烈摇晃,这意味着 AI 对那部分句子的记忆变得陈旧,需要快速刷新。如果一个指针突然停止摇晃并锁定在一个稳定的方向,这意味着 AI 已经搞定了它,可以安全地“提交”(commit)那个词,从而更快地处理下一个词。

Polestar:聪明的画家

该论文介绍了一种名为 Polestar 的系统,它就像是这些 AI 画家的超级智能艺术总监。它有两个主要职责,作者称之为“Polestar-Cache”和“Polestar-Commit”。

首先,Polestar-Cache 是内存管理器。它不会在每次添加云朵时都重新绘制整个海洋,而是观察指南针指针。它只回到那些指针摇晃最剧烈的特定位置进行重绘。这是一个巨大的效率提升。研究人员发现,通过使用这种“漂移”信号,他们可以比以前更精确地更新 AI 的记忆。他们不仅仅是在猜测,而是使用一种叫做 KL 散度(KL-divergence,这是一种衡量概率分布偏移程度的数学工具)的工具来测量 AI 对一个词的理解变化了多少。通过只关注那些“漂移”的部分,他们节省了大量的计算能力。

其次,Polestar-Commit 是决策者。通常情况下,AI 会等到 100% 确定才会锁定一个词。但 Polestar 注意到,有时一个词的指南针指针在 AI 的置信度分数达到触发通常“锁定”信号的水平之前,就已经停止漂移并变得稳定了。Polestar-Commit 捕捉到了这些“尖锐漂移事件”(sharp drift events)——即指针突然稳定下来的时刻——并发出指令:“嘿,这个已经完成了!现在就把它锁定吧。”这使得 AI 能够在不损失准确性的情况下同时处理多个词(并行处理)。

结果:更快、更聪明

团队在多项困难任务上测试了 Polestar,包括数学问题 (GSM8K)、编程挑战 (HumanEval) 和复杂推理 (MATH)。结果令人印象深刻。在这些测试中,Polestar 使 AI 的速度提升了高达 3.7 倍(以每秒 token 数衡量),同时在特定场景下实现了高达 10.73% 的准确率提升

例如,在 GSM8K 数学基准测试中,标准方法每次前向传播只能处理约 1 个 token(意味着它非常慢)。Polestar 则能在保持 78.33% 高分的同时,实现每次前向传播处理 3.67 个 token。虽然在该特定运行中,基准模型的得分略高(79.30%),但其速度明显较慢。Polestar 的真正威力在于它能够建立一个新的准确率与吞吐量权衡(accuracy-throughput trade-off)的最高水平,经常大幅超越其他快速方法。在另一个 HumanEval 编程基准测试中,Polestar 在保持高准确度的同时,实现了比基准模型 9.1 倍 的加速。

研究人员还展示了他们的方法无需重新训练 AI 模型即可生效。它是一种“无需训练”(training-free)的升级,这意味着它可以直接插入现有的 AI 系统(如 LLaDA 或 Dream-7B)中,使其瞬间变得更快、更可靠。他们甚至构建了一个系统优化方案,将部分繁重的工作转移到计算机的 CPU 上,以防止图形处理器(GPU)过载,确保速度提升是真实的而非仅仅是理论上的。

Polestar 不是什么

需要注意的是,Polestar 并不做哪些事情。论文明确反对认为 token 漂移仅仅是“KV-cache 错误”(一种内存系统的故障)并应当被忽略或平均掉的观点。相反,他们证明了漂移是这些模型运作方式中一个基本且自然的一部分。他们也排除了仅仅降低置信度阈值(让 AI 变得不那么挑剔)是提高速度的好方法的想法;他们的测试表明,如果不观察漂移就这样做,会导致 AI 犯下太多错误。Polestar 不仅仅是在猜测,它利用模型内部“指南针”的具体行为来进行决策。

为什么这很重要

Polestar 的美妙之处在于它将一个问题(AI 的记忆过时)转化为了一个特性(利用漂移来知道何时更新)。通过将 AI 不断变化的理解视为一个有用的信号而非噪声,研究人员创造了一种让这些强大的快速 AI 模型真正发挥潜力的途径。他们不仅是在让 AI 变快,还在让它变得更聪明,知道何时前进,何时回头,为高效的 AI 推理设定了新的标准。正如论文所暗示的,这种方法可能是解锁基于扩散的语言模型全部速度,同时又不牺牲其回答质量的关键。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →