← 最新论文
💬 NLP

TokenButler: Token Importance is Predictable

TokenButler 是一种轻量级且感知查询的预测器,它通过蒸馏掩蔽因果注意力分布来动态识别关键令牌以进行高效的 KV 缓存管理,在不永久驱逐令牌的情况下实现了接近神谕的检索准确率和显著的延迟降低。

原作者: Yash Akhauri, Ahmed F AbouElhamayed, Yifei Gao, Chi-Chih Chang, Sameh Gobriel, Nilesh Jain, Mohamed S. Abdelfattah

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Yash Akhauri, Ahmed F AbouElhamayed, Yifei Gao, Chi-Chih Chang, Sameh Gobriel, Nilesh Jain, Mohamed S. Abdelfattah

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图与一位非常聪明但略显健忘的图书管理员进行对话。这位图书管理员(即人工智能)阅读过海量的书籍(即训练数据),现在正试图根据你刚刚交给他们的一段非常长的特定故事(即上下文)来回答你的问题。

问题在于,这个故事实在太长了——有时长达数十万字——以至于图书管理员的办公桌(即计算机内存)变得完全杂乱无章。为了跟上进度,图书管理员必须保留一份他们迄今为止读过的每一个单词的实时清单(这被称为KV-Cache)。随着故事变长,这份清单变得过大,无法放在办公桌上,导致一切进程慢如蜗牛。

旧方法:丢弃或分组

为了解决这个问题,以往的方法主要尝试了两种方案,但两者都存在缺陷:

  1. “垃圾桶”方法:一些图书管理员决定,一旦办公桌满了,就直接将清单中的旧单词扔掉。
    • 缺陷:想象一下,故事开头提到了一个名叫“齐拉梅尔格罗夫”(Ziramelgrove)的角色。图书管理员当时觉得这个名字不重要,就把它扔掉了。但在 50 页之后,你问:“齐拉梅尔格罗夫是谁?”图书管理员完全不知道那是谁,因为他们把这个名字扔进了垃圾桶。
  2. “盒子”方法:其他图书管理员保留了所有单词,但将它们整理成大盒子(页面)。当他们需要查找某样东西时,就会拿走整个盒子。
    • 缺陷:如果重要的单词“齐拉梅尔格罗夫”恰好被分割在两个盒子之间,图书管理员可能会拿错盒子,或者因为他们是把整个盒子作为一个整体来看待,而不是关注盒子里的特定单词,从而完全错过这个词。

新方案:TokenButler

这篇论文介绍了TokenButler,一位智能助手,它能帮助图书管理员决定确切应该保留哪些单词在桌面上,而无需永久丢弃任何内容。

TokenButler想象成一位站在图书管理员身旁、受过高度训练的观察员

  • 工作原理:图书管理员不再猜测哪些单词重要,而是由 TokenButler 查看你当前的问题(即“查询”),并预测出长故事中究竟需要哪些特定单词来回答它。
  • 魔法技巧:它无需重新阅读整个故事就能知道这一点。它使用一个微小的、轻量级的“作弊小抄”(一个小预测模型),该模型在训练期间学会了识别模式。它知道,如果你询问 1 万字之前提到的某个特定地点,那么即使 10 秒前它看起来无关紧要,这个地点现在突然变成了宇宙中最重要的事物。

为何更优

这篇论文在一个“词语捉迷藏”游戏中测试了该方法。

  • 测试:故事在早期隐藏了一个秘密地点名称,然后用长时间的数学问题和烹饪技巧来分散读者的注意力,最后才问:“这个地点在哪里?”
  • 结果:“垃圾桶”和“盒子”方法经常失败,因为它们要么扔掉了地点名称,要么在错误的盒子里找不到它。然而,TokenButler 成功地让地点名称保持就绪,几乎每次都能找到它,就像一个“神谕”(完美的预测者)那样运作。

速度与效率

你可能会认为增加一位观察员会拖慢图书管理员的速度。但论文展示了 TokenButler 避免这种情况的两种巧妙方法:

  1. “批处理”技巧:图书管理员不是每写一个单词就请观察员检查一次清单,而是每隔几个单词请观察员检查一次。观察员会说:“保留这些单词”,然后图书管理员在接下来的几步中保留它们。这使得整个过程快得多。
  2. “邻居”技巧:观察员知道重要信息通常成簇出现(如全名或句子)。因此,如果观察员选中了某个特定单词,它也会顺便抓取紧邻的单词,以防万一。这确保了即使重要性发生轻微偏移,他们也不会遗漏任何内容。

核心结论

TokenButler 使计算机能够在不耗尽内存或降低速度的情况下阅读和理解海量故事(高达 100 万字)。它通过学会预测当前问题究竟需要哪些单词来实现这一点,从而保持内存的整洁和快速,同时确保没有任何关键细节被意外丢弃。

在测试中,该方法使计算机在显卡上运行时的速度提高了1.6 倍,而在计算机必须从主处理器借用额外内存时,速度提高了7.6 倍,同时保持了与在桌面上保留每一个单词时完全相同的回答准确性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →