← 最新论文
💬 NLP

EntmaxKV: Support-Aware Decoding for Entmax Attention

EntmaxKV 是一种支持感知的稀疏解码框架,它利用α\alpha-entmax 注意力的精确稀疏性,在推理前选择性地加载键值(KV)缓存页面,从而显著减少内存流量,在长上下文生成中实现大幅加速,同时保持与全缓存基线相当的准确性。

原作者: Gonçalo Duarte, Miguel Couceiro, Marcos V. Treviso

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Gonçalo Duarte, Miguel Couceiro, Marcos V. Treviso

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是EntmaxKV论文的通俗解释,辅以生动的类比。

核心难题:“无限图书馆”的瓶颈

想象你是一位图书管理员(即 AI 模型),正在撰写一个故事。每写一个新句子,你都需要回顾之前写下的所有内容,以确保新句子合乎逻辑。

在标准 AI 中,这种“记忆”就像一座不断增长的图书馆。每当你写下一个新词,图书馆就会多出一本书。

  • 问题所在:当故事变得非常长(达到数百万字)时,图书馆会变得极其庞大。
  • 瓶颈:为了写出下一个词,图书管理员必须跑向书架,取出图书馆里的每一本书,阅读书脊,并判断哪些是相关的。即使 99% 的书都无关紧要,管理员仍必须物理地搬运它们。这耗费了巨大的时间和能量,拖慢了一切进程。

旧方案:"Softmax"(“人人有票”法)

当前的 AI 模型使用一种称为Softmax的方法。

  • 工作原理:当图书管理员查看图书馆时,Softmax 会给每一本书分配一张微小的、非零的“票”(概率分数)。即使是一本关于“如何烤面包”的书,如果故事讲的是“太空旅行”,它也会获得一张微小的票。
  • 缺陷:因为每一本书都有票,管理员无法直接忽略那些无关的书。他们必须将所有书都加载到房间里进行检查。如果试图为了节省时间而跳过无关的书,就会意外丢弃 Softmax 分配的那些微小票数,从而破坏数学计算并毁掉故事。
  • 结果:这就像试图在一堆干草中找一根针,即使你知道针只在一个极小的角落,你也必须查看每一根干草。

新构想:"Entmax"(“精确零”法)

作者引入了一种新的数学工具,称为α\alpha-entmax

  • 魔法技巧:与 Softmax 不同,Entmax 非常严格。如果一本书不相关,它获得的票数就是精确的零。这不是“微小”,而是什么都没有
  • 优势:如果一本书的票数为零,它对故事就毫无贡献。你可以直接将其扔掉,而完全不会改变结果。
  • 目标:目标不再是试图近似处理整个“干草堆”,而是找到特定的“针”(即支持集)。如果你能找出那些拥有非零票数的少数几本书,就不需要查看图书馆的其余部分。

解决方案:EntmaxKV(“聪明图书管理员”)

论文提出了EntmaxKV,这是一个利用“精确零”特性来加速的系统。其工作原理如下:

1. “盒子”检查(查询感知页面评分)

想象图书馆的书不是散放的,而是存放在盒子(页面)中。

  • 在图书管理员打开盒子阅读内部书籍之前,他们会先查看盒子上的标签
  • 标签包含了对盒内书籍的“摘要”(最小和最大分数)。
  • 管理员会问:“这个盒子里有可能包含相关的书吗?”
  • 如果答案是“不”(该盒子肯定不相关),管理员就永远不会打开这个盒子。他们节省了走向书架并将其取出的时间。

2. “高斯”猜测(高斯感知选择器)

有时,仅凭盒子标签还不足以 100% 确定。作者增加了一个巧妙的猜测游戏。

  • 他们查看盒内书籍的平均值分布范围
  • 他们使用统计猜测(就像天气预报)来估算该盒子中任何一本书可能获得的最高分数
  • 如果“天气预报”显示该盒子中最好的书仍然无聊到无关紧要,他们就会跳过这个盒子。这使他们能够更激进地跳过无关的盒子,而不会错过好书。

3. “精确”搜索(支持集恢复)

一旦管理员只选中了有希望的盒子,他们就会打开它们并运行Entmax数学计算。

  • 因为 Entmax 会给不相关的项目分配,数学计算会自然地忽略选中盒子内的垃圾。
  • 结果:如果管理员选对了盒子,故事就是100% 完美的,与阅读了整个图书馆完全一样。他们只是没有浪费时间处理垃圾。

为何重要(实验结果)

论文将这种方法与旧的"Softmax"方法进行了测试,发现:

  1. 更少错误:当你尝试使用旧的 Softmax 方法跳过书籍时,你不可避免地会丢弃一些重要的“微小票数”,从而导致错误。只要 EntmaxKV 找到了正确的盒子,它丢弃的重要信息为零
  2. 速度:在非常长的故事(100 万字)中,EntmaxKV 比标准方法快3.36 倍,比未使用此跳过技巧的标准 Entmax 方法快5.43 倍
  3. 准确性:它在仅使用极少内存流量的情况下,保持了高质量的故事(低“困惑度”)。

类比总结

  • 旧方法(Softmax):你有百万封邮件。你必须阅读每一封邮件的主题行,以决定回复哪些,因为即使是垃圾邮件也有微小的可能性是重要的。
  • EntmaxKV:你有一个智能过滤器。它首先查看发件人和主题行元数据。它立即识别出 99% 的邮件肯定是垃圾邮件(零概率)。它在未打开的情况下直接删除它们。它只打开那 1% 可能重要的邮件。因为过滤器是完美的,你永远不会错过真正的邮件,但却节省了数小时的时间。

论文的主要主张:通过切换到一种为不相关数据生成“精确零”的数学系统,并在加载数据之前先检查元数据,我们可以使 AI 在处理长任务时速度大幅提升,同时不损失准确性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →