← 最新论文
🤖 machine learning

Cascade Token Selection for Transformer Attention Acceleration

本文提出了一种级联令牌选择机制,通过在各层继承并增量更新代表性令牌来加速 Transformer 注意力计算,从而在保持高信息保留率的同时,将选择复杂度从O(T2d)O(T^2 d)降低至O(Trd)O(T r d)

原作者: Stephen J. Thomas

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Stephen J. Thomas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个 Transformer 模型(现代人工智能的大脑)是一座巨大的多层图书馆。每当 AI 阅读一个句子时,它都会派遣一支“图书管理员”团队(层)上楼来整理信息。

在标准图书馆中,书架上的每一本书(token)都需要与其他每一本书进行比较,以寻找关联。如果你有 512 本书,仅为了决定哪些书重要,就需要进行超过 260,000 次比较。这既缓慢又昂贵,尤其是对于长故事而言。

问题:“重新检查”瓶颈

一种名为 ADA 的先前方法试图解决这一问题。它意识到,大多数书实际上只是几本“关键”书的副本或非常相似。ADA 不再比较所有 512 本书,而是挑选一小部分“代表性”书籍(例如 200 本),并忽略其余部分,假设它们是冗余的。

然而,ADA 有一个隐藏成本:为了找出这 200 本关键书籍,它必须在图书馆的每一层,从头开始重新检查每一本书与所有其他书籍的关联。 这就像在每一层楼都雇佣一支新的图书管理员团队来重新整理整座图书馆,尽管从下一层楼上来后,书籍并没有发生太大变化。寻找关键书籍的成本几乎与阅读它们的成本一样高。

解决方案:“级联”电梯

本文介绍了一种巧妙的捷径,称为级联 Token 选择(Cascade Token Selection)

将图书馆的楼层想象成 AI 中的层。作者发现了一个令人惊讶的事实:第 10 层的“关键书籍”组与第 11 层的组几乎完全相同。 在一层楼上重要的书,在下一层楼依然重要。AI 不会因为向上移动了一层楼,就突然决定某本随机书籍变得重要。

级联方法不再在每一层重新检查整座图书馆,而是这样做:

  1. 继承:它从下一层获取“关键书籍”列表。
  2. 验证:它仅检查这些特定的关键书籍是否仍然是关键,以及是否有任何被“忽略”的书籍突然变得重要。
  3. 更新:它进行微小的调整(添加或移除几本书),而不是从头开始。

类比:音乐会人群

想象一场音乐会,人群就是 AI 的数据。

  • 旧方法(独立选择):在每一首歌时,一名保安扫描整个由 10,000 人组成的人群,以找出 500 名最兴奋的粉丝。这花费了漫长时间。
  • 新方法(级联):保安查看上一首歌中 500 名兴奋粉丝的名单。他知道其中大多数人仍然兴奋。他只需检查这 500 人是否仍然兴奋,以及后排是否有任何新人突然跳了起来。他不再重新扫描整个人群。

结果:论文发现了什么

作者在强大的计算机芯片上,针对三种不同的 AI 模型(GPT-2、GPT-J 和 OPT)测试了这种方法。结果如下:

  • 巨大节省:通过不再每次重新扫描整个人群,他们节省了22% 到 63% 的计算机工作量,这些工作量原本仅用于寻找重要 Token。模型越深(楼层越多),节省幅度越大。
  • 稳定性:“关键书籍”列表从一层到下一层保持了 83% 到 94% 的相同性。这证明了随着 AI 深入,其对重要性的理解非常稳定。
  • 安全性:该方法是“保守”的。它绝不会意外丢弃一本真正重要的书。它可能会保留几本额外的“可能”书籍(使列表稍大),但它保证绝不会遗漏任何关键书籍。这意味着 AI 的回答依然同样准确。

为什么这很重要

论文总结认为,之所以有效,是因为 AI 内部的“世界观”随着深入而平滑变化。这不是混乱的跳跃,而是温和的演变。通过利用这种平滑性,级联方法将沉重、缓慢的过程转变为轻盈、快速的过程。

简而言之:不要在每一步都重新发明轮子。只需检查你正在滚动的轮子是否仍然是圆的,如果不是,就修正微小的晃动。 这使得运行大型 AI 模型显著更快、更便宜。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →