← 最新论文
💬 NLP

FASA: Frequency-aware Sparse Attention

本文提出了 FASA 框架,通过利用旋转位置编码(RoPE)中频率分块(FC)层面的功能稀疏性,动态识别并保留关键令牌以进行稀疏注意力计算,从而在显著降低 KV 缓存开销的同时实现了长上下文任务中接近全量注意力的性能。

原作者: Yifei Wang, Yueqi Wang, Zhenrui Yue, Huimin Zeng, Yong Wang, Ismini Lourentzou, Zhengzhong Tu, Xiangxiang Chu, Julian McAuley

发布于 2026-03-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifei Wang, Yueqi Wang, Zhenrui Yue, Huimin Zeng, Yong Wang, Ismini Lourentzou, Zhengzhong Tu, Xiangxiang Chu, Julian McAuley

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 FASA(频率感知稀疏注意力)的新方法,旨在解决大语言模型(LLM)在处理超长文本时遇到的“内存爆炸”和“速度变慢”的问题。

为了让你轻松理解,我们可以把大语言模型想象成一个正在写长篇小说的超级作家,而 FASA 就是这位作家的超级记忆助手

1. 核心痛点:作家的“记性”负担太重了

想象一下,这位作家要写一本几百万字的小说。

  • KV Cache(键值缓存):就像作家为了保持故事连贯,必须把之前写过的所有情节都记在脑子里(或者写在一张无限长的便签纸上)。
  • 问题:随着故事越来越长,这张“便签纸”变得无限长。
    • 内存不够:作家的大脑(显存)装不下这么多内容,导致电脑卡顿甚至崩溃。
    • 阅读太慢:每写一个新句子,作家都要从头到尾把这张超长的便签纸翻一遍,才能找到灵感,这太浪费时间了。

现有的解决方法要么是把便签纸撕掉一部分(静态剪枝),但这可能会不小心撕掉关键剧情;要么是凭感觉撕(动态启发式),但往往抓不住重点。

2. FASA 的灵感:发现“频率”的秘密

FASA 的发明者发现了一个有趣的秘密,这源于模型中一种叫 RoPE(旋转位置编码)的机制。

🌰 创意类比:交响乐团与“主导乐器”

想象大语言模型的注意力机制是一个交响乐团,里面有成百上千种乐器(我们称之为“频率块”或 FC)。

  • 传统观点:认为要听懂一首曲子,必须让所有乐器都同时演奏,缺一不可。
  • FASA 的发现:经过仔细观察,他们发现,虽然乐团里有几百种乐器,但真正决定这首曲子“情感”和“剧情走向”的,只有少数几种“主导乐器”(比如小提琴和长笛)。
    • 其他大部分乐器(比如背景里的鼓点或低音)虽然一直在响,但它们主要是在维持节奏和位置感,对“接下来该说什么”贡献很小。
    • 这就叫功能稀疏性:只有少数的“主导频率块”承载了核心的上下文信息。

3. FASA 是如何工作的?(两步走策略)

FASA 不需要重新训练模型,它像是一个聪明的选曲指挥家,分两步走:

第一步:快速筛选(Token Importance Prediction, TIP)

  • 动作:在作家准备写下一个字之前,FASA 指挥家只让那几种“主导乐器”(主导频率块)快速演奏一下。
  • 效果:通过听这几样乐器的声音,指挥家就能瞬间判断出:刚才便签纸上的哪几个情节(Token)是真正重要的?
  • 比喻:就像你不需要读完整本《红楼梦》才能知道“林黛玉进贾府”很重要,你只需要扫一眼目录里的关键章节标题(主导频率),就能锁定重点。
  • 优势:这一步非常快,而且不需要消耗额外内存,因为它是基于模型自带的数学特性(离线校准一次即可)。

第二步:精准聚焦(Focused Attention Computation, FAC)

  • 动作:一旦锁定了那几十个最重要的情节,FASA 就把便签纸上其他无关紧要的几千页直接折叠起来,暂时不看
  • 效果:作家只在那几十个关键情节上集中注意力,写出下一个字。
  • 比喻:这就好比你在找东西时,不再在整间屋子里乱翻,而是直接打开那个“最可能放东西的抽屉”(关键 Token),瞬间找到答案。

4. 两个版本:FASA-M 和 FASA-C

为了适应不同的需求,FASA 有两个变种:

  • FASA-M(省内存版):就像把不常用的书都搬到了地下室(CPU 内存),只把最关键的几本放在书桌上(GPU 显存)。适合内存很小的电脑。
  • FASA-C(加速版):书都在书桌上,但只快速翻阅那几本关键的。适合想要极速生成的场景。

5. 结果如何?

实验表明,FASA 非常厉害:

  • 几乎无损:即使只保留 256 个关键 Token(原本可能有几万),它的表现依然能达到全量记忆的 99% 以上。
  • 速度飞起:在处理超长数学推理(如 AIME24)时,速度提升了 2.56 倍
  • 通用性强:无论是写代码、做阅读理解,还是复杂的逻辑推理,它都能胜任。

总结

FASA 就像给大语言模型装上了一副“智能眼镜”
以前,模型看世界是“全景扫描”,不管看到什么都要处理,累得半死。
现在,戴上 FASA 眼镜后,模型能自动过滤掉背景噪音,只聚焦于那些真正决定剧情走向的“关键帧”。

这不仅让大模型能处理更长的故事(如整本书、整个代码库),还让它们跑得更快、更省电,让普通人的电脑也能跑动以前需要超级计算机才能处理的长文本任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →