← 最新论文
🤖 machine learning

AdaSplash-2: Faster Differentiable Sparse Attention

本文提出了 AdaSplash-2,一种通过新颖的直方图初始化方法显著降低α\alpha-entmax 注意力归一化计算开销的高效可微稀疏注意力机制,使其在长上下文训练中的性能可与 FlashAttention-2 媲美,并在长序列任务中展现出显著优势。

原作者: Nuno Gonçalves, Hugo Pitorro, Vlad Niculae, Edoardo Ponti, Lei Li, Andre Martins, Marcos Treviso

发布于 2026-04-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Nuno Gonçalves, Hugo Pitorro, Vlad Niculae, Edoardo Ponti, Lei Li, Andre Martins, Marcos Treviso

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 ADASPLASH-2 的新技术,它的目标是让大型人工智能模型(比如现在的聊天机器人)在处理超长文本时变得更快、更聪明。

为了让你轻松理解,我们可以把训练 AI 模型想象成在一个巨大的图书馆里找书

1. 以前的痛点:笨重的“全量搜索”

传统的 AI 模型(基于 Softmax 注意力机制)在读取一篇文章时,就像是一个极其勤奋但有点死板的图书管理员

  • 做法:不管文章有多长,管理员都要把每一个字和文章里的所有其他字都比对一遍,看看它们之间有没有关系。
  • 问题:如果文章只有 100 个字,这还好办。但如果文章有 10 万字(长上下文),管理员就要做 10 万 x 10 万 = 100 亿次比对!这就像让管理员把图书馆里每一本书都拿出来和每一本其他书比一遍,速度慢得让人抓狂,而且非常耗电

2. 聪明的尝试:α-entmax(稀疏注意力)

为了解决这个问题,科学家们发明了一种叫 α-entmax 的新方法。

  • 做法:它像是一个聪明的图书管理员。它知道,并不是每个字都重要。比如在读“今天天气真好”时,“今天”和“天气”关系很紧密,但“今天”和“好”的关系就弱一些。α-entmax 能自动把那些不重要的关系直接设为 0(忽略它们),只关注最重要的部分。
  • 好处:这就叫“稀疏”,意味着管理员只需要检查一小部分书,速度理论上快多了。
  • 新问题:虽然想法很好,但计算“到底哪些字重要”的过程(数学上叫计算归一化常数 τ\tau)非常复杂,就像管理员在决定忽略哪些书之前,得先做一道超级难的数学题。这道题算得太慢,反而抵消了它“少看书”带来的速度优势。

3. ADASPLASH-2 的绝招:直方图“快速预览”

这篇论文提出的 ADASPLASH-2,就是为了解决那个“算得慢”的问题。它用了一个非常巧妙的**“直方图”**(Histogram)技巧。

我们可以用**“快速扫描”**来打比方:

  • 旧方法(慢):管理员要精确地数出每一本书的分数,然后才能决定哪些书该忽略。这需要反复扫描,非常累。
  • ADASPLASH-2 的新方法
    1. 快速分桶(直方图):管理员不再精确数每一本书,而是把书快速扔进几个大箱子里(比如:分数 0-10 的放箱子 A,10-20 的放箱子 B...)。这个动作非常快,而且是在电脑芯片内部的高速缓存(SRAM)里完成的,就像在桌面上直接整理,不用跑回仓库。
    2. 精准定位:通过这几个箱子里的粗略统计,管理员能立刻猜出“大概哪些分数段的书是重要的”。这个猜测非常准,就像你看到箱子里大部分书都在高分区,你就知道不用去低分区找书了。
    3. 只需微调:有了这个粗略的猜测,管理员只需要再做1 到 2 次极小的调整,就能得到完美的结果。

比喻总结
以前的方法是**“逐字精读,反复核对”
ADASPLASH-2 的方法是
“先扫一眼目录(直方图),快速锁定重点,再精读那几页”**。

4. 它带来了什么改变?

  • 速度飞起:在文章很长、需要忽略大量无关信息(高稀疏度)的情况下,ADASPLASH-2 比目前最先进的 FlashAttention-2 还要快,甚至能快2 倍
  • 更懂长文:因为它能高效地忽略无关信息,模型在处理长篇小说、长篇法律文档或复杂代码时,表现更好,不容易“迷路”或“遗忘”前面的内容。
  • 不牺牲质量:实验证明,用这种方法训练的模型,在短文章和长文章的任务中,回答问题的准确度都跟传统方法一样好,甚至更好。

一句话总结

ADASPLASH-2 就像给 AI 装上了一副“智能眼镜”,让它在看长文章时,能瞬间过滤掉无关的废话,只聚焦在关键信息上,而且计算过程极其高效,让 AI 读长文不再“卡顿”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →