← 最新论文
💬 NLP

Long Context Pre-Training with Lighthouse Attention

本文介绍了灯塔注意力,这是一种仅用于训练、无需梯度的分层选择算法,它封装了标准的缩放点积注意力,以支持在极端序列长度下对因果Transformer进行高效的次二次方预训练,并可通过一个简短的恢复阶段无缝移除,从而得到一个具有更快训练速度和更低最终损失的全注意力模型。

原作者: Bowen Peng, Subho Ghosh, Jeffrey Quesnelle

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Bowen Peng, Subho Ghosh, Jeffrey Quesnelle

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你试图一次性阅读一个庞大的图书馆(即一段非常长的文本)来理解一个故事。在人工智能领域,这被称为“长上下文训练”。

问题在于,标准人工智能模型(Transformer)试图将每一个单词与所有其他单词进行比对,以寻找关联。如果你有 10 万个单词,模型就必须进行 100 亿次比对。这就像试图通过在图书馆里同时向每个单词大喊每一个单词来寻找特定句子一样。这需要耗费漫长时间,产生巨额电费,并且会导致计算机内存耗尽。

本文介绍了一种名为**灯塔注意力(Lighthouse Attention)**的新方法来解决这一问题。以下是其工作原理,使用了简单的类比:

1. 问题:“全知之眼”过于沉重

标准人工智能的注意力机制就像一名保安,坚持要同时盯着体育场里的每一个人,以查看谁在和谁交谈。随着体育场变得越来越大,这名保安会不堪重负。

2. 解决方案:“灯塔”策略

灯塔注意力不像全分辨率地审视一切,而是像灯塔扫描黑暗的海洋。它并非忽略海洋,只是分层扫描,以快速找到最重要的部分。

以下是论文描述的三步流程:

步骤 A:“金字塔”(对人群进行总结)

想象你有一大群人(即文本)。与其观察每一张脸,不如将他们分成小组(如家庭或团队)。

  • 技巧:论文在此处做了一个独特的处理。大多数其他方法仅总结“被谈论的人”(即键和值),而将“正在说话的人”(即查询)保留在高细节中。
  • 灯塔的做法:它平等地总结所有人。它构建了一个总结金字塔:
    • 第 0 层:每一个单词。
    • 第 1 层:每 4 个单词被总结为一个。
    • 第 2 层:每 16 个单词被总结为一个。
    • 依此类推。
      这创建了一个从“超级详细”到“宏观概览”的多层级文本地图。

步骤 B:“聚光灯”(挑选最佳部分)

现在,模型需要决定金字塔中的哪些部分重要到值得全细节阅读。

  • 选择:它使用一条简单、免费且无需额外学习的规则来给每个小组打分。它会问:“哪些小组拥有最多的‘能量’或重要性?”
  • 裁剪:它从金字塔的所有层级中挑选出最重要的前 KK 个小组。
  • 结果:模型不再需要阅读 10 万个单词,而只需阅读一个微小、密集的、最重要的“块”列表(可能约为 5,000 个单词)。

步骤 C:“闪光”(阅读选定的部分)

一旦模型挑选出前 5,000 个单词,它就会将它们输入标准的、超高速的"FlashAttention"引擎。由于列表现在变短了,这一步极其迅速,并且可以轻松适应计算机内存。

3.“魔法”恢复(两阶段训练)

这是本文最关键的部分。作者曾担心:“如果我们训练人工智能只查看摘要,它以后是否会忘记如何阅读完整句子?”

为了解决这个问题,他们采用了一种两阶段训练配方

  1. 阶段 1(灯塔阶段):在大部分训练时间里,他们使用灯塔方法训练模型。模型学会变得高效并挑选正确的重点。
  2. 阶段 2(恢复阶段):在最后的少量训练时间里,他们关闭“总结”和“挑选”部分。他们强制模型使用标准方法再次阅读完整文本。

结果:模型从高效训练中“苏醒”过来,并完美地记住了如何使用完整注意力。论文声称,经过这段短暂的恢复后,模型的表现与那些全程都在完整文本上训练的模型一样好(甚至更好),但它到达这一状态的速度更快、成本更低。

为什么这很重要?

  • 速度:论文表明,对于非常长的文本(如 10 万 + 单词),该方法比标准方法快 17 到 21 倍
  • 无“垃圾”代码:与其他需要构建定制、复杂的计算机芯片(内核)来处理“挑选”过程的方法不同,灯塔注意力在实际阅读时使用标准的、现成的计算机部件。它只是在移交数据之前重新排列了数据。
  • 对称性:它平等地对待句子中的“问题”和“答案”部分,这使得数学计算更清晰、更稳定。

总结

灯塔注意力就像雇佣了一位聪明的研究助理。与其逐字阅读报告的 1,000 页,这位助理会快速扫描整份文件,高亮显示最重要的 50 个段落,然后深入详细地阅读这 50 个段落。

论文证明,如果你以这种方式训练人工智能,并在最后给它一个快速阅读整体的“复习课程”,它就会变成一个超级快速的阅读者,且不会损失任何智能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →