← 最新论文
💻 computer science

Long-Context Modeling with Dynamic Hierarchical Sparse Attention for Memory-Constrained LLM Inference

本文提出了动态分层稀疏注意力(DHSA),这是一种数据驱动框架,通过分层路由在线预测注意力稀疏性,从而在有限硬件上实现内存高效的长上下文大语言模型推理,同时保持接近稠密方法的精度,并相较于现有稀疏方法获得显著加速。

原作者: Siheng Xiong, Joe Zou, Faramarz Fekri, Yae Jee Cho

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Siheng Xiong, Joe Zou, Faramarz Fekri, Yae Jee Cho

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图阅读一本庞大的百科全书,以查找一个特定的事实,比如“秘鲁的首都是什么?”在标准的语言模型(LLM)中,计算机就像一位非常详尽但缓慢的图书管理员。为了回答你的问题,这位图书管理员会阅读百科全书的每一页,将其与你的问题进行比对,然后决定如何作答。

如果这本百科全书有 10 万页,那么图书管理员每回答一个问题都需要完成海量的工作。这不仅昂贵、缓慢,而且经常会导致计算机内存崩溃(就像试图一次性抱住 10 万本书)。

本文介绍了一种名为DHSA(动态分层稀疏注意力)的新方法。这相当于将那位图书管理员升级为一位聪明且自适应的侦探,他确切地知道应该跳过哪些页面。

以下是其工作原理,分解为简单的概念:

1. 问题:“二次方”瓶颈

本文指出,当前的人工智能模型遭受“二次方成本”的困扰。这意味着,如果你将文本长度加倍,计算机需要完成的工作量并不会仅仅加倍,而是会翻四倍。

  • 类比:想象一下试图在人群中寻找一位朋友。如果有 10 个人,你只需查看 10 张脸。如果有 100 个人,你不仅仅要看 100 张脸;你必须查看每一个人,并将他们与彼此进行比对,以看清谁在跟谁说话。这种情况很快就会变得混乱且缓慢。

2. 旧方案:“僵硬的网格”

过去试图解决这一问题的方法是使用静态稀疏注意力

  • 类比:想象图书管理员决定只阅读每第 10 页,或者无论故事内容如何,只阅读每一章的第一页和最后一页。
  • 缺陷:这就像使用饼干模具。有时重要的信息恰恰就在你切掉的地方!如果“针”(即答案)位于你决定跳过的书页部分,你就会失败。本文表明,当文本变得非常长时,这些僵化的方法往往会遗漏重要细节。

3. 新方案:DHSA(聪明的侦探)

DHSA 之所以不同,是因为它是动态分层的。它不使用固定的规则;而是先“阅读”文本,以决定什么是重要的。

步骤 A:“分块”侦探(动态边界)

DHSA 不是将书籍切成等大小的切片(例如每片 10 页),而是查看内容

  • 类比:想象文本是一部电影。僵化的方法会将电影切成 10 分钟的片段,即使场景转换发生在第 9 分钟。DHSA 足够聪明,能够看到场景转换,并在故事转折的确切位置切断电影。它将属于一起的句子(如一个段落或一段代码块)分组为“块”。
  • 工作原理:它使用一个小型、轻量级的辅助工具来扫描文本,并指出:“好的,这句话结束了一个想法,而新的一句开始了不同的话题。”它在那里画了一条线。

步骤 B:“摘要”策略(分层路由)

一旦文本被分组为这些智能块,模型还不会查看块内的每一个单词。

  • 类比:想象你有 50 章。与其阅读每一章的每一个字,侦探首先会阅读章节摘要。它会问:“哪 5 章最有可能包含答案?”
  • 过程
    1. 它为每个块创建一个“摘要”。
    2. 它将你的问题与这些摘要进行比对。
    3. 它挑选出看似最相关的几个“摘要”块。
    4. 只有在此之后,它才会回过头来,阅读那些选定块中的具体单词。

4. 为什么这很重要

本文声称,这种方法解决了三个主要问题:

  • 节省内存:因为模型只关注文本的一小部分(约 6% 到 12% 的单词),所以它可以将巨大的书籍(多达 10 万个单词)放入单个标准计算机显卡(如游戏显卡)中。如果没有这种方法,计算机就会因内存不足而崩溃。
  • 速度快:通过跳过不相关的部分,模型回答问题要快得多。本文显示,在处理非常长的文本时,其速度比旧方法快10 倍
  • 准确:与那些如果答案位置不对就会遗漏答案的“僵硬网格”方法不同,这位聪明的侦探几乎能像通读全书一样找到“大海捞针”。在测试中,它的准确率显著高于其他“跳过”方法。

总结

本文提出了一种方法,使人工智能模型无需超级计算机即可处理海量文本。DHSA不像旧方法那样盲目地阅读所有内容,或使用僵化的、一刀切的跳过规则,而是像一位聪明的编辑。它首先识别文本中自然的“段落”,然后快速扫描“目录”以找到最相关的部分,最后仅深入挖掘那些特定部分。

这使得标准计算机能够阅读和理解像小说或法律合同一样长的文档,且速度快,不会耗尽内存。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →