← 最新论文
💬 NLP

CoSA: Accelerating Long-Context Inference via Proxy-Kernel Co-Designed Sparse Attention

CoSA 是一个无需训练的两阶段稀疏注意力框架,它通过将核感知代理(Kernel-Aware Proxy)与有序跳过核(Ordered-Skipping Kernel)相结合,动态优化块的选择与跳过,从而在紧凑的计算预算下,为长上下文大语言模型实现显著的推理加速并降低延迟,同时保持高精度。

原作者: Yufei Xue, Lin Niu, Hong Liu, Siran Liu, Hanyong Shao, Wei Liu, Guanghua Yu, Jianchen Zhu, Jun Zhang

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yufei Xue, Lin Niu, Hong Liu, Siran Liu, Hanyong Shao, Wei Liu, Guanghua Yu, Jianchen Zhu, Jun Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过阅读一本长达 128,000 页的巨型百科全书来回答一个问题。在人工智能的世界里,这些“百科全书”被称为大语言模型(LLM),而这种“阅读”过程则是它们理解上下文的方式。问题在于,这些模型的标准阅读方式就像一个坚持要从第一页第一个字读到最后一页最后一个字的图书管理员,在他们开始思考你的问题之前,必须把整本书读完。随着书本变得越来越厚,这种“全读”的方法会变得极其缓慢且昂贵,就像背着一包砖头去跑马拉松一样。

为了解决这个问题,科学家们尝试教导图书管理员变得更有选择性,这种技术被称为“稀疏注意力”(sparse attention)。与其阅读每一页,模型会尝试猜测哪些页面是重要的,并跳过其余部分。通常,这涉及两个步骤:首先,一个快速的“代理”(即快速猜测者)查看书籍,并用一个简单的“是/否”列表标记出重要的页面。第二步,一个“内核”(即实际的执行者)根据该列表进行繁重的体力活。这是一个还算不错的系统,但它有一个缺陷:当书籍变得巨大,且你需要通过严格限制跳过的页面来节省时间时,那个快速猜测者就会开始出错,而执行者只会盲目地遵循那份错误的名单。结果就是,模型变快了,却开始遗忘重要的细节,就像一个图书管理员因为觉得某个章节无聊就跳过了故事的高潮部分。

这正是名为 CoSA(协同设计稀疏注意力,Co-Designed Sparse Attention)的新方法发挥作用的地方。CoSA 背后的研究人员意识到,原本的“猜测者”和“执行者”是在孤立工作的,这导致系统在压力下崩溃。他们决定重新设计整个过程,让两者作为一个团队协作。新方法不再只是交给执行者一份简单的“是/否”列表,而是让新的“猜测者”(称为内核感知代理,简称 KAP)递交一份优先级列表。它不只是说“读这一页”;它会说:“先读这一页,然后是这一页,接着是那一页。”

这就是其中的魔术技巧:执行者(称为有序跳跃内核,简称 OSK)利用这份优先级列表来重新排列它阅读页面的顺序。通过先阅读最关键的页面,执行者能在过程的早期阶段就建立起一个关于“什么重要”的“运行评分”。因为它很早就掌握了最重要的信息,所以它可以在后续过程中更自信地跳过更多的页面,而不会感到困惑。这就像你在读一本推理小说,侦探告诉你:“先读前三章来寻找凶手,然后你就可以放心地跳过接下来的五十章园艺心得。”

论文显示,这种团队协作的方法带来了颠覆性的变化。在测试模型阅读长达 128,000 个 token(大约相当于一部长篇小说)的上下文时,CoSA 将“注意力”部分的处理速度提升了 4.93 倍,并将生成第一个词所需的时间缩短了 2.53 倍。至关重要的是,它在做这些的同时,并没有让模型丧失理解故事或解决复杂推理问题的能力。研究人员发现,通过让代理和内核相互交流并共享特定的操作顺序,他们可以更激进地跳过工作,同时仍保持模型的聪明才智。事实证明,在人工智能的世界里,知道“何时”阅读一页与知道“阅读哪一页”同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →