← 最新论文
🤖 AI

Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents

Vortex 是一个结合了 Python 嵌入式前端与高效后端的系统,旨在实现稀疏注意力算法的快速原型设计与部署,使 AI 智能体能够自动发现设计,从而实现比全注意力机制高出达 3.46 倍的吞吐量,并将这些增益扩展到新兴的大规模架构中。

原作者: Zhuoming Chen, Xinrui Zhong, Qilong Feng, Ranajoy Sadhukhan, Yang Zhou, Michael Qizhe Shieh, Zhihao Jia, Beidi Chen

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhuoming Chen, Xinrui Zhong, Qilong Feng, Ranajoy Sadhukhan, Yang Zhou, Michael Qizhe Shieh, Zhihao Jia, Beidi Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在经营一座巨大的图书馆(即大语言模型,LLM),一位图书管理员(AI)必须一次写一个词,写出一个非常长的故事。

每当图书管理员写下一个新词时,他们都必须回顾之前写过的所有内容,以确保新词能够衔接得上。在传统的图书馆里,图书管理员必须走遍每一排书架,检查每一本书,并阅读每一个句子,才能找到相关的部分。随着故事变得越来越长(数千个词),这种“行走与检查”的过程会变得极其缓慢且令人精疲力竭。这就是**全注意力机制(Full Attention)**的问题。

**稀疏注意力机制(Sparse Attention)**就像是给了图书管理员一个聪明的捷径:“只看最后 5 页以及开头最重要的 3 个章节。”这节省了大量时间。然而,构建这些捷径目前是工程师们的噩梦。这就像是你每产生一个新的捷径想法,都必须重新建造一整条定制的高速火车轨道。如果你想测试一个新想法,你必须从头开始重建整个轨道,这需要耗费数周时间。

Vortex 正是为此而生。

Vortex 是一个全新的系统,它充当了这些捷径的**“通用火车轨道建造者”**。以下是它的工作原理,我们使用简单的类比来解释:

1. 问题所在:“分页式”图书馆

现代图书馆并不将书籍存储在一条连续的长行中。为了节省空间,它们将书籍存储在分散、不连续的箱子中(称为分页注意力机制/Paged Attention)。

  • 旧方法: 如果你想告诉计算机“查看特定的分散箱子”,你必须编写复杂的底层代码来寻找每个箱子、取出它们并按顺序排列。这就像是要求机器人通过一个一个挖掘的方式,去寻找沙滩上特定的沙粒。
  • Vortex 的方式: Vortex 引入了一种全新的思维方式,称为 vTensor。它给了图书管理员一张“魔法地图”。你不需要知道箱子在物理上的具体位置,你只需要说:“我想要前 5 个最相关的箱子,”魔法地图就会处理好在分散存储中寻找这些箱子的复杂细节。

2. 语言:vFlow(“食谱书”)

Vortex 配有一种名为 vFlow 的编程语言。

  • 类比: 想象你是一名厨师。你不需要编写代码来告诉计算机如何切每一根胡萝卜,你只需要写一个食谱:“取胡萝卜,切碎,然后与洋葱混合。”
  • 它如何提供帮助: 研究人员(甚至是 AI Agent)可以用短短几行代码来编写新类型捷径(稀疏注意力算法)的“食谱”。他们不需要成为精通复杂硬件细节的专家。他们只需描述他们想要做什么,Vortex 就会搞定如何高效地实现它

3. AI Agent: “自主发明家”

这是最令人兴奋的部分。论文显示,Vortex 如此易于使用,以至于 AI Agent(旨在像人类一样行动的计算机程序)也可以利用它来发明新的捷径。

  • 实验: 研究人员要求 AI Agent “发明 20 种加速图书管理员的方法”。
  • 结果: AI Agent 不仅仅是在模仿旧的想法;它们创造了全新的、多样化的食谱。其中一个由 AI 生成的捷径让图书管理员的速度提升了 3.46 倍,且没有损失任何故事的准确性。
  • 循环: AI 在 18 小时内不断尝试、失败并调整其食谱。它最终找到了一个人类可能会错过的、在速度与准确性之间的完美平衡点。

4. 结果:加速未来

Vortex 不仅仅适用于小型模型;它也能在世界上最庞大、最复杂的图书馆上运行。

  • 大型模型: 团队在拥有 2290 亿参数的超大规模模型(MiniMax-M2.7)以及超级计算机芯片(NVIDIA B200)上测试了 Vortex。即使在这种规模下,Vortex 的捷径也让系统提速了 1.37 倍
  • 新架构: 他们还将它用于一种新型的图书馆设计——MLA(被 DeepSeek 和 GLM 等模型使用)。他们使用 vFlow 设计了一个定制的捷径,并实现了 4.7 倍的加速

总结

Vortex 看作是一个集翻译官和施工队于一身的角色。

  1. 它将复杂、混乱的硬件规则转化为简单、易读的食谱。
  2. 它允许人类和 AI Agent 快速发明、测试并部署用于阅读长文本的新型“捷径”。
  3. 它将过去长达数月的工程项目缩短为几个小时,使我们能够找到更快的方式来运行 AI 模型,而不必牺牲其智能水平。

论文声称,通过让实验变得容易,Vortex 已经帮助 AI Agent 发现了比目前生产环境中使用的算法更快的算法,这证明了我们可以在无需等待新硬件的情况下,让 AI 变得更快、更高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →