Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents
Vortex 是一个结合了 Python 嵌入式前端与高效后端的系统,旨在实现稀疏注意力算法的快速原型设计与部署,使 AI 智能体能够自动发现设计,从而实现比全注意力机制高出达 3.46 倍的吞吐量,并将这些增益扩展到新兴的大规模架构中。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在经营一座巨大的图书馆(即大语言模型,LLM),一位图书管理员(AI)必须一次写一个词,写出一个非常长的故事。
每当图书管理员写下一个新词时,他们都必须回顾之前写过的所有内容,以确保新词能够衔接得上。在传统的图书馆里,图书管理员必须走遍每一排书架,检查每一本书,并阅读每一个句子,才能找到相关的部分。随着故事变得越来越长(数千个词),这种“行走与检查”的过程会变得极其缓慢且令人精疲力竭。这就是**全注意力机制(Full Attention)**的问题。
**稀疏注意力机制(Sparse Attention)**就像是给了图书管理员一个聪明的捷径:“只看最后 5 页以及开头最重要的 3 个章节。”这节省了大量时间。然而,构建这些捷径目前是工程师们的噩梦。这就像是你每产生一个新的捷径想法,都必须重新建造一整条定制的高速火车轨道。如果你想测试一个新想法,你必须从头开始重建整个轨道,这需要耗费数周时间。
Vortex 正是为此而生。
Vortex 是一个全新的系统,它充当了这些捷径的**“通用火车轨道建造者”**。以下是它的工作原理,我们使用简单的类比来解释:
1. 问题所在:“分页式”图书馆
现代图书馆并不将书籍存储在一条连续的长行中。为了节省空间,它们将书籍存储在分散、不连续的箱子中(称为分页注意力机制/Paged Attention)。
- 旧方法: 如果你想告诉计算机“查看特定的分散箱子”,你必须编写复杂的底层代码来寻找每个箱子、取出它们并按顺序排列。这就像是要求机器人通过一个一个挖掘的方式,去寻找沙滩上特定的沙粒。
- Vortex 的方式: Vortex 引入了一种全新的思维方式,称为 vTensor。它给了图书管理员一张“魔法地图”。你不需要知道箱子在物理上的具体位置,你只需要说:“我想要前 5 个最相关的箱子,”魔法地图就会处理好在分散存储中寻找这些箱子的复杂细节。
2. 语言:vFlow(“食谱书”)
Vortex 配有一种名为 vFlow 的编程语言。
- 类比: 想象你是一名厨师。你不需要编写代码来告诉计算机如何切每一根胡萝卜,你只需要写一个食谱:“取胡萝卜,切碎,然后与洋葱混合。”
- 它如何提供帮助: 研究人员(甚至是 AI Agent)可以用短短几行代码来编写新类型捷径(稀疏注意力算法)的“食谱”。他们不需要成为精通复杂硬件细节的专家。他们只需描述他们想要做什么,Vortex 就会搞定如何高效地实现它。
3. AI Agent: “自主发明家”
这是最令人兴奋的部分。论文显示,Vortex 如此易于使用,以至于 AI Agent(旨在像人类一样行动的计算机程序)也可以利用它来发明新的捷径。
- 实验: 研究人员要求 AI Agent “发明 20 种加速图书管理员的方法”。
- 结果: AI Agent 不仅仅是在模仿旧的想法;它们创造了全新的、多样化的食谱。其中一个由 AI 生成的捷径让图书管理员的速度提升了 3.46 倍,且没有损失任何故事的准确性。
- 循环: AI 在 18 小时内不断尝试、失败并调整其食谱。它最终找到了一个人类可能会错过的、在速度与准确性之间的完美平衡点。
4. 结果:加速未来
Vortex 不仅仅适用于小型模型;它也能在世界上最庞大、最复杂的图书馆上运行。
- 大型模型: 团队在拥有 2290 亿参数的超大规模模型(MiniMax-M2.7)以及超级计算机芯片(NVIDIA B200)上测试了 Vortex。即使在这种规模下,Vortex 的捷径也让系统提速了 1.37 倍。
- 新架构: 他们还将它用于一种新型的图书馆设计——MLA(被 DeepSeek 和 GLM 等模型使用)。他们使用 vFlow 设计了一个定制的捷径,并实现了 4.7 倍的加速。
总结
把 Vortex 看作是一个集翻译官和施工队于一身的角色。
- 它将复杂、混乱的硬件规则转化为简单、易读的食谱。
- 它允许人类和 AI Agent 快速发明、测试并部署用于阅读长文本的新型“捷径”。
- 它将过去长达数月的工程项目缩短为几个小时,使我们能够找到更快的方式来运行 AI 模型,而不必牺牲其智能水平。
论文声称,通过让实验变得容易,Vortex 已经帮助 AI Agent 发现了比目前生产环境中使用的算法更快的算法,这证明了我们可以在无需等待新硬件的情况下,让 AI 变得更快、更高效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。