Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents
Vortexは、Pythonを組み込んだフロントエンドと効率的なバックエンドを組み合わせたシステムであり、スパースアテンションアルゴリズムの迅速なプロトタイピングとデプロイを可能にし、AIエージェントがフルアテンションよりも最大3.46倍高いスループットを実現する設計を自動的に発見し、これらの利点を新たな大規模アーキテクチャへと拡張することを可能にします。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、巨大な図書館(大規模言語モデル、またはLLM)を運営している司書だと想像してください。司書(AI)は、一語ずつ物語を書いていかなければなりません。
新しい単語を書くたびに、司書はそれまでに書いたすべての内容を振り返り、新しい単語がそれに適合するかどうかを確認する必要があります。従来の図書館では、司書はすべての棚を歩き回り、すべての本をチェックし、すべての文章を読み直さなければなりません。物語が長くなる(数千語に及ぶ)につれ、この「歩いて確認する」作業は非常に遅く、消耗するものになります。これが**フル・アテンション(Full Attention)**の問題です。
**スパース・アテンション(Sparse Attention)**は、司書に賢いショートカットを与えるようなものです。「直近の5ページと、最初の方にある最も重要な3つの章だけを見なさい」という指示です。これにより、膨大な時間が節約されます。しかし、これらのショートカットを構築することは、現在エンジニアにとって悪夢のような作業です。新しいショートカットのアイデアを試そうとするたびに、専用の高速列車 tracks(線路)をゼロから作り直さなければならず、それには数週間かかることもあります。
ここに、Vortexが登場します。
Vortexは、これらのショートカットのための**「ユニバーサルな線路建設機」**として機能する新しいシステムです。以下に、簡単な比喩を用いてその仕組みを説明します。
1. 問題点:「ページ化された」図書館
現代の図書館では、本を一つの長い連続した列として保管しているわけではありません。スペースを節約するために、本はバラバラで連続していない箱(Paged Attentionと呼ばれます)の中に保管されています。
- 従来の方法: もしコンピュータに「散らばった特定の箱を見ろ」と命じたい場合、それぞれの箱を見つけ出し、掴み取り、順番に並べるための複雑で低レベルなコードを書かなければなりませんでした。それは、ロボットに対して「ビーチにある特定の砂粒を、一つずつ掘り起こして見つけろ」と頼むようなものでした。
- Vortexの方法: Vortexは、vTensorと呼ばれる新しい考え方を導入しています。これは司書に「魔法の地図」を与えるものです。箱が物理的にどこに位置しているかを知る必要はありません。ただ、「最も関連性の高い上位5つの箱が欲しい」と言うだけで、魔法の地図が散らばったストレージの中からそれらを見つけ出すという、面倒な詳細処理をすべて処理してくれます。
2. 言語:vFlow(「レシピ本」)
Vortexには、vFlowと呼ばれるプログラミング言語が備わっています。
- 比喩: あなたがシェフだと想像してください。コンピュータに「ニンジンをどうやって刻むか」という詳細なコードを書く代わりに、単にレシピを書くだけです。「ニンジンを取り、刻み、玉ねぎと混ぜる」。
- どのように役立つか: 研究者(あるいはAIエージェント)は、新しいタイプのショートカット(スパース・アテンション・アルゴリズム)を、わずか数行のコードで「レシピ」として記述できます。彼らは、扱いにくいハードウェアの詳細に精通している必要はありません。単に「何をしたいか」を記述すれば、Vortexがそれを効率的に行う「方法」を導き出します。
3. AIエージェント:「自律的な発明家」
これが最もエキサイティングな部分です。論文では、Vortexがあまりにも使いやすいため、AIエージェント(人間のように振る舞うよう設計されたコンピュータプログラム)が、自ら新しいショートカットを発明できることが示されています。
- 実験: 研究者たちはAIエージェントに対し、「司書のスピードを上げるための20個の新しい方法を発明せよ」と命じました。
- 結果: AIエージェントは単に古いアイデアを模倣したのではなく、全く新しい、多様なレシピを作り出しました。AIが生成したショートカットの一つは、物語の正確性を損なうことなく、標準的な手法よりも司書を3.46倍速くしました。
- ループ: AIは18時間にわたって、レシピを試し、失敗し、微調整するというプロセスを繰り返しました。最終的に、人間が見逃していたかもしれない、スピードと正確性の完璧なバランスを見つけ出したのです。
4. 結果:未来を加速させる
Vortexは小さなモデルだけでなく、世界で最も大きく複雑なライブラリでも動作します。
- 大規模モデル: チームは、2290億のパラメータを持つ巨大なモデル(MiniMax-M2.7)を用い、スーパーコンピュータのチップ(NVIDIA B200)上でVortexをテストしました。そこでも、Vortexのショートカットはシステムを1.37倍高速化させました。
- 新しいアーキテクチャ: 彼らはまた、MLA(DeepSeekやGLMで使用されている)と呼ばれる新しいタイプのライブラリ設計についても使用しました。vFlowを用いてカスタムショートカットを設計したところ、4.7倍の高速化を実現しました。
まとめ
Vortexを、「翻訳者」と「建設作業員」が一つになったものと考えてください。
- 複雑で煩雑なハードウェアのルールを、シンプルで読みやすい「レシピ」へと翻訳します。
- 人間やAIエージェントが、長いテキストを読むための新しい「ショートカット」を迅速に発明、テスト、展開することを可能にします。
- かつては数ヶ月を要したエンジニアリングプロジェクトを、わずか数時間の作業へと変え、AIの知能を損なうことなく、より高速にAIモデルを動かす方法を見つけ出します。
論文によれば、実験を容易にすることで、VortexはすでにAIエージェントが現在プロダクション環境で使用されているものよりも大幅に高速なアルゴリズムを発見するのを助けており、新しいハードウェアを待つことなく、AIをより速く、より効率的にできることを証明しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。