← 最新の論文
💻 computer science

FlashAttention for Scalable Vector Architectures

本論文は、インターヘッド・パラレリズムと効率的なメモリアクセスを活用することで、CPU上でのTransformer推論を大幅に加速させる、スケーラブルなベクトルアーキテクチャ向けに最適化されたブロック化FlashAttentionであるFlashAttention-Vを紹介し、プリフィルで最大42倍、デコードで11倍の高速化を実現すると同時に、長ベクトル実行における現在の量子化フォーマットの構造的なボトルネックを浮き彫りにしている。

原著者: Sonia Rani Gupta, Nikela Papadopoulou, Miquel Pericàs

公開日 2026-08-20
📖 1 分で読めます☕ さくっと読める

原著者: Sonia Rani Gupta, Nikela Papadopoulou, Miquel Pericàs

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

メールの草案を作成するチャットボットから、ソフトウェアのデバッグを行うコーディングアシスタントに至るまで、現代の人工知能システムは「トランスフォーマー」と呼ばれる特定の種類のコンピュータプログラムに依存しています。これらのプログラムは、文の中で単語が互いにどのように関連しているかを見ることで、言語を理解するように構築されています。これを行うために、彼らは「アテンション(注意)」と呼ばれるメカニメントを使用しており、これはスポットライトのように機能し、システムがテキストの残りの部分を無視しながら、最も関連性の高い部分に焦点を合わせることを可能にします。これらのシステムは、強力なグラフィックスカードを備えた大規模なデータセンターで実行されることが多いですが、ノートパソコンやタブレット、さらにはモノのインターネット(IoT)に見られるような専用のマイクロチップといった、より身近な日常的なデバイスで実行する必要性が高まっています。これらの小型デバイスは、多くの場合、データを長い列として処理することで一度に多くの計算を行うように設計された、ベクトルアーキテクチャとして知られる異なる種類のプロセッサを使用しています。しかし、大きな障害が生じています。アテンション・メカニズムは非常にメモリを貪欲に消費するため、プロセッサが大量のデータを絶えず読み込み、保存することを要求し、それが動作を遅らせるのです。

チャルマーズ工科大学とグラスゴー大学の研究者たちは、これらのベクトルプロセッサ上でアテンション・メカニズムがどのように機能するかを再設計することで、この問題に取り組みました。彼らは「FlashAttention-V」と呼ばれる新しい手法を開発しました。これは、プロセッサの独特な形状に合わせて、コンピュータが作業をどのように整理するかを変更するものです。プロセッサに一度に一つの小さなデータ片を扱わせようとする代わりに、この新手法は、複数の独立した計算を一つの幅の広いデータの列へとグループ化します。これは、作業員が通常は一度に一つのアイテムを扱う工場の組立ラインを想像してみてください。この新しいアプローチでは、作業員がトレイごとまとめて掴み、一度にすべてを処理することを可能にし、保管棚へ何度も往復する時間を劇的に削減します。操作の順序を並べ替え、データをより密に詰め込むことで、研究者たちは、特に短いテキストを扱う場合や、デバイスが一つずつ新しい言葉を生成している場合に、これらの小型デバイスを大幅に高速化できることを見出しました。

チームは、TinyLlama、Llama 3.2、Qwen2.5を含むいくつかの言語モデルを用いて、実機ハードウェアと詳細なコンピュータシミュレーションの両方で彼らの新しいアプローチをテストしました。RISC-Vプロセッサを使用するBanana Pi BPI-F3という物理的な開発ボードにおいて、この新手法は劇的な改善を示しました。デバイスが短い入力を読み取る準備をしている際、この新しいアプローチは、標準的な最適化されていないバージョンよりも12倍から14倍高速でした。デバイスが単語ごとにテキストを生成しているときには、4倍から5倍高速でした。また、研究者たちは、プロセッサがより大きな情報の塊を一度に扱えるほど、より広いデータラインを備えている場合に、その手法がどのように機能するかを確認するために、広範なシミュレーションを実施しました。これらのシミュレーションは、データラインが広くなるにつれて、速度の向上も継続し、入力準備のベストケースにおいては基本バージョンよりも最大42倍高速になることを示しました。

しかし、この研究は、これらのデバイスがどれほど速くなれるかには明確な限界があることも明らかにしました。研究者たちは、アテンションの部分のプログラムはこれらのより広いデータラインから大きな恩恵を受ける一方で、他の部分、具体的には数値を予測に変換するレイヤーはそうではないことを発見しました。これらのレイヤーは、スペースを節約するためにデータを圧縮する「量子化」と呼ばれる特定の数値保存方法を使用しています。現在このデータが詰められている方法は、構造的な不一致を生んでおり、プロセッサに数値を分離・再結合するための余分で非効率な作業を強いています。シミュレーションによれば、これらの特定のレイヤーにおいて、一度に多くのデータを処理することで節約された時間は、それを並べ替えるために費やされる時間によって完全に相殺されてしまいました。これは、アテンション・メカニズムは驚異的に高速化できる一方で、システム全体の速度は現在、これらの他のコンポーネントによって引き下げられていることを意味しており、将来の改善には、単にどのように処理するかだけでなく、どのようにこれらの数値を保存するかを変える必要があることを示唆しています。

これらの知見は、人工知能を日常的なデバイスでより身近なものにするための明確な道筋を提示しています。新しい手法であるFlashAttention-Vは、現代の言語モデルの設計と、スケーラブルなベクトルプロセッサの能力との間の溝をうまく埋めることに成功しました。これは、コンピュータがタスクを考える方法を単に並べ替え、データをより効率的に詰め込むだけで、新しいハードウェアを必要とせずに大幅なパフォーマンス向上が可能であることを証明しています。研究は、短時間のタスクやリアルタイムのテキスト生成において、これらの最適化されたプロセッサが非常に効果的であることを裏付けています。しかし同時に、これらのデバイスのための現在のデータ圧縮方法が壁に突き当たっている可能性があるという警告でもあります。将来の、より広いプロセッサの全ポテンシャルを解き放つことは、おそらく、これらの圧縮された数値をよりインテリジェントに保存し、移動する方法というパズルを解くことにかかっています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →