← 最新の論文
🤖 machine learning

Hardware-Aware FP4 FlashAttention-4

本論文は、非因果的推論にDirect-Pを採用し、FP8勾配を用いた因果パスを用いることで、BlackwellのFP4テンソルコアの限界を克服するハードウェア認識型FP4 FlashAttention-4を紹介しており、MXFP4トレーニングで見られる発散の問題を回避しながら、最大2.13倍の高速なフォワードスループットと1.14倍高速なシングルGPUトレーニング更新を実現している。

原著者: Robert Hu

公開日 2026-09-04✓ Author reviewed
📖 1 分で読めます☕ さくっと読める

原著者: Robert Hu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界において、最も強力なモデルは「アテンション(注意)」と呼ばれるメカニズムに依存して文脈を理解しています。読者が長い文書をスキャンすることを想像してみてください。アテンションによって、モデルは文章内の最も関連性の高い単語に焦와し、それ以外の部分は無視しながら、遠く離れた概念同士を結びつけることができます。これを行うために、コンピュータは、すべての単語を他のすべての単語と比較してそれらの関係性を決定するという、膨大な一連の計算を実行します。長年、これらの計算は、建物を測定するために極めて精密な目盛りが付いた定規を使用するのと同様に、高精度な数値を用いて行われてきました。これにより、モデルが正しく学習することが保証されますが、速度が遅く、膨大なエネルギーを消費します。モデルが大きくなるにつれ、速度の必要性は極めて重要になります。研究者たちは最近、はるかに小さく粗い数値(4ビット浮動小数点値)を使用して、これらの比較をはるかに高速に実行できるチップを開発しました。しかし、単にこれらの小さな数値に切り替えるだけでは不十分です。データの流れを管理するソフトウェアも変更しなければ、速度の恩 خلالが得られなくなります。

Graphcoreの研究者は、「Direct-P」と呼ぶ新しい手法で、この特定のボトルネックに対処しました。彼らの研究は、モデルが情報を処理して答えを生成する「フォワード(順方向)」パスと、モデルが自身の間違いから学ぶ「バックワード(逆方向)」パスに焦点を当てています。研究者は、新しいチップは数値を驚異的な速さで乗算できる一方で、その中間ステップである「生のスコアを確率に変換する工程」がすべてを遅らせていることを発見しました。それは、まるで超高速の組み立てラインがあるのに、作業員が次の部品を渡す前に、一つひとつの部品を丁寧に測定しなければならないために、ラインが何度も止まってしまうようなものでした。研究者は、複雑なスケーリングや丸め処理を含む標準的な変換処理が、新しいハードウェアの速度面の利点を打ち消してしまう「交通渋滞」を引き起こしていることを突き止めました。

これを解決するために、研究者は変換プロセスを直接的かつ合理的なものへと再設計しました。正確な確率を計算してから丸めるのではなく、彼らの手法は、生のスコアをハードウェアが使用する特定のコードに直接マッピングします。これにより、遅延の原因となっていた仲介ステップが排除されます。最新世代のデータセンター向けチップでこのアプローチをテストしたところ、結果は驚くべきものでした。一般的なデータ形状に対して、この新手法は、高精度な数値に依存していた従来の標準的な手法よりも2倍以上速く情報を処理しました。これは、ビデオ生成や言語理解のような複雑なタスクに対して十分な精度を維持しながら達成されました。ビデオ生成モデルを用いたテストでは、新手法は標準的なアプローチよりもほぼ2倍速く、その結果は有限で利用可能なものでありながら、より低速で精密なバージョンと比較すると、測定可能なドリフト(ずれ)や低い類似度を示しました。

しかし、物語はスピードについてだけではありません。モデルが学習しようとする際に何が起こるかについても述べています。研究者は、モデルが知識を更新するバックワードパスを含む、学習プロセス全体にこれらの超高速・低精度な数値を使用できるかどうかを調査しました。その結果、フォワードパスはフルスピードで実行できる一方で、バックワードパスには慎重な妥協が必要であることがわかりました。学習中に確率値に対して最も速い4ビット形式を使用しようとしたところ、学習プロセスが不安定になり、モデルの改善が失敗しました。数値が粗すぎたため、学習信号が崩壊してしまったのです。その結果、研究者は、学習を安定させるためには、計算の他の部分に高速な4ビット形式を使用する場合でも、確率値にはわずかに精度の高い8ビット形式を使用しなければならないと判断しました。このハイブリッドなアプローチにより、強力なシングルチップ上で、学習サイクル全体を約14パーセント高速化することができました。これは大規模なモデルにとって大きな利点です。

研究者はまた、コンピュータチップ自体の物理的な限界についても調査しました。彼らは、計算の速度自体はもはや主要な問題ではなく、チップ内部でデータがいかに保存され、移動されるかが問題であることを発見しました。チップには、作業中に数値を保持するための、非常に高速で小さなメモリ領域があります。研究者は、このメモリ空間が完全に埋まっており、計算の異なるステージをオーバーラップ(重ね合わせ)させる余地がないことを発見しました。それは、まるでキッチンのカウンターが食材で溢れかえっており、たとえ包丁が驚くほど鋭利であっても、現在の野菜を切り終えるまで次の野菜を刻み始めることができないシェフのような状態でした。メモリ空間が占有されていたため、チップは複数のステップを同時に実行できず、それがプロセス全体をどれほど高速化できるかという上限を制限していました。

この研究は、人工知能を高速化する方法に関する考え方の重要な転換を浮き彫りにしています。単に高速な計算機を作るだけでは不十分であり、ハードウェアの能力に合わせてワークフロー全体を再設計しなければなりません。研究者は、確率の計算方法を変更し、データの流れを慎重に管理することで、劇的な速度向上を実現できることを示しました。しかし同時に、明確な限界が存在することも証明しました。チップのメモリ制約により、たとえ最速の数学的演算を用いたとしても、オーバーラップが可能な範囲には天井があります。彼らが示唆する進むべき道は、単なる高速な算術ではなく、チップのリソースが待機状態にならないよう、データを整理するよりスマートな方法を見出すことにあるのです。この生のスピードと慎重なデータ管理のバランスこそが、次世代の人工知能を効率的に動作させる鍵となるでしょう。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →