✨ 要約🔬 技術概要
巨大で複雑なパズルを解こうとしている自分を想像してください。人工知能の世界において、このパズルとは「大規模言語モデル(LLM)」、つまり物語を書き、質問に答え、問題を解決できる超賢いコンピュータの脳です。これらの脳が大きくなり賢くなるにつれて、単一のコンピュータが保持するには重くなりすぎます。
これを解決するため、科学者たちはパズルのピースを、連携して動作する多数のコンピュータ(「ノード」と呼ばれる)に分割しました。この論文は、これらのコンピュータが時間を無駄に待たずに効率的に互いに通信する方法を明らかにし、構築することについて述べています。
以下に、研究者たちが発見し構築したものの簡単な概要を示します。
1. 課題:「電話ゲーム」のボトルネック
コンピュータが連携して動作する際、絶えず情報を共有する必要があります。
設定: パズルを解こうとする 32 人のチーム(GPU)を想像してください。彼らはグループ(ノード)に分かれています。グループ内では、彼らは瞬時に互いに叫ぶことができます(NVLink という超高速の内部ウォーキー・トウキーのようなものを使用)。しかし、他の グループと話すためには、より遅く、長距離の電話回線(ノード間のネットワーク)を使用する必要があります。
問題点: 研究者たちは、コンピュータがパズルの「デコード」部分(1 語ずつ生成する部分)を解こうとする際、互いに非常に小さなメッセージを送信する必要があることを発見しました。
比喩: リレー競争にいると想像してください。次のランナーに小さなメモを渡すために長い距離を走らなければならず、かつメモを受け取る相手がメモの受け取りが遅い場合、あなたの時間の大部分は待機することに費やされます。この論文は、標準的な「電話回線」ソフトウェア(NCCL と呼ばれる)が、異なる建物(ノード)間のこれらの小さく頻繁なメモの処理に極めて不適切であることを発見しました。それは、即座に秘密の握手を渡す必要があるのに、遅い郵便サービスでハガキを送ろうとしているようなものです。
2. 比較:チームを編成する 2 つの方法
研究者たちは、チームを編成する 2 つの主要な方法をテストしました。
テンソル並列化(TP): 全員が同時にパズルの同じ 部分に取り組むが、合意を確認するために常に全員とチェックインする必要があります。これは大きな作業塊には優れていますが、すべてのチェックイン(通信)によって足止めを食らいます。
ハイブリッド並列化(HP): パズルを大きな塊に分割し、異なる塊を異なる人に割り当てます。これによりチェックインの必要性は減りますが、タスクの「1 語ずつ」生成部分には効率的ではありません。
発見: タスクの「1 語ずつ」の部分(これが最も頻繁に発生する部分)については、TP が通常優れていますが、それは チームが互いに十分に速く話せる場合に限られます。標準的な話し方は遅すぎたため、チームが停止していました。
3. 解決策:NVRAR(「エクスプレスレーン」)
遅い通信を修正するため、研究者たちは NVRAR という新しいツールを構築しました。
仕組み: 標準的で遅い郵便サービスを使用する代わりに、NVSHMEM という技術を用いたカスタムの「エクスプレスレーン」を構築しました。
比喩: 古い方法は、スタンプを押され、仕分けされ、トラックで配達される手紙を送るようなものです。NVRAR は、ある人から直接もう一人へ飛び、メモを届け、同じ瞬間に返信を受け取る専用ドローンを持っているようなものです。
「再帰的倍増」のトリック: 彼らは、各ステップで話す相手の数を倍増させる「電話ゲーム」のように通信を編成しました。全員が 1 人ずつ全員と話をする代わりに、ペアを組み、結合し、再びペアを組み、再び結合します。これは大規模なグループにとって非常に高速です。
4. 結果:チームの加速
彼らがこの新しい「エクスプレスレーン」(NVRAR)をシステムに接続したとき:
速い会話: これらの AI タスクで使用される小さなメッセージの場合、新しいシステムは標準システムよりも1.9 倍から 3.6 倍 速くなりました。
優れたパズル解決: この新しいシステムを使用して巨大な「Llama 3.1 405B」モデル(巨大な AI 脳)を実行したところ、回答を生成する時間が大幅に短縮されました。場合によっては、チームは以前よりも1.72 倍 速く完了しました。
実世界テスト: 彼らは実世界のトラフィック(何千人ものユーザーが質問をしているシミュレーション)でこれをテストし、システムが速度を落とすことなく、より多くのリクエストを 1 秒あたり処理できることを発見しました。
まとめ
この論文の本質は、巨大なコンピュータのチームが AI のパズルを解こうとする際、最大の遅延は「思考」ではなく「会話」にあるという認識にあります。異なる建物間の標準的な話し方は、必要とされる小さく頻繁なメッセージには遅すぎました。著者たちは、チームが瞬時に連携し、パズルを非常に速く解けるようにする、カスタム製の高速度通信システム(NVRAR)を構築しました。これはエクスプレスレーンのような役割を果たします。
技術的サマリー:マルチノード LLM 推論における通信パフォーマンスの理解と改善
問題定義
大規模言語モデル(LLM)の規模が拡大するにつれ、そのメモリフットプリントは単一 GPU の容量を超え、複数のノードにまたがる分散推論が必要となります。テンソル並列化(TP)やパイプライン並列化(PP)といったモデル並列化戦略は単一ノード推論においてよく研究されていますが、マルチノード環境におけるそのパフォーマンスは十分に探求されていません。マルチノード推論は、ノード間接続(例:NVLink)と比較してノード間遅延が大きいことから、重大な課題をもたらします。
著者らは、TP がメモリ束縛型でデコード負荷の重いワークロードにおいてしばしば優れている一方で、頻繁な all-reduce 操作に起因する大幅な通信オーバーヘッドに悩まされていると特定しました。一方、TP と PP を組み合わせたハイブリッド並列化(HP)は通信オーバーヘッドを削減しますが、行列乗算の性質上、デコード負荷の重い領域では計算時間の効果的な削減に失敗します。特定された重要なボトルネックは、LLM のデコードフェーズに典型的な小規模メッセージサイズ(128 KB から 2 MB)における標準的な NCCL all-reduce 実装の非最適性能であり、特にノード間でのスケーリング時に顕著です。
手法
著者らは、既存の最先端推論エンジンとカスタム研究プロトタイプの組み合わせを用いて、体系的なパフォーマンス調査を実施しました。
実験設定:
ハードウェア: 実験は Perlmutter システム(NVIDIA A100 GPU、HPE Slingshot-11 相互接続)および Vista システム(NVIDIA GH200 GPU、InfiniBand 相互接続)上で実施されました。
モデル: bf16 精度の Llama 3.1 70B および 405B(Instruct)。
ワークロード: 2 つの主要な領域がテストされました。「プレフィル負荷型」(大規模なプロンプト長)と「デコード負荷型」(長い生成シーケンス)です。
エンジン: 本研究では、vLLM およびSGLang に加え、マルチノード HPC 環境での制御された実験を容易にするために著者らによって開発されたカスタムオープンソース推論エンジンYALIS が利用されました。YALIS は、統合されたモデル定義レイヤー、Torch Compile ベースの実行、および AxoNN ベースのテンソル並列化を特徴としています。
分析アプローチ:
著者らは、GPU 数を単一ノードから 32 ノード構成まで増加させた際の強スケーリング実験を行い、エンドツーエンドのバッチ遅延を測定しました。
実行時間を計算(Matmul、Other Comp.)、通信、アイドル時間に分解し、ボトルネックを特定しました。
合成 GEMM ベンチマークを用いて、マイクロバッチング(PP)とテンソルスプリッティング(TP)が行列乗算カーネルに及ぼす影響を分離しました。
提案ソリューション(NVRAR):
通信ボトルネックに対処するため、著者らは NVSHMEM を用いた再帰的倍増に基づく階層的 all-reduce アルゴリズムNVRAR を開発しました。
設計: NVRAR は 3 つのフェーズで動作します。
ノード内 Reduce-Scatter: NCCL を用いてノード内のデータを削減します。
ノード間再帰的倍増: NVSHMEM のノンブロッキング RMA プリミティブ(put_nbi)を用いて、再帰的倍増トポロジーでノード間での all-reduce を実行します。
ノード内 All-Gather: NCCL を用いて削減されたデータをノード内の全 GPU に集めます。
最適化:
チャンク化ノンブロッキング通信: データをチャンク単位で処理することで計算と通信をオーバーラップさせます。
融合ペイロード: Slingshot/InfiniBand 上の高価な明示的シグナリングプリミティブを回避するため、データと同期フラグを単一の 8 バイトペイロードに結合します。
シーケンス番号同期: グローバルバリア(fence/quiet)の遅延オーバーヘッドを回避しつつ正しさを保証するため、グローバル同期に一意のシーケンス番号を使用します。
主要な貢献
体系的なパフォーマンス調査: 本論文は、マルチノード環境における TP と HP のスケーリング挙動の詳細な分解を提供し、TP が一般的にデコード負荷の重いワークロードで優れているが通信オーバーヘッドによって制限される一方、HP はこれらの領域において計算時間の削減に苦戦することを特定しました。
YALIS エンジン: マルチノード HPC 環境での計測可能性と制御された実験のために設計された、研究志向の推論エンジン YALIS の開発。
NVRAR アルゴリズム: LLM デコードフェーズに特徴的な小メッセージ領域向けに最適化されたカスタム all-reduce アルゴリズム NVRAR の提案と実装。これは NVSHMEM を活用し、Slingshot および InfiniBand ネットワーク上で標準的な NCCL 実装よりも低い遅延を実現します。
統合と評価: NVRAR を YALIS および vLLM に統合し、大規模モデル(Llama 3.1 405B)および混合専門家(MoE)モデル(Qwen3-235B)におけるエンドツーエンドのパフォーマンス向上を実証しました。
結果
スケーリング挙動: TP と HP の両方とも、マルチノード環境では強スケーリングが不良です。HP は計算束縛型(プレフィル負荷型)の領域で TP よりも優位ですが、TP はメモリ束縛型(デコード負荷型)の領域で HP よりも優位です。
通信ボトルネック: NCCL all-reduce は、小規模メッセージ(128 KB–2 MB)においてノード間でスケーリングが不良であり、これらの特定の領域では MPI ベースのソリューションよりも性能が劣ることが多いです。
NVRAR のパフォーマンス:
マイクロベンチマーク: NVRAR は、HPE Slingshot および InfiniBand 相互接続上で 128 KB から 2 MB のメッセージサイズにおいて、NCCL よりも1.9 倍–3.6 倍低い遅延 を達成します。
エンドツーエンド推論: YALIS および vLLM に統合された NVRAR は、テンソル並列化を使用したデコード負荷型ワークロードにおける Llama 3.1 405B モデルのエンドツーエンドバッチ遅延を最大1.72 倍 削減します。
MoE モデル: NVRAR は、並列化戦略の TP 成分を高速化することで MoE モデル(例:Qwen3-235B)のスループットも向上させ、NCCL ベースの構成と比較して最大1.14 倍 の高いスループットを達成します。
重要性
本論文は、LLM がより大規模化し、推論がマルチノードクラスターへ移行するにつれて、通信効率がパフォーマンスの主要な決定要因となると主張しています。著者らは、標準的な通信ライブラリ(NCCL)が LLM デコードフェーズ特有のメッセージサイズと遅延制約に対して最適化されていないことを実証しました。NVRAR を導入することで、彼らは通信オーバーヘッドを大幅に削減するターゲット型のソリューションを提供し、大規模モデルに対するテンソル並列化のより効率的なスケーリングを可能にしました。この研究は、次世代分散推論システムにおけるカスタム通信プリミティブの必要性を浮き彫りにし、特定の HPC 相互接続環境において標準的な集合通信ライブラリよりも階層的で NVSHMEM ベースのアプローチの有効性を検証しています。
毎週最高の machine learning 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×