← 最新の論文
🤖 machine learning

Understanding and Improving Communication Performance in Multi-node LLM Inference

本論文は、マルチノード LLM 推論の性能評価を行い、all-reduce 操作が主要なボトルネックであることを特定し、NVSHMEM を用いた階層的 all-reduce アルゴリズムである NVRAR を導入して、標準的な NCCL 実装と比較して Llama 3.1 405B などの大規模モデルにおけるレイテンシを大幅に削減し、エンドツーエンドの性能を向上させることを示す。

原著者: Prajwal Singhania, Siddharth Singh, Lannie Dalton Hough, Akarsh Srivastava, Harshitha Menon, Charles Fredrick Jekel, Abhinav Bhatele

公開日 2026-05-21
📖 1 分で読めます☕ さくっと読める

原著者: Prajwal Singhania, Siddharth Singh, Lannie Dalton Hough, Akarsh Srivastava, Harshitha Menon, Charles Fredrick Jekel, Abhinav Bhatele

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大で複雑なパズルを解こうとしている自分を想像してください。人工知能の世界において、このパズルとは「大規模言語モデル(LLM)」、つまり物語を書き、質問に答え、問題を解決できる超賢いコンピュータの脳です。これらの脳が大きくなり賢くなるにつれて、単一のコンピュータが保持するには重くなりすぎます。

これを解決するため、科学者たちはパズルのピースを、連携して動作する多数のコンピュータ(「ノード」と呼ばれる)に分割しました。この論文は、これらのコンピュータが時間を無駄に待たずに効率的に互いに通信する方法を明らかにし、構築することについて述べています。

以下に、研究者たちが発見し構築したものの簡単な概要を示します。

1. 課題:「電話ゲーム」のボトルネック

コンピュータが連携して動作する際、絶えず情報を共有する必要があります。

  • 設定: パズルを解こうとする 32 人のチーム(GPU)を想像してください。彼らはグループ(ノード)に分かれています。グループ内では、彼らは瞬時に互いに叫ぶことができます(NVLink という超高速の内部ウォーキー・トウキーのようなものを使用)。しかし、他の グループと話すためには、より遅く、長距離の電話回線(ノード間のネットワーク)を使用する必要があります。
  • 問題点: 研究者たちは、コンピュータがパズルの「デコード」部分(1 語ずつ生成する部分)を解こうとする際、互いに非常に小さなメッセージを送信する必要があることを発見しました。
  • 比喩: リレー競争にいると想像してください。次のランナーに小さなメモを渡すために長い距離を走らなければならず、かつメモを受け取る相手がメモの受け取りが遅い場合、あなたの時間の大部分は待機することに費やされます。この論文は、標準的な「電話回線」ソフトウェア(NCCL と呼ばれる)が、異なる建物(ノード)間のこれらの小さく頻繁なメモの処理に極めて不適切であることを発見しました。それは、即座に秘密の握手を渡す必要があるのに、遅い郵便サービスでハガキを送ろうとしているようなものです。

2. 比較:チームを編成する 2 つの方法

研究者たちは、チームを編成する 2 つの主要な方法をテストしました。

  • テンソル並列化(TP): 全員が同時にパズルの同じ部分に取り組むが、合意を確認するために常に全員とチェックインする必要があります。これは大きな作業塊には優れていますが、すべてのチェックイン(通信)によって足止めを食らいます。
  • ハイブリッド並列化(HP): パズルを大きな塊に分割し、異なる塊を異なる人に割り当てます。これによりチェックインの必要性は減りますが、タスクの「1 語ずつ」生成部分には効率的ではありません。

発見: タスクの「1 語ずつ」の部分(これが最も頻繁に発生する部分)については、TP が通常優れていますが、それは チームが互いに十分に速く話せる場合に限られます。標準的な話し方は遅すぎたため、チームが停止していました。

3. 解決策:NVRAR(「エクスプレスレーン」)

遅い通信を修正するため、研究者たちは NVRAR という新しいツールを構築しました。

  • 仕組み: 標準的で遅い郵便サービスを使用する代わりに、NVSHMEM という技術を用いたカスタムの「エクスプレスレーン」を構築しました。
  • 比喩: 古い方法は、スタンプを押され、仕分けされ、トラックで配達される手紙を送るようなものです。NVRAR は、ある人から直接もう一人へ飛び、メモを届け、同じ瞬間に返信を受け取る専用ドローンを持っているようなものです。
  • 「再帰的倍増」のトリック: 彼らは、各ステップで話す相手の数を倍増させる「電話ゲーム」のように通信を編成しました。全員が 1 人ずつ全員と話をする代わりに、ペアを組み、結合し、再びペアを組み、再び結合します。これは大規模なグループにとって非常に高速です。

4. 結果:チームの加速

彼らがこの新しい「エクスプレスレーン」(NVRAR)をシステムに接続したとき:

  • 速い会話: これらの AI タスクで使用される小さなメッセージの場合、新しいシステムは標準システムよりも1.9 倍から 3.6 倍速くなりました。
  • 優れたパズル解決: この新しいシステムを使用して巨大な「Llama 3.1 405B」モデル(巨大な AI 脳)を実行したところ、回答を生成する時間が大幅に短縮されました。場合によっては、チームは以前よりも1.72 倍速く完了しました。
  • 実世界テスト: 彼らは実世界のトラフィック(何千人ものユーザーが質問をしているシミュレーション)でこれをテストし、システムが速度を落とすことなく、より多くのリクエストを 1 秒あたり処理できることを発見しました。

まとめ

この論文の本質は、巨大なコンピュータのチームが AI のパズルを解こうとする際、最大の遅延は「思考」ではなく「会話」にあるという認識にあります。異なる建物間の標準的な話し方は、必要とされる小さく頻繁なメッセージには遅すぎました。著者たちは、チームが瞬時に連携し、パズルを非常に速く解けるようにする、カスタム製の高速度通信システム(NVRAR)を構築しました。これはエクスプレスレーンのような役割を果たします。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →