世界で最も強力な人工知能モデルは、単一の建物内に収まりきらないほど巨大になりつつあります。これらのシステムを訓練するには、何千台ものコンピュータが連携して動作する必要がありますが、電力とスペースの物理的な限界により、もはや単一のデータセンターにそれらすべてを収めることはできません。その代わりに、研究者たちは計算能力を複数の場所に分散させなければならず、時には海を隔てた場所まで広げることもあります。これは困難な問題を生み出します。コンピュータ同士が同期を保つために絶えず通信する必要がある一方で、大量のデータを長距離にわたって送信することは遅く、かつ高コストだからです。離れた拠点間の接続はしばしば細く、不安定であり、情報の到着を待つ間にコンピュータがアイドル状態(待機状態)になってしまいます。もしコンピュータが自分たちの進捗を迅速に共有できなければ、訓練プロセス全体が遅れ、貴重な時間とエネルギーを浪費することになります。
DoubleZero Foundationの研究チームは、ネットワーク自体を「能動的な助っ人」に変えることで、このボトルネックを解決する新しい方法を提案しました。インターネット接続を単にデータを運ぶだけの受動的なパイプとして扱うのではなく、ネットワーク内の専用ハードウェアを使用して情報の流れを管理することを提案しています。彼らのアプローチは、既存の2つの技術を広域接続(WAN)向けに斬新な形で組み合わせたものです。第一に、「マルチキャスト」と呼ばれる手法を使用します。これにより、一台のコンピュータがメッセージを送信すると、ネットワークが自動的にそのメッセージをコピーし、個別に別々のコピーを送るのではなく、一度に多くの異なる目的地へと配信できます。第二に、各コンピュータ・クラスターの近くにあるネットワークのエッジ部分に、「FPGA」として知られるプログラマブルなチップを配置します。これらのチップはスマートな集約器として機能し、多くの異なるソースから入ってくるデータのストリームを集め、ローカルのコンピュータに到達する前に、それらを単一のクリーンなストリームへと統合します。ネットワーク内部でコピーや結合といった重い作業を行うことで、システムは離れた拠点間の限られた接続への負荷を軽減します。
このシステムを効果的に機能させるために、研究者たちは、コンピュータがいつ、どのように通信すべきかを決定するための新しい数学的フレームワークも開発しました。従来のセットアップでは、すべてのコンピュータが同時に他のすべてのコンピュータと話そうとする可能性があり、それがネットワークを渋滞させます。新しいフレームワークは、ネットワークを特定の道路と交通ルールを持つ「地図」のように扱います。それは、コンピュータを小さな回転する通信グループに分ける最適な方法を算出します。各ラウンドでは、特定のグループのコンピュータが情報を交換し、他のコンピュータは待機し、次のラウンドではグループが入れ替わります。目標は、コンピュータの待ち時間と、共有される情報の量の間の完璧なバランスを見つけることです。研究者たちは、3大陸にまたがる9つの都市をカバーする実際のプログラマブルなネットワークに基づいたシミュレーションを用いて、このアイデアをテストしました。彼らは、東京、ニューヨーク、ロンドンといった都市間の実際の移動時間や接続速度をモデル化し、異なるグループ化戦略がどのように機能するかを確認しました。
シミュレーションの結果、最適な戦略はハードウェアの性能に大きく依存することが明らかになりました。ネットワークチップのメモリが非常に少ない場合、最も効率的なアプローチは、異なる組み合わせを回転しながら巡回する3台のコンピュータによる小さなグループを形成することでした。これにより、システムの保持能力を圧倒することなく、データを迅速に流すことができました。しかし、研究者がチップにより多くのメモリを与えると、最適な戦略は完全に変化しました。長距離移動による遅延を処理できる十分なメモリがあれば、システムはすべてのコンピュータが同時に他のすべてのコンピュータと通信する戦略をサポートできるようになります。この「オールトゥオール(全対全)」のアプローチは、以前は長距離では不可能であったものですが、情報を最短時間で全員に広めることができるため、最も速い手法となりました。この研究は、スマートなネットワーク技術と、ハードウェアの限界に適応するスケジューリングを組み合わせることで、世界中に分散した訓練用コンピュータと、同じ部屋に隣り合って置かれたコンピュータとの間の格差を縮めることが可能であることを示しました。
研究者たちは、彼らの研究が現在、構築中のライブネットワークに基づいたシミュレーションであることを強調しています。DoubleZeroネットワークは存在し、トラフィックを運んでいますが、大規模なモデルを現実世界のテストで訓練するのに十分な数の接続されたコンピュータ・クラスターはまだ備わっていません。提示された結果は概念実証(プルーフ・オブ・コンセプト)であり、理論的な利点が現実のものであること、そして適切なネットワークハードウェアとスケジューリング・ロジックの組み合わせが、従来の距離の壁を克服できることを証明しています。この知見は、巨大な人工知能モデルの訓練の未来は、単に高速なコンピュータだけに依存するのではなく、遠く離れたデータセンター間の距離を弱点ではなく、管理可能なシステムの一部へと変える、学習プロセスに能動的に参加するスマートなネットワークにかかっていることを示唆しています。
技術要約:インテリジェント・ネットワークを用いた分散学習
問題提起
大規模モデルの分散学習は、電力、許可、データ主権に関する規制による個別のデータセンターの限界によって、ますます制約を受けるようになっています。単一のデータセンター内での学習は、高帯域幅、低遅延、および対称的な接続性により実現可能ですが、これをワイドエリアネットワーク(WAN)に拡張すると、深刻なボトルネックが生じます。主な課題は以下の通りです:
- 帯域幅の制約: WANリンク、特に計算アイランドへのイングレス(流入)およびエグレス(流出)リンクは、高価であり容量も限られています。標準的な同期型確率的勾配降下法(SGD)では、フルモデルの更新を交換するためにテラビット毎秒の帯域が必要となりますが、これは現実的ではありません。
- 遅延と非対称性: WANトポロジーは不均一であり、高レイテンシ(ミリ秒単位 vs マイクロ秒単位)と非対称な帯域幅を伴います。これにより、同期や結果を待つ間に計算リソースが大幅にアイドル状態になるか、あるいは古いパラメータを使用することになります。
- トポロジーの不均一性: アイランド間の距離やリンク容量の変動により、標準的な同期スキーム(リング・オールリデュースなど)は、膨大なオーバーヘッドなしには非効率的、あるいは実行不可能になります。
既存の文献では、通信頻度を減らしたり(DiLoCoなど)、データを圧縮したり(量子化/スパース化)、あるいは情報の古さ(ステイルネス)を許容したりすることで、アルゴリズムをネットワークに適応させる手法が一般的です。しかし、これらのアプローチは、ネットワークを能動的な参加者としてではなく、受動的な制約として扱う傾向があります。
手法
本論文は、特定のシステム技術と新しいアルゴリズム最適化フレームワークを組み合わせることで、ネットワークが学習プロセスに能動的に参加する二段構えのアプローチを提案しています。
1. システム提案:アクティブ・ネットワーク技術
著者らは、WANにおけるイングレスおよびエグレスのボトルネックを緩和するために、2つの特定の技術を活用することを提案しています。
- エグレス最適化のためのマルチキャスト: 送信側のアイランドが、N−1 個のユニキャストストリーム(受信者ごとに1つ)を送信する代わりに、ネットワークがマルチキャストを使用します。送信側は単一のペイロードを送信し、ネットワークは配信ツリーの分岐点でそれを複製します。これにより、コアネットワーク上の重複トラフィックが排除され、エグレス帯域幅の使用量が劇的に削減されます。
- インラインFPGAによるイングレス集約: アイランドが N−1 個の異なるストリームを受信しなければならないイングレスのボトルネックに対処するため、ネットワークのエッジにフィールド・プログラマブル・ゲート・アレイ(FPGA)を配置します。これらのFPGAは、アイランドのアクセスリンクに到達する「前」にインバウンドストリームを集約します。
- メモリ管理: データセンターのスイッチとは異なり、WANのFPGAは、レイテンシの差異による非同期的な到着を処理する必要があります。システムは、受信した重みをバッファリングするために高帯域幅メモリ(HBM)を利用します。集約は重みが到着するたびに発生し、ハッシュスキーム(Weight ID)と退避基準(完了、タイムアウト、または競合)によって管理されます。
- 損失回復: マルチキャストはTCPを排除するため、システムは集約後のパケットにシーケンス番号を付与することでパケット損失を処理します。FPGAは特定の再送ウィンドウ(tresend)に対して再送バッファを保持し、受信側のアイランドが欠落したパケットを要求できるようにすることで、クリティカルな最終ホップを保護します。
2. アルゴリズム提案:最適化フレームワーク
著者らは、ネットワークの物理的トポロジーと技術的能力に基づいた「リッチな同期スケジュール」を生成するための最適化フレームワークを開発しました。
- 回転するクリーク(Rotating Cliques): 全対全(all-to-all)の同期を行う代わりに、各ラウンドでアイランドを互いに素な「クリーク」(グループ)に分割します。これらのクリークは、グローバルな混合を確実にするために、時間の経過とともに回転します。
- 目的関数: 目標は、**情報のステイルネス(古さ)**を表すコスト関数を最小化することです。
- この関数は、**ラウンド時間(T)と平均不一致生存期間(A)**を組み合わせたものです。
- A は、「生存曲線」から導出され、特定の世代のパラメータ更新がすべてのアイランドにどのように拡散するかを測定します。
- 目的は、T(A+1/2) を最小化することであり、ラウンドの時間のコストと混合の質の間のトレードオフを行います。
- 実現可能性の制約: スケジュールがラウンド時間 T 内に収まり、かつFPGAのメモリ制約 M を満たす場合にのみ有効とされます。
- 完了制約: 最後のバイトが目的地に到着するまでの時間が ≤T であること。
- メモリ制約: FPGAは、最初のストリームの到着から最後のストリームの到着まで、メモリ内にバイトを保持しなければなりません。メモリが不足している場合、アイランドは到着を合わせるために送信オフセット(tj)をずらす必要があり、これが T を増加させます。
- 解決戦略: 最適なスケジュールは、候補となるクリーク・トポロジーを反復的に検討し、各候補に対して最小の実現可能な T を計算し(オフセットとストリームレートに関する線形計画法を解く)、目的関数を最小化するスケジュールを選択することによって求められます。
主な貢献
- システムの革新: データセンター環境におけるマルチキャストとインネットワーク集約(FPGA経由)を、WANへと拡張したことです。これは、WANの帯域幅の非対称性とレイテンシを解決するために、これらの技術を具体的に用いた初めての提案です。
- アルゴリズム・フレームワーク: ネットワークの物理的トポロジー、レイテンシ、帯域幅、およびハードウェアのメモリ制約を明示的に組み込んだ同期スケジューリング・フレームワークです。これは、静的またはヒューリスティックなスケジュールを超え、特定のネットワークに合わせて最適化された「回転するクリーク」を生成します。
- 統合設計: 本論文は、システムとアルゴリズムのコンポーネントが相互に補完し合っていることを示しています。アルゴリズムはマルチキャストとFPGAの能力を活用し、一方でハードウェアは、以前はWAN上で不可能と考えられていた混合特性をアルゴリズムが達成することを可能にします。
結果
著者らは、リアルなレイテンシと100 Gbpsのコアリンクを持つ、3つのリージョン(北米、欧州、アジア)にまたがる9つの都市を結ぶライブ・プログラマブルWANである DoubleZeroネットワーク に基づくシミュレーションを用いて、提案手法を評価しています。
- スケジュールの比較: 研究では、4つのスケジュールを比較しています:「トライアングル(Triangles)」(リージョン間を横断するように回転するリージョナル・クリーク)、「ペア(Pairs)」(線形マッチング)、「全対全(All-to-All)」、および「リージョナル(Regional)」。
- FPGAメモリがない場合: 「トライアングル」スケジュールが最も優れた性能を示し、高速なエラー減衰と実現可能なラウンド時間(~565ms)のバランスをとっていました。「全対全」は、メモリバッファなしでは9つの同時送信者を調整できないため、実行不可能でした。
- FPGAメモリがある場合(32 GB): 「全対全」スケジュールがラウンド時間 ~676ms で実現可能となりました。その完璧な混合特性により、他のすべてのスケジュールを上回り、ハードウェアの能力が最適なアルゴリズム戦略を直接決定することを証明しました。
- 同期型SGDとの比較:
- 標準的な同期型SGD(リング・オールリデュース)では、グローバルな同期を待つためにGPUが約80%の時間アイドル状態になります。
- 提案システムは、パラメータのわずかなステイルネス(1秒)を許容することで、5倍速い学習スループットを達成します。
- 同期型SGD内であっても、提案されたハードウェア(マルチキャスト/FPGA)を利用することで、標準的なホストベースの集約と比較してアイドル時間を大幅に削減できました。
意義と主張
本論文は、ネットワークを能動的な参加者にすることで、分散型WAN学習と「ゴールドスタンダード」であるコロケート(同拠点)学習との間のギャップを埋めることができると主張しています。
- 新規性: 著者らは、マルチキャストやFPGAはデータセンターでは知られているものの、これらをWANでの学習のために適用することは斬新であると主張しています。同様に、同期フレームワークは、ネットワークをブラックボックスとして扱うのではなく、その物理的特性に深く組み込まれているという点で独特です。
- 限定的な範囲: 著者らは、DoubleZeroネットワークは現在金融市場向けのライブネットワークであり、ピアシステムとの完全な経験的比較を行うためのモデルを本格的に学習できるほど多くのGPUクラスターをまだ接続していないことを認めており、提示された結果はシミュレーションに基づいています。
- 将来の展望: 著者らは、この研究を次世代モデルのための理論的およびシステム的な基盤として位置づけています。彼らは、プライベートでプログラマブルな、独自の制御と十分なメモリを備えたWANが、個別のデータセンターのスケーリング限界を克服するための不可欠なインフラであると主張しています。彼らは、このようなアプローチが限定的なインフラでのみ実行可能であるという考えを明確に否定し、能動的なネットワーキングと最適化されたスケジューリングの組み合わせこそが、将来の分散学習の鍵であると述べています。
毎週最高の machine learning 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録