Lakestream: A Consistent and Brokerless Data Plane for Large Foundation Model Training
Lakestream は、既存のメッセージキューや co-located ソリューションよりも低いレイテンシで ACID 類似の整合性、故障隔離、および高スループット取り込みを実現するためにトランザクショナルグローバルバッチと分散適応コミットアルゴリズムを導入し、大規模基盤モデルのトレーニング向けにブローカーレスかつオブジェクトストレージネイティブなデータプレーンです。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
巨大で超知能なロボット(大規模基盤モデル)に世界を理解させる方法を想像してみてください。そのためには、動画、画像、テキストなどの膨大なデータを、「バッチ」という単位で次々と与える必要があります。
かつて、このロボットにデータを与えることは、工場の単純なコンベアベルトのようでした。データはすでに箱に詰められており、ベルトが一定の速度でロボットへと運ぶだけでした。しかし、現代の AI は異なります。データは乱雑で巨大であり、中身に応じてサイズが変化します。場合によっては、ロボットが使用できる前に、単一の動画ファイルを解凍し、1,000 倍のサイズに拡張する必要があることもあります。
古いコンベアベルト(既存のシステム)はこれに対応できませんでした。詰まってしまうか、あるいは一人の作業者が箱を落とした瞬間に、工場全体が停止してしまっていたのです。
Lakestream の登場:「スマートでブローカー不要」なデータプレーン
この論文の著者たちは、Lakestreamという新しいシステムを構築しました。これは、これらの巨大な AI モデルに対するデータ配信を組織化する革命的な方法です。その仕組みを、簡単なアナロジーを用いて説明します。
1. 旧来の方法の問題点
- 「コロケート」の問題(ジムにあるキッチン): ロボット(トレーナー)がウェイトリフティングをしていると想像してください。その食事を用意する人(データローダー)は、同じ狭い部屋に隣接して立っています。食事の準備に時間がかかれば、ロボットはウェイトリフティングを中断せざるを得ません。食事を用意する人が転んで倒れれば、ロボットは永遠に停止してしまいます。彼らは互いに絡み合いすぎているのです。
- 「メッセージキュー」の問題(混乱した宅配業者): データ配送のために中央郵便局(Kafka のようなもの)を使うと想像してください。郵便局は、すべての紙片を個別の手紙として扱います。しかし、ロボットは一度に「完全な食事(バッチ)」を必要とします。もし郵便局が、食事の「鶏肉」部分をあるロボットアームに、「ご飯」部分を別のロボットアームに、異なるタイミングで配送すれば、ロボットは混乱し、間違ったことを学習してしまいます。また、郵便局は単一障害点です。郵便局長が病気になれば、誰も食事を手に入れることができません。
2. Lakestream の解決策:共有デジタル倉庫
Lakestream は、中央郵便局と窮屈なキッチンを取り除きます。代わりに、巨大で共有されたオブジェクトストレージ(Amazon S3 のような、無限のデジタル倉庫)とバージョン管理されたマニフェスト(マスター台帳)を使用します。
Lakestream が使用する 3 つの魔法のトリックは以下の通りです。
A. 「トランザクショナル・グローバル・バッチ」(完璧な食事)
かつて、データは個々のレコードの単なるストリームでした。Lakestream は、データ全体の「バッチ」を、**トランザクショナル・グローバル・バッチ(TGB)**と呼ばれる、単一の壊れにくい単位として扱います。
- アナロジー: 料理人がフルコースの宴会を準備していると想像してください。料理は調理され、テーブルに置かれますが、蓋で覆われています。蓋は施錠されています。まだ誰も中身を見ることはできません。
- 魔法: 料理人が「宴会全体が準備できた」と確信した瞬間、マスター台帳(マニフェスト)のスイッチを切り替えます。すると、蓋が上がり、すべてのロボットアームが、完全に完璧な食事を、全く同じ瞬間に目にするのです。スイッチを切り替える前に料理人が皿を落としてしまえば、蓋は開かず、誰もその散乱を目にすることはありません。これにより、誰もが常に同じデータで作業していることが保証されます。
B. 「分散型適応コミット」(スマートな信号機)
多くの料理人(プロデューサー)が同時にマスター台帳を更新しようとする場合、同じページに書き込もうとして競合が発生する可能性があります。
- 旧来の方法: 誰かが入るまで、ドアを叩き続けるだけでした。これは時間の無駄です。
- Lakestream の方法(DAC): 料理人たちは、賢く、自己学習したリズムを持っています。彼らは台帳の混雑状況を見ています。台帳が膨大になり、更新が遅くなっている場合は、書き込みを再試行する前に自動的にわずかに待機します。静かな場合は、より速く書き込みます。彼らは互いに会話することなく、台帳を見るだけでこれを行います。これにより、数百人の料理人が同時に作業していても、交通はスムーズに流れ続けます。
C. 「チェックポイント整合ライフサイクル」(タイムトラベル可能なセーフティ)
AI モデルはしばしば「進捗を保存(チェックポイント)」する必要があり、時には異なる経路を試すために以前の保存状態に戻る必要があります。
- 問題点: 古いシステムでは、一度データが消費されれば、それは消えてしまいます。戻りたいと思っても、戻ることができません。
- Lakestream の方法: システムは、ロボットが消費したすべての食事の履歴を、特定の「セーブポイント」と紐付けて保持します。ロボットが進捗を保存する際、台帳に「ウォーターマーク(安全ライン)」を書き込みます。システムは、そのラインより前のデータをすべて安全に保つべきであることを認識します。どのロボットもそのデータを必要としなくなったと確信できるまで、古いデータを削除しません。これにより、データを失うことなく時間を完全に巻き戻すことができ、また誰も必要としないデータを保存するための費用も節約できます。
3. 結果
この論文では、このシステムを 64 個の高性能 GPU と、巨大な動画および画像データセットでテストしました。
- 速度: 既存の最良の「コロケート」システム(データ準備とトレーニングが同時に行われるもの)と比較して、2.7 倍から 7.7 倍高速でした。
- 信頼性: 障害への対応が格段に向上しました。データ準備担当者がクラッシュしても、ロボットは停止することなくトレーニングを継続しました。
- 効率性: 中央メッセージキュー(Kafka のようなもの)を使用する場合よりもはるかに高速でした。Kafka はデータの規模と複雑さに追いつくのに苦労していました。
まとめ
Lakestream は、混沌とした片側車線の道路を、スマートで分散型の高速道路システムに置き換えるようなものです。共有倉庫とマスター台帳を使用することで、以下のことを保証します。
- 全員が、全く同じタイミングで、正確に同じ「バッチ」のデータを入手できる。
- 交通量が混雑しても、システムは高速で動き続ける。
- データを失うことなく、トレーニングプロセスを過去の任意の時点に巻き戻すことができる。
これらすべてを、誰に何をすべきかを指示する中央管理者(ブローカー)を必要とせずに達成します。これにより、世界最大の AI モデルをトレーニングする際、より高速で、安価で、かつ信頼性の高いものとなります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。