DumpsterCluster: From Dumpster Diving to Serving LLaMA-70B on $60 GPUs
本論文は、中古の引退済みハードウェアから構築された128GPUクラスターが、LLaMA-70Bのような大規模言語モデルを経済的に運用できることを実証するものであるが、その環境的な持続可能性は、旧世代のGPUによる高いエネルギー消費量を相殺するために、低炭素電力を用いた地域での展開に厳格に依存している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人工知能の世界は現在、複雑な言語モデルの学習や実行のためのエンジンとして機能するGPUと呼ばれる巨大なコンピュータチップによって、猛烈な勢いで前進しています。これらのモデルは物語を書いたり、問題を解決したり、会話をしたりすることができますが、膨大な計算能力を必要とします。このペースについていくため、データセンターはハードウェアを絶えずアップグレードし、より高速で新しいチップのためのスペースを作るために、まだ機能するチップを引退させています。このサイクルにより、能力はあるものの「古い」アクセラレータの山が蓄積され、これらの廃棄されたコンポーネントが元の価格のわずかな割合で販売される二次市場を生み出しています。研究者やエンジニアが直面している問いは、これらの引退したマシンに現代のAIタスクをこなすための生産的な「第二の人生」を与えることができるのか、それともその古さが、有用性を損なうほど非効率で無駄なものにしてしまうのかという点です。
ある研究チームは、すべて中古部品のみを使用してゼロから大規模なコンピューティング・クラスターを構築することで、この問いに答えるべく乗り出しました。彼らは単に中古のグラフィックスカードを買っただけではありません。中古のプロセッサ、メモリ、マザーボード、およびネットワーク機器を調達し、128基の引退したNVIDIA V100 GPUからなるシステムを構築しました。「ダンプスタークラスター(ゴミ箱クラスター)」と名付けられたこのコレクションは、古いハードウェアが大規模言語モデル、具体的にはLLaMA-70Bとして知られる700億パラメータのモデルを実行するという重い負荷を処理できるかどうかをテストするために設計されました。チームは、このクラスターを実世界の環境で1年間稼働させ、実際のユーザーのリクエストに応答させることで、このアプローチが経済的に実行可能であり、環境的に持続可能であるかどうかを検証しました。彼らの発見は、驚くべき可能性を示していますが、それには厳格な条件が伴います。つまり、ハードウェアは動作可能ではあるものの、その成功はどこに配置され、どのように管理されるかに完全に依存するということです。
このアプローチの経済的なケースは衝撃的です。研究者たちは、128基のGPUからなるシステム全体を約22,000ドルで組み立てました。この価格は、研究期間中の市場の下落により、当初の32,000ドルから低下しました。対照的に、最新世代のGPUをわずか8基搭載した現代的なシステムは約600,000ドルします。この莫大な初期コストの差により、たとえ個々の古いチップが低性能であっても、膨大な数のチップを用いることで、クラスターは大量のデータを処理することが可能になります。チームは、このシステムを1年間稼働させることで、大規模言語モデルを効果的に提供できることを証明しました。テキスト生成の速度は最新のスーパチップには及びませんが、多くの実用的なアプリケーションには十分なものでした。これを成功させる鍵は、単に部品を購入することではなく、それらを動かすソフトウェアを書き換えることにありました。
これらのモデルを実行するための標準的なソフトウェアは、チップ間の接続が非常に高速な最新のハードウェア向けに設計されています。ダンプスタークラスター内の古いV100チップは、接続が遅くメモリも少ないため、通常であれば大規模なモデルに直面すると窒息してしまいます。これを解決するために、研究者たちは作業の分割方法を変更するカスタムエンジンを開発しました。チップ同士を常に通信させようとするのではなく、各チップが計算の特定のセクションを担当し、結果をラインに沿って次に渡していくようにモデルを配置しました。また、グラフィックスチップが作業を継続している間にコンピュータの中央プロセッサがバックグラウンドでデータ転送を処理するようにシステムを最適化し、システムがアイドル状態になるのを防ぎました。この戦略により、128基の古いチップが、単一のチップには到底収まりきらない規模のモデルを実行できる、一つの結束したユニットとして機能することが可能になりました。
しかし、この研究は、この解決策がAI業界のエネルギーおよび環境問題に対する普遍的な解決策ではないことも明らかにしています。研究者たちは、初期コストは低いものの、稼働にかかるコストは電気料金と電力源の価格に大きく左右されることを発見しました。古いチップは最新のものよりもエネルギー効率が悪いため、同じ量のテキストを生成するためにより多くの電力を消費します。もしこのクラスターが化石燃料由来の電気を使用する地域で稼働している場合、生成される単語あたりの総炭素排出量は、新しい効率的なシステムを使用する場合よりも数十倍高くなる可能性があります。ハードウェアを再利用することによる環境上のメリットは、使用される電力が汚れていれば、完全に打ち消されてしまいます。このシステムが真に持続可能となるのは、風力や水力発電などの豊富で安価かつクリーンなエネルギーが存在する場所に設置されている場合に限られます。そのような特定の場所において、電気代の低さが古いチップの非効率性を相殺し、総所有コストを低く抑え、炭素足跡を管理可能なものにします。
ハードウェアの信頼性も、チームが対処しなければならない課題でした。1年間の稼働中、クラスターは数多くの技術的なトラブルに見舞われましたが、その大部分は単純な再起動で修正できるソフトウェアの不具合でした。チップやコンポーネントが実際に故障する、真のハードウェア障害は稀であり、発生率は全事象の14パーセント未満でした。これは、入念なテストを行い、故障に対処するための余剰容量を組み込んでおけば、中古のハードウェアでもプロダクション環境で使用できるほど信頼できることを示唆しています。研究者たちは、このシステムは質問への回答やテキスト生成には適しているものの、新しいモデルをゼロからトレーニングするために必要な、異なる種類の計算能力と安定性を必要とする用途には向いていないと指摘しました。
結局のところ、この論文は、引退したテクノロジーに第二の人生を与えることは可能であるが、それは単に古い部品をプラグに差し込むような単純なことではないことを示しています。このような「ダンプスタークラスター」の成功は、エンジニアリング、経済学、そして地理学の繊細なバランスに基づいています。それは、老朽化したハードウェアの限界を克服するための特化したソフトウェア、稼働コストと排出量を抑えるための安価でクリーンな電力のある場所、そして最新のシステムと比較してやや高いメンテナンス率を受け入れる姿勢を必要とします。これらの条件が満たされるとき、このアプローチは、常に新しいチップを製造し続ける膨大な財務的・環境的コストをかけずに、AIの容量を拡大するための実行可能な道筋を提供します。それは、適切なツールを適切なエネルギー源と一致させることができれば、コンピューティング・ハードウェアのライフサイクルを延長できるという未来を示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。