A converged architecture for processing 32 Tbps of physics data in real-time at the LHCb experiment
LHCb実験は、ゼロコピー・ネットワーク技術を用いて、前例のない毎秒32テラビットのリアルタイム粒子衝突データを処理する、収束した完全GPUベースのアーキテクチャの実装に成功し、物理学実験における高スループットなデータフィルタリングの新たな標準を確立しました。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
夕焼けや子犬の写真を撮るのではなく、宇宙で最も小さな構成要素が衝突する様子を捉える、巨大で高速なカメラを想像してみてください。これが素粒子物理学の世界です。そこでは、科学者たちが衝突器と呼ばれる巨大な装置を使用して、粒子を1秒間に数十億回もぶつけ合っています。これらの粒子が衝突すると、新しい粒子がカオス的な爆発を引き起こします。それはまるで、中身を見るために花瓶を粉々に砕くようなものです。目的は、その破片の中に隠された、稀で新しい何かを垣間見ることです。しかし、ここには落とし穴があります。カメラがあまりに速く、衝突があまりに頻繁であるため、膨大な量のデータが生成されます。それは、毎秒、数百万個のハードドライブを満たしてしまうほどの量です。もし科学者たちがすべてのデータ片を保存しようとすれば、コンピュータは溶けてしまい、ストレージは瞬時に使い果たされてしまうでしょう。
この問題を解決するために、物理学者は「フィルター」または「トリガー」を使用します。これは、非常に排他的なクラブのドアマンのようなものだと考えてください。ドアマンは、どの衝突が保存する価値があるほど興味深いのか、そしてどの衝突を単なる退屈な背景ノッチとして捨て去るべきかを、一瞬で判断しなければなりません。数十年の間、これらのドアマンは、専用のハードウェアとコンピュータ・ソフトウェアの混合物でした。しかし、マシンが高速化するにつれ、古いドアマンたちはついていけなくなりました。彼らはあまりに遅く、かつ硬直していたため、ハードウェアが想定していたものと見た目が異なると、興味深いイベントであっても捨ててしまうことがよくありました。大きな疑問はこうでした。「いかにして、データの洪水に対処できるほど速く、全体像を見渡せるほど賢く、そして状況に応じて即座に判断を変えられるほど柔軟なフィルターを構築するか?」
この論文は、LHCb実験が大規模なアップグレードによってこの問題をどのように解決したかという物語を伝えています。チームは、まるで超効率的なオールインワンの工場のようにはたらく新しいシステムを構築しました。データを複数のステップに分け、異なるチームが異なる部分を担当するという遅いプロセスを使用する代わりに、彼らは「コンバージド・アーキテクチャ(統合アーキテクチャ)」を作成しました。これは、データ収集、選別、およびフィルタリングを、通常ゲーミングコンピュータで見られる強力なグラフィックス・プロセッシング・ユニット(GPU)上で実行される、一つの合理化されたプロセスに統合することを意味します。彼らは、驚異的な毎秒32テラビットのデータをリアルタイムで処理することに成功しました。これは、ソフトウェアによって処理されたデータレートとしては、物理学の実験において過去最高です。古い硬直したハードウェア・フィルターを取り除き、スマートで柔軟なソフトウェア・システムに置き換えることで、彼らは単にスピードについていくだけでなく、科学の質自体を向上させ、稀でエキサイティングなイベントが決して漏れ落ちないようにしたのです。
問題点:データの洪水
大型ハドロン衝突器(LHC)は、1秒間に数十億回、粒子を衝突させています。衝突するたびに、それは一つの「イベント」と呼ばれます。かつて、LHCb実験は2段階のフィルター・システムを使用していました。まず、「ローレベル・トリガー」と呼ばれる専用設計の電子回路が、データを素早くスキャンして、退屈な衝突の大部分を捨て去ります。有望そうに見えるものだけが、「ハイレベル・トリガー(ソフトウェア)」へと渡され、より深い調査が行われます。
しかし、この古いシステムには欠陥がありました。ハードウェア・フィルターは特定のセンサーのみを監視していたため、検出器の他の場所で発生した興味深いイベントを見逃してしまうことがあったのです。また、一度ハードウェアを構築してしまうと、ルールを変更することが困難でした。LHCbチームは、この最初のハードウェアベースのフィルターを完全に廃止することに決めました。これは、彼らのシステムが以前よりも40倍多いデータを処理しなければならないことを意味します。彼らは**毎秒32テラビット(Tbps)**の生データストリームを処理し、それをリアルタイムで最も興味深いイベントへと絞り込む必要がありました。もし失敗すれば、データは永遠に失われてしまうことになります。
解決策:コンバージド・ファクトリー
チームは、164台のサーバー(コンピュータ)が単一の巨大なマシンのように機能する新しいシステムを構築しました。その仕組みは以下の通りです。
1. 「ゼロコピー」ハイウェイ
通常、データがネットワークカードからコンピュータのメモリへ、そしてプロセッサへと移動する場合、何度もコピーされる必要があります。これは、箱をトラックから倉庫へ、次に棚へ、そして展示ケースへと何度も運び直すようなものです。これには時間とエネルギーがかかります。LHCbチームは「ゼロコピー」技術を使用しました。トラックから倉庫を通って、直接展示ケースへと流れるコンベアベルトを想像してください。一度も手作業で移動させることなく、直接流れていくのです。これにより、コンピュータを減速させることなく、極めて高速にデータを移動させることができました。
2. GPUパワーハウス
重労働を行うために、標準的なコンピュータ・プロセッサ(CPU)の代わりに、グラフィックス・プロセッシング・ユニット(GPU)を使用しました。これらはビデオゲーム用コンピュータに見られるチップであり、何千ものタスクを同時に処理するように設計されています。チームは、粒子の軌跡を再構成することは、複雑な3Dビデオゲームのシーンをレンダリングすることに似ていると気づきました。フィルタリングのプロセス全体をGPU上に置くことで、数千の衝突を同時に処理することが可能になりました。
3. スマートなスケジューリング
課題の一つは、すべての衝突が同じサイズや複雑さではないことでした。分析が早いものもあれば、時間がかかるものもあります。もしシステムがこれらを一つずつ処理しようとすれば、待ち状態が発生してしまいます。チームは、イベントをバッチ(塊)としてグループ化する巧妙な「スケジューラー」を開発しました。これは、料理人が食事を準備するようなものです。一度に一皿ずつ作るのではなく、野菜をすべて切り、次に肉をすべて切り、それからすべてをまとめて調理します。これにより、GPUを常に稼働させ、効率的に機能させることができます。彼らはまた、バッチ全体を俯瞰し、ステップを実行する最適な順序を決定する「マルチイベント・スケジューラー」を使用し、高価な計算が本当に必要なイベントに対してのみ行われるようにしました。
4. ネットワーク
これら164台のサーバーを接続するために、スーパーコンピュータでよく使われるテクノロジーである「InfiniBand」を用いたカスタムネットワークを構築しました。すべてのサーバーが他のすべてのサーバーと効率的に通信でき、交通渋滞(「インキャスト」として知られる問題)を回避できるように設計されました。これにより、検出器の異なる部分から各衝突の断片を集め、ボトルネックなしにGPUへ送ってフィルタリングを行うことが可能になりました。
結果:記録の更新
チームがシステムをテストしたところ、計画通りに動作することが確認されました。
- 速度: 入ってくる32 Tbpsの全データをリアルタイムで処理することに成功しました。
- フィルタリング: システムは、データを30:1の割合で削減するフィルターを適用しました。これは、30回の衝突につき、1回分だけがさらなる研究のために保持されることを意味します。
- 拡張性: より多くのサーバーを用いてテストした際、システムは完璧にスケールアップしました。システムは、LHCの設計レートである毎秒3,000万回の衝突を処理することができます。
- 効率性: システムは、328個のGPU(1サーバーにつき2個)を備えた164台のサーバーを使用しました。総計算能力は膨大でしたが、設計は効率的であり、かつての実験のように何千台ものマシンを必要とすることはありませんでした。
この論文は、このシステムが、物理学の分野におけるソフトウェアによる最高データレートを実現可能であることを裏付けています。古い硬直したハードウェア・フィルターを取り除き、より速く、よりスマートなソフトウェアベースのシステムに置き換えることができることを証明したのです。
なぜ重要なのか
これは単に多くのデータを扱うための話ではありません。宇宙のより多くの姿を見ることなのです。ハードウェア・フィルターを取り除くことで、LHCb実験は、古いハードウェアが監視するようにプログラムされていた部分だけでなく、興味深いイベントを探すために「検出器全体」を見渡すことができるようになりました。これは、以前は見えなかった稀な粒子や新しい物理学を発見できる可能性があることを意味します。この「コンバージド・アーキテクチャ」の成功は、将来の素粒子物理学の実験がどのように構築されるべきかという新たな基準を打ち立て、適切な市販技術と巧みなソフトウェアを組み合わせることで、科学の可能性の限界を押し広げられることを示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。