← 最新の論文
💻 computer science

Multi-tenant Kubernetes Use Cases for AI, Secure Computing and Data Services, and More

本論文は、信頼性の高い医学研究環境や機密性の高いAIモデルのホスティングに向けた柔軟なマルチテナント・ユースケースを可能にすることで、従来のシングルテナント型バッチシステムの限界に対処するため、HPE Cray EXスーパーコンピュータ「Isambard-AI」上へのKubernetesのデプロイメントを評価し、そのようなハイパフォーマンス・プラットフォームにおけるKubernetes-as-a-Serviceのプロダクション化に向けた課題と今後のステップを概説するものである。

原著者: Jake Watson, Sadaf R Alam, Christopher Woods, Abdelwahab Kawafi, Thomas Green, Ian Johnson, Ellis Pires, Jessica R. Jones, Utz-Uwe Haus

公開日 2026-08-04
📖 1 分で読めます☕ さくっと読める

原著者: Jake Watson, Sadaf R Alam, Christopher Woods, Abdelwahab Kawafi, Thomas Green, Ian Johnson, Ellis Pires, Jessica R. Jones, Utz-Uwe Haus

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

スーパーコンピュータが、巨大で高速な鉄道駅のような存在である世界を想像してみてください。何十年もの間、これらの駅はある特定のタイプの乗客、「バッチ」旅行者に合わせて設計されてきました。彼らは、一度に到着し、旅の間中ずっと専用の車両に詰め込まれた、巨大で密に集まったデータの塊です。そして、列車全体が終わるまで出発することはありません。このシステムは伝統的な科学には完璧に機能しますが、世界は変わりつつあります。今、私たちは新しい種類の旅行者、「クラウドネイティブ」な乗客を迎えています。彼らは柔軟で、個別のデータのコンテナであり、即座に列車を乗り降りしたり、安全に他人の車両を共有したり、AIチャットボットや安全な医療データベースのような複雑でインタラクティブなアプリを実行したりすることを望んでいます。

問題は、古い鉄道駅(従来のスーパーコンピュータ)がそのように作られていないことです。それらは大量の貨物を運ぶことには長けていますが、誰もが自分自身の安全なスペースを必要とする、賑やかなマルチテナント型の駅を管理することには不得意です。そこで登場するのがKubernetesです。Kubernetesを、これらコンテナ化された乗客のための究極の交通管制官だと考えてください。それは、全員に座席が行き渡り、他の人のバッグの中を覗き見ることができず、何千もの異なるアプリが同時に実行されていても駅がスムーズに機能するようにするソフトウェアです。しかし、この柔軟な交通管制官を、硬直した高速スーパーコンピュータに導入することは、蒸気機関の中に現代的な地下鉄の券売システムを設置しようとするようなものであり、システム全体をクラッシュさせることなく機能させるためには、本格的なエンジニアリングの魔法が必要となります。

この論文は、あるエンジニアのチームが、どのようにしてその現代的な交通管制官を、Isambard-AIと呼ばれる世界最先端のスーパーコンピュータの一つに導入することに成功したかという物語を伝えています。彼らは単にそれを動作させただけではありません。彼らは、二つの非常に異なり、かつ非常に重要な仕事を用いてそれをテストしました。第一に、彼らは「信頼できる研究環境(Trusted Research Environment)」を構築しました。これは、科学者が機密性の高い医療データを見ることができるものの、決してそれを盗んだり漏洩させたりすることができない、超安全なガラス張りの部屋のようなものです。第二に、彼らはAIモデルのための「サンドボックス」を設置し、複数の研究者が強力なAIの脳を、互いに邪魔することなく同時に実行し、テストできるようにしました。

チームは、彼らの新しいシステムが非常にうまく機能することを発見しました。彼らは、これらの柔軟なマルチテナント・サービスを、スーパーコンピュータの速度を落とすことなく実行できることを証明しました。実際、コンピュータ同士を接続するネットワークの速度をテストした際、このセキュリティ層を追加したことによる遅延は、わずか0.89マイクロ秒という、ほとんど目に見えないほど微小なものに過ぎないことが分かりました。これを比較するために言えば、コンピュータにとってさえ、瞬きよりも短い時間です。また、彼らは、大規模なAIモデルを複数のコンピュータにわたって実行し、かつ安全に保つことができることも示しました。

しかし、この旅に路面状況の悪い箇所(ポットホール)がなかったわけではありません。チームは、決定的なハードウェアのボトルネックを発見しました。基盤となるネットワークカード(Cassini NIC)には、発行できるセキュアな「サービスID」の数に厳格な制限があります。現在のシステムは、すべてのコンテナに固有のIDを割り当てているため、あまりにも多くのユーザーが同時に接続しようとすると、駅がID不足に陥り、システムが停止してしまうリスクがあります。さらに、彼らは現在のセットアップにおける重大なセキュリティ上の欠陥を特定しました。高速ネットワークにアクセスするために、現在の「ガラスの部屋」は「特権(privileged)」キーを使用して構築されなければなりません。これは、セキュリティガードが実際に乗客に駅のマスターキーを渡していることを意味しており、システムが本来設計されていた隔離性を損なっています。

彼らは、システムの設定がまだ少し複雑であり、これらのハードウェア制限やセキュリティのギャップを修正するために将来的な磨き上げが必要であることを認めてはいますが、クラウドの柔軟性をスーパーコンピュータの生のパワーへと持ち込むことが可能であることを実証しました。これは、科学者やAI研究者が、新しい種類の仕事のために全く新しいハードウェアを構築する必要なく、同じ強力なマシン上で安全かつ効率的に協力して作業できる未来への扉を開くものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →