← 最新の論文
🤖 AI

M*: A Modular, Extensible, Serving System for Multimodal Models

本論文では、複合的なマルチモーダルモデルをデータフローグラフとして表現することで、柔軟なコンポーネント構成と分散最適化を可能にし、テキストから画像生成、テキストから音声合成、ロボット・プランニングといった多様なタスクにおいて既存のフレームワークを大幅に上回るレイテンシとスループットの向上を実現する、モジュール式で拡張可能なサービングシステムであるM*を提案する。

原著者: Atindra Jha, Naomi Sagan, Keisuke Kamahori, Irmak Sivgin, Rohan Sanda, Steven Gao, Mark Horowitz, Luke Zettlemoyer, Olivia Hsu, Jure Leskovec, Baris Kasikci, Stephanie Wang

公開日 2026-06-12
📖 1 分で読めます☕ さくっと読める

原著者: Atindra Jha, Naomi Sagan, Keisuke Kamahori, Irmak Sivgin, Rohan Sanda, Steven Gao, Mark Horowitz, Luke Zettlemoyer, Olivia Hsu, Jure Leskovec, Baris Kasikci, Stephanie Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください、あなたは大規模でハイテクなキッチンを運営しています。

旧来のやり方(既存のシステム):
長い間、AIモデルは単純な一本道の組み立てラインのようなものでした。もしケーキを焼きたければ(テキスト生成)、すべての材料が同じ経路を通らなければなりませんでした:混ぜる、焼く、デコレーションする、提供する。vLLMのようなシステムは、まさにこの「テキスト専用」の組み立てラインのために構築されました。これらはケーキを焼くことに関しては非常に高速でした。

しかし今、AIは新しい時代に突入しています。私たちはもはや、単にケーキを焼いているだけではありません。私たちは複合的なキッチンを運営しているのです。私たちのモデルには以下のような能力があります:

  • 写真を見て、それを説明する(ビジョン)。
  • 声を聞いて、異なる声で返答する(音声)。
  • ビデオを見て、次に何が起こるかを予測する(ワールドモデル)。
  • コマンドに基づいてロボットアームを制御する(ロボティクス)。

これらの新しい「複合的」なモデルは、非常に複雑です。それらは単一の直線的な経路を辿るわけではありません。時には、作業をチェックするために(画像を洗練させる拡散モデルのように)元の工程に戻ってループすることもあります。時には、一度に3つの並列パスに分岐することもあります(異なる3つの角度から写真をチェックするように)。また、オーディオをリアルタイムで、一語一語ストリーミングする必要もあります。

旧来のキッチンシステム(vLLM、SGLang)は、これらの複雑でマルチタスクなモデルを、無理やり単純な一本道の組み立てラインに押し込めようとしました。それは、まるでジャグリングの演舞をコンベアベルトに押し込もうとするようなものでした。機能はしましたが、動作は遅く、使いにくく、各パーツを繋ぎ止めるための大量のカスタム「接着剤」コードを必要としました。

新しい解決策:M*
この論文では、これらの複雑なAIキッチンのための新しいオペレーティングシステムであるMを紹介しています。Mは、モデルを直線に押し込めるのではなく、モデルを動的なマップフローチャートとして扱います。

M*がどのように機能するかを、簡単な比喩を使って説明します。

1. 「ウォークグラフ」(マップ)

かつてのキッチンマネージャーは、あらゆる料理の正確なレシピを知っていなければなりませんでした。M*では、モデルの作成者はキッチンの**マップ(グラフ)**を描くだけで済みます。

  • ノード(節点): これらは各ステーションです(例:「ビジョン・ステーション」、「言語ステーション」、「オーディオ・ステーション」)。
  • ウォーク(経路): これらは顧客の注文が辿る具体的なルートです。
    • 注文A (Text-to-Image): 言語ステーションから出発 → アート・ステーションで50回ループする → プリンターへ。
    • 注文B (Speech-to-Speech): マイク・ステーションから出発 → 2つのパスに分岐する → 再び合流する → スピーカーへ。

これをM*はウォークグラフと呼びます。これにより、システムは、異なるタスクが同じキッチン内を異なる経路で移動することを理解できます。しかも、そのたびにキッチンのレイアウトを書き直す必要はありません。

2. 「コンダクター」(交通管制官)

マップが描かれたら、M*には**コンダクター(指揮者)**が控えています。これは、食べ物が「何」であるかには関心を持たず、「どこへ」行くべきかだけを管理するスマートな交通管制官です。

  • もしリクエストが(画像を洗練させるように)ループバックを必要とする場合、コンダクターはそれをループの開始点へと送り返します。
  • もしリクエストが(安全性、スタイル、コンテンツを同時にチェックするように)3つに分岐する必要がある場合、コンダクターは3つのコピーを同時に3人のシェフへと送ります。
  • もしリクエストがオーディオをストリーミングしている場合、コンダクターは文章全体が終わるのを待つのではなく、最初の単語を即座に渡すように指示します。

3. 柔軟な座席配置(プレースメント)

旧来のシステムでは、もし大きなシェフ(大規模なAIモデル)がいたら、彼らを一つの巨大なテーブル(一つのGPU)に座らせなければなりませんでした。もし小さな助手(小さなエンコーダー)がいたら、彼らを小さなテーブルに座らせる必要がありました。
M*は、キッチンを**分離(ディスアグリゲート)**することを可能にします。あなたは「ビジョン・シェフ」を別のコンピュータに、「言語・シェフ」をまた別のコンピュータに、「オーディオ・シェフ」をさらに別のコンピュータに配置できます。彼らは瞬時に互いに通信できます。これにより、遅い部分のモデルだけをスケールアップさせることができ、速い部分に無駄なコストをかけることがなくなります。

何を証明したのか?(結果)

著者らは、5つの異なる種類の複雑なモデルを用いて、M*を旧来のシステム(vLLM-Omni、SGLang-Omni、VoxServe)と比較検証しました。結果は以下の通りです。

  • 画像生成 (BAGEL): テキストから画像を生成する際、M*は旧来のシステムよりも20%から50%高速でした。画像を洗練させるために必要な複雑な「ループ」をより効率的に処理できました。
  • 音声 (Qwen3-Omni & Orpheus): 音声を生成する際、M*はリアルタイム性能において最大2.9倍高速になり、同時に2.7倍多くのリクエストを処理できました。それは、ゆっくりと途切れるラジオから、鮮明なライブ放送へと切り替わったようなものです。
  • ロボティクス (V-JEPA 2): ロボットの計画のために将来のビデオフレームを予測する際、M最大12.5倍高速でした。旧来のシステムはステップごとにすべてをゼロから再計算していましたが、Mは前のステップを記憶し、新しい部分だけを更新していました。

まとめ

M*は、あらゆるAIモデルを単一の硬直した形状に押し込めようとしない、ユニバーサルなシステムです。代わりに、モデル自身が自分の形(グラフ)を定義できるようにし、その形を実行するための柔軟で高速なエンジンを構築します。

これは、トースターを作る代わりに車を作ろうとすると壊れてしまう硬直した組み立てラインと、トースターからロケットシップまで、あらゆるものを同等のスピードと効率で作り上げることができる、スマートで適応性の高いワークショップとの違いです。この論文は、これにより開発者が、最小限の労力でこれらの複雑なマルチモーダルモデルをデプロイし、大幅に優れたパフォーマンスを得られることを主張しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →