← Derniers articles
🤖 AI

M*: A Modular, Extensible, Serving System for Multimodal Models

Cet article présente M*, un système de service modulaire et extensible qui représente les modèles multimodaux composites sous forme de graphes de flux de données afin de permettre une composition flexible des composants et une optimisation distribuée, atteignant des améliorations significatives de la latence et du débit par rapport aux frameworks existants à travers diverses tâches telles que le texte-vers-image, le texte-vers-parole et la planification robotique.

Auteurs originaux : Atindra Jha, Naomi Sagan, Keisuke Kamahori, Irmak Sivgin, Rohan Sanda, Steven Gao, Mark Horowitz, Luke Zettlemoyer, Olivia Hsu, Jure Leskovec, Baris Kasikci, Stephanie Wang

Publié 2026-06-12
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Atindra Jha, Naomi Sagan, Keisuke Kamahori, Irmak Sivgin, Rohan Sanda, Steven Gao, Mark Horowitz, Luke Zettlemoyer, Olivia Hsu, Jure Leskovec, Baris Kasikci, Stephanie Wang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous dirigez une cuisine technologique de pointe et de grande envergure.

L'Ancienne Méthode (Systèmes Existants) :
Pendant longtemps, les modèles d'IA étaient comme des chaînes de montage simples à voie unique. Si vous vouliez préparer un gâteau (générer du texte), tous les ingrédients suivaient le même chemin : mélanger, cuire, glacer, servir. Les systèmes comme vLLM ont été conçus spécifiquement pour cette chaîne de montage « uniquement textuelle ». Ils étaient incroyablement rapides pour cuire des gâteaux.

Mais maintenant, l'IA entre dans une nouvelle ère. Nous ne nous contentons plus de préparer des gâteaux ; nous gérons une cuisine composite. Nous avons des modèles qui peuvent :

  • Regarder une photo et la décrire (Vision).
  • Écouter une voix et répondre avec une voix différente (Parole).
  • Regarder une vidéo et prédire ce qui va se passer ensuite (Modèles de monde/World Models).
  • Contrôler un bras robotique sur la base d'une commande (Robotique).

Ces nouveaux modèles « composites » sont désordonnés. Ils ne suivent pas une ligne droite unique. Parfois, ils doivent revenir en arrière pour vérifier leur travail (comme un modèle de diffusion qui affine une image). Parfois, ils doivent se diviser en trois chemins parallèles simultanément (comme vérifier une image sous trois angles différents). Parfois, ils doivent diffuser de l'audio en temps réel, un mot à la fois.

Les anciens systèmes de cuisine (vLLM, SGLang) tentaient de forcer ces modèles complexes et multimodaux dans leurs simples chaînes de montage linéaires. C'était comme essayer de faire entrer un spectacle de jonglage dans un tapis roulant. Cela fonctionnait, mais c'était lent, maladroit et nécessitait beaucoup de code de « colle » personnalisé pour faire tenir les pièces ensemble.

La Nouvelle Solution : M*
Le document présente M, un nouveau système d'exploitation pour ces cuisines d'IA complexes. Au lieu de forcer les modèles à suivre une ligne droite, M les traite comme une carte dynamique ou un organigramme.

Voici comment fonctionne M*, en utilisant des analogies simples :

1. Le « Walk Graph » (La Carte)

Dans l'ancien temps, le gestionnaire de cuisine devait connaître la recette exacte de chaque plat. Dans M*, le créateur du modèle dessine simplement une carte (un graphe) de la cuisine.

  • Nœuds : Ce sont les stations (ex : « La Station Vision », « La Station Langage », « La Station Audio »).
  • Walks (Trajets) : Ce sont les itinéraires spécifiques que prend la commande d'un client.
    • Commande A (Texte vers Image) : Le trajet va de la Station Langage → boucle 50 fois à la Station Art → se termine à l'Imprimante.
    • Commande B (Parole vers Parole) : Le trajet part de la Station Micro → se divise en deux chemins → fusionne à nouveau → va vers le Haut-parleur.

M* appelle cela le Walk Graph. Cela permet au système de comprendre que différentes tâches empruntent différents chemins à travers la même cuisine, sans avoir besoin de réécrire la disposition de la cuisine à chaque fois.

2. Le « Conductor » (Le Chef d'Orchestre)

Une fois la carte dessinée, M* possède un Conductor. C'est un contrôleur de trafic intelligent qui ne se soucie pas de savoir ce que l'on cuisine, mais seulement de cela doit aller.

  • Si une requête doit boucler (comme pour affiner une image), le Conductor la renvoie au début de la boucle.
  • Si une requête doit se diviser en trois (comme pour vérifier la sécurité, le style et le contenu), le Conductor envoie trois copies à trois chefs différents simultanément.
  • Si une requête diffuse de l'audio, le Conductor s'assure que le chef livre le premier mot immédiatement, plutôt que d'attendre la fin de toute la phrase.

3. Placement Flexible (Seating)

Dans les anciens systèmes, si vous aviez un grand chef (un grand modèle d'IA), vous deviez le mettre sur une table géante (un GPU). Si vous aviez un petit assistant (un petit encodeur), il devait s'asseoir à une petite table.
M* vous permet de désagréger la cuisine. Vous pouvez placer le « Chef Vision » sur un ordinateur, le « Chef Langage » sur un autre, et le « Chef Audio » sur un troisième. Ils peuvent communiquer entre eux instantanément. Cela signifie que vous pouvez augmenter l'échelle uniquement de la partie du modèle qui est lente, sans gaspiller d'argent pour les parties qui sont rapides.

Qu'ont-ils prouvé ? (Les Résultats)

Les auteurs ont testé M* contre les anciens systèmes (vLLM-Omni, SGLang-Omni, VoxServe) sur cinq types différents de modèles complexes. Voici ce qu'il s'est passé :

  • Génération d'images (BAGEL) : Lors de la transformation de texte en images, M* était 20 % à 50 % plus rapide que les anciens systèmes. Il gérait les « boucles » complexes nécessaires pour affiner l'image de manière beaucoup plus efficace.
  • Parole (Qwen3-Omni & Orpheus) : Lors de la génération de parole, M* était jusqu'à 2,9 fois plus rapide en termes de performance en temps réel et gérait 2,7 fois plus de requêtes simultanément. C'était comme passer d'une radio lente et saccadée à une diffusion en direct et fluide.
  • Robotique (V-JEPA 2) : Pour la prédiction des futures images vidéo pour la planification de robots, M* était jusqu'à 12,5 fois plus rapide. L'ancien système devait tout recalculer à partir de zéro à chaque étape ; M* se souvenait des étapes précédentes et ne mettait à jour que les nouvelles.

L'essentiel

M* est un système universel qui cesse d'essayer de forcer chaque modèle d'IA dans une forme unique et rigide. Au lieu de cela, il laisse le modèle définir sa propre forme (un graphe) puis construit un moteur flexible et haute vitesse pour exécuter cette forme.

C'est la différence entre une ligne de montage rigide qui casse si vous essayez de construire une voiture au lieu d'un grille-pain, et un atelier intelligent et adaptable capable de construire aussi bien un grille-pain qu'une fusée, avec la même vitesse et la même efficacité. Le document affirme que cela permet aux développeurs de déployer ces modèles multimodaux complexes avec un effort minimal tout en obtenant des performances nettement supérieures.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →