Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
Mage-VL est un modèle de fondation de streaming efficace et natif du codec qui exploite un tokenizer sensible au mouvement et une architecture à double système pour parvenir à une compréhension multimodale en temps réel avec une consommation de jetons considérablement réduite et une inférence plus rapide, tout en égalant ou en surpassant des modèles de pointe plus vastes sur les tâches de raisonnement statiques et dynamiques.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous regardez un match de football en direct sur votre téléphone. La caméra balaie le terrain, la foule rugit et les joueurs courent de l'avant vers l'arrière. Maintenant, imaginez un robot super intelligent essayant de comprendre ce match en temps réel. La plupart des robots actuels sont comme un étudiant qui s'obstine à lire chaque mot d'un manuel de 500 pages, même les passages qui disent simplement « l'herbe est verte » pour la centième fois. Ils s'embourbent dans les parties ennuyeuses et statiques de la vidéo, gaspillant toute leur puissance cérébrale et leur temps, alors qu'ils ratent le moment où un but est marqué. C'est un peu un paradox d'un autre genre : ils sont des génies pour résoudre des énigmes complexes mais sont incapables de regarder simplement une scène en mouvement de manière efficace.
Ce document, écrit par l'équipe Microsoft Mage, présente un nouveau type de cerveau robotique appelé Mage-VL. Il est conçu pour briser cette règle en agissant davantage comme un œil humain. Au lieu de fixer chaque image d'une vidéo, Mage-VL ne prête attention qu'aux parties qui changent ou qui bougent réellement. Voyez cela comme un agent de sécurité qui ne regarde que les capteurs de mouvement ; si rien ne bouge, il ne gaspille pas d'énergie à surveiller le couloir vide. En faisant cela, le robot peut comprendre les vidéos beaucoup plus rapidement et avec moins de puissance de calcul, ce qui lui permet de discuter avec vous d'un match en direct au fur et à mesure qu'il se déroule, plutôt que d'attendre la fin du match pour donner un résumé.
La magie de l'observation « codec-native »
La recette secrète de Mage-VL est ce que les auteurs appellent une approche codec-native. Dans le monde de la diffusion vidéo (comme lorsque vous regardez Netflix ou YouTube), les ordinateurs utilisent une astuce appelée « compression » pour économiser de l'espace. Ils n'envoient pas chaque image d'une vidéo ; ils envoient une image complète (un « I-frame ») puis n'envoient que les minuscules morceaux qui changent au cours des quelques secondes suivantes (les « P-frames »). C'est ainsi que votre téléphone peut diffuser un film sans consommer toutes vos données.
Mage-VL a été construit pour parler nativement ce langage. Au lieu de forcer la vidéo dans une grille rigide d'images statiques, il utilise les mêmes signaux de mouvement que la compression vidéo pour décider de ce qui est important. Si un joueur court, le robot zoome sur le joueur. Si la foule en arrière-plan est simplement immobile, le robot l'ignore complètement. C'est comme un photographe qui ne prend une photo que lorsqu'un événement intéressant se produit, plutôt que de prendre 30 photos par seconde d'une nature morte.
Le résultat est un gain d'efficacité massif. Le document montre que Mage-VL peut réduire le nombre de « jetons visuels » (les minuscules morceaux de l'image que l'ordinateur doit traiter) de plus de 75 %. C'est comme lire un livre où vous n'avez à lire que les chapitres passionnants, en sautant les parties ennuyeuses, tout en comprenant parfaitement l'histoire entière.
Un cerveau à deux systèmes
Pour gérer ce flux vidéo, Mage-VL utilise un cerveau ingénieux en deux parties, inspiré de la façon dont les humains réfléchissent.
- Système 1 (Le réflexe) : C'est un gardien très rapide et léger. Il surveille le flux vidéo et demande : « Se passe-t-il quelque chose d'intéressant en ce moment ? » Si la réponse est non, il reste silencieux. Si la réponse est oui (comme lors de la marque d'un but), il réveille instantanément la seconde partie du cerveau.
- Système 2 (Le raisonneur) : C'est la partie de la réflexion lourde et intense. Une fois que la porte est ouverte, il plonge en profondeur pour comprendre exactement ce qui s'est passé et générer une réponse.
Cela signifie que le robot ne perd pas de temps à réfléchir aux parties ennuyeuses de la vidéo. Il reste silencieux pendant la mi-temps ou lorsque la caméra balaie simplement le stade, puis il intervient avec un commentaire dès qu'un joueur frappe dans le ballon.
Ce qu'ils ont trouvé (et ce qu'ils n'ont pas trouvé)
L'équipe a entraîné ce modèle de zéro en utilisant environ 560 millions d'images non étiquetées et 100 millions de trames vidéo non étiquetées. Cela semble énorme, mais comparé à d'autres modèles géants qui nécessitent des milliards de paires image-texte, c'est en réalité assez peu. Étonnamment, ils ont découvert qu'il n'est pas nécessaire d'avoir un ensemble de données à l'échelle du web pour construire un excellent cerveau visuel. La méthode d'entraînement personnalisée de Mage-VL lui a permis d'égaler ou même de surpasser des modèles beaucoup plus grands sur des tâches de compréhension vidéo.
Voici certaines des découvertes clés qu'ils ont faites :
- Vitesse : Mage-VL est incroyablement rapide. Il peut traiter la vidéo jusqu'à 3,5 fois plus vite en temps réel par rapport aux modèles standards, tout en donnant les bonnes réponses.
- Pas besoin d'entraînement sur « longues vidéos » : Ils ont découvert qu'ils n'avaient pas besoin d'entraîner spécifiquement le modèle sur de longues vidéos pour qu'il soit capable de répondre à des questions les concernant. En l'entraînant sur des descriptions détaillées de clips courts et en utilisant leur méthode intelligente de « codec », le modèle a appris à comprendre les longues vidéos de lui-même.
- Le mouvement aide le raisonnement spatial : Ils ont constaté que l'entraînement du modèle sur des vidéos en mouvement le rendait meilleur pour comprendre les formes 3D statiques et les relations spatiales. Il semble que voir comment les choses bougent aide le robot à comprendre comment elles s'emboîtent dans l'espace.
- L'IA aidant l'IA : L'équipe a utilisé un système d'IA pour aider à rédiger de meilleures données d'entraînement. Ils ont fait vérifier les légendes générées par une IA, corriger les erreurs et améliorer les requêtes (prompts), créant ainsi une boucle qui a rendu les données de bien meilleure qualité.
L'essentiel
Mage-VL est une étape importante pour créer une IA capable de réellement « regarder » et d'« écouter » le monde en temps réel. Il prouve qu'il n'est pas nécessaire de forcer le passage à travers chaque pixel d'une vidéo pour la comprendre. En étant intelligent sur ce qu'il regarde — en imitant la façon dont la compression vidéo fonctionne et la façon dont l'œil humain se concentre sur le mouvement — le modèle devient plus rapide, moins coûteux à exploiter et plus réactif.
Bien que le document note que le modèle doit encore progresser sur les tâches de raisonnement complexe et les problèmes mathématiques, il démontre avec succès qu'un modèle plus petit et plus efficace peut surpasser des géants beaucoup plus grands et plus lents lorsqu'il s'agit de comprendre le monde dynamique qui nous entoure. C'est un passage de « tout lire » à « regarder ce qui compte ».
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.