← Derniers articles
💻 computer science

X2SAM: Any Segmentation in Images and Videos

X2SAM est un modèle de langage large multimodal unifié qui étend les capacités de segmentation à n'importe quel segment des images aux vidéos en couplant un LLM à un module de mémoire de masques, permettant une génération de masques de haute qualité et temporellement cohérente à partir d'instructions conversationnelles et d'indices visuels pour des tâches de segmentation diverses.

Auteurs originaux : Hao Wang, Limeng Qiao, Chi Zhang, Lin Ma, Guanglu Wan, Xiangyuan Lan, Xiaodan Liang

Publié 2026-05-05
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hao Wang, Limeng Qiao, Chi Zhang, Lin Ma, Guanglu Wan, Xiangyuan Lan, Xiaodan Liang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un assistant ultra-intelligent capable d'examiner une photo ou une vidéo et de vous dire exactement ce qui s'y passe. Pendant longtemps, ces assistants étaient excellents pour décrire la « vue d'ensemble » (comme « un chien qui joue dans un parc ») mais terribles pour pointer les détails spécifiques (comme « dessinez un cercle autour de la patte gauche du chien »).

D'un autre côté, vous avez des outils spécialisés qui sont incroyables pour dessiner ces cercles précis (masques) autour d'objets, mais ils sont comme des robots qui ne comprennent que des commandes simples comme « cliquez ici » ou « dessinez un cadre ». Ils ne comprennent pas des phrases complexes comme : « Trouvez le chien qui court après la balle rouge et dessinez un contour autour de lui. »

X2SAM est le nouveau « super-connecteur » qui comble cette lacune. Il combine le cerveau d'une IA conversationnelle avec les mains d'un outil de dessin précis, et il fonctionne aussi bien pour les photos fixes que pour les vidéos en mouvement.

Voici une explication de son fonctionnement, en utilisant quelques analogies du quotidien :

1. Le « Traducteur Universel » pour les images et les vidéos

Pensez à X2SAM comme à un traducteur universel qui parle à la fois le « Langage Humain » et le « Langage des Pixels ».

  • L'Ancienne Façon : Si vous vouliez trouver un objet spécifique dans une vidéo, vous deviez peut-être utiliser un outil pour comprendre la vidéo et un autre outil pour dessiner le contour. Ils ne communiquaient pas bien entre eux.
  • La Façon X2SAM : Vous pouvez simplement lui parler naturellement. Vous pouvez dire : « Montrez-moi la personne qui marche d'avant en arrière près du mur blanc », ou même pointer un endroit sur votre écran et dire : « Trouvez ce qui se trouve dans cette zone. » X2SAM comprend l'instruction et dessine instantanément le contour pour vous, qu'il s'agisse d'une seule photo ou d'un clip vidéo de 10 secondes.

2. La « Banque de Mémoire » pour les images en mouvement

C'est l'ingrédient secret qui rend X2SAM spécial pour les vidéos.

  • Le Problème : Si vous demandez à une IA standard de suivre une personne dans une vidéo, elle examine souvent chaque image (chaque image fractionnée d'une seconde) comme si elle était toute neuve. Elle peut perdre la personne lorsqu'elle passe derrière un arbre ou lorsque la caméra tremble.
  • La Solution X2SAM : X2SAM possède un Module de Mémoire de Masque. Imaginez cela comme un système de « post-it ». Au fur et à mesure que la vidéo défile, X2SAM note où se trouvait l'objet dans l'image précédente et garde ce post-it dans sa poche. Lorsqu'il regarde l'image suivante, il consulte ses notes pour dire : « Ah, je sais que cette personne était juste ici, donc elle est probablement toujours là. » Cela lui permet de maintenir le contour de l'objet lisse et cohérent, même si l'objet bouge, se cache ou change de forme.

3. Le « Couteau Suisse » des tâches

L'article affirme que X2SAM peut gérer une vaste variété de tâches avec un seul système, plutôt que d'avoir besoin d'un outil différent pour chaque travail. Il peut effectuer :

  • Segmentation Générique : « Dessinez les contours de tout ce qui se trouve dans cette image. »
  • Segmentation par Référence : « Dessinez le chat qui porte un chapeau. »
  • Segmentation par Raisonnement : « Trouvez l'objet qui pourrait être utilisé pour verser de l'eau dans un verre. » (Il doit réfléchir pour comprendre qu'il s'agit d'une cruche, pas seulement chercher le mot « cruche »).
  • Segmentation Ancrée Visuellement : Vous pointez un endroit sur l'écran, et il dessine l'objet sur lequel vous pointez.
  • Conversation : Il peut discuter avec vous de l'image ou de la vidéo tout en dessinant les masques simultanément.

4. Comment il a appris (L'Entraînement)

Pour devenir aussi performant, les chercheurs ne lui ont pas appris une chose à la fois. Ils ont utilisé une stratégie d'Entraînement Joint Unifié.

  • L'Analogie : Imaginez enseigner à un élève. Au lieu de lui enseigner les mathématiques le lundi et l'histoire le mardi, vous lui apprenez à résoudre des problèmes de mathématiques en utilisant des faits historiques, et vice versa, tout en même temps.
  • X2SAM a été entraîné sur un immense mélange d'images et de vidéos simultanément. Cela l'a aidé à apprendre que les règles pour trouver un « chien » dans une photo sont similaires à celles pour trouver un « chien » dans une vidéo, mais avec l'ajout de se souvenir où se trouvait le chien une seconde plus tôt.

5. Le Nouveau « Test » (V-VGD)

Les auteurs ont également créé un nouveau test appelé segmentation Video Visual Grounded (V-VGD).

  • L'Analogie : Auparavant, les tests demandaient surtout : « Pouvez-vous trouver le chien ? » Le nouveau test de X2SAM demande : « Je pointe un endroit sur l'écran dans cette vidéo ; pouvez-vous trouver l'objet sur lequel je pointe et le suivre alors qu'il bouge ? » Cela teste si l'IA peut vraiment comprendre le lien entre un indice visuel et l'objet en mouvement. X2SAM a réussi ce test avec brio, battant les modèles précédents.

En Résumé

X2SAM, c'est comme donner à un artiste humain une paire d'yeux capable de voir chaque pixel, un cerveau qui comprend des phrases complexes et la logique, et une mémoire qui se souvient où se trouvaient les choses il y a un instant. Il vous permet d'avoir une conversation naturelle avec un ordinateur pour trouver et délimiter des éléments spécifiques dans des photos et des vidéos, le tout en une seule opération.

Ce qu'il ne fait pas (selon l'article) :
L'article se concentre entièrement sur la capacité technique à segmenter (délimiter) des objets dans des images et des vidéos. Il ne prétend pas être utilisé pour le diagnostic médical, les voitures autonomes ou la surveillance de sécurité, bien que ce soient des utilisations futures potentielles pour une telle technologie. C'est strictement un outil pour comprendre et délimiter du contenu visuel basé sur des instructions.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →