← Derniers articles
💻 computer science

G2^2TAM: Geometry Grounded Track Anything Model

Le papier introduit G2^2TAM, un cadre unifié qui exploite des représentations géométriques spatialement alignées comme mémoire implicite pour parvenir à un suivi d'instances 3D et une segmentation vidéo robustes, promptables à travers des points de vue et des occlusions variables, appuyés par le nouvel ensemble de données InsTrack.

Auteurs originaux : Chenming Zhu, Peizhou Cao, Jingli Lin, Wenbo Hu, Yunlong Ran, Jiangmiao Pang, Tai Wang, Xihui Liu

Publié 2026-07-07
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Chenming Zhu, Peizhou Cao, Jingli Lin, Wenbo Hu, Yunlong Ran, Jiangmiao Pang, Tai Wang, Xihui Liu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous marchez dans une pièce encombrée et animée. Vous repérez une chaise rouge spécifique. En circulant dans la pièce, la chaise change de forme à vos yeux : vue de côté, elle ressemble à une ligne plate ; vue de dos, vous ne voyez que les pieds ; si vous passez derrière une bibliothèque, elle disparaît complètement.

La plupart des systèmes de vision par ordinateur actuels sont comme une personne dotée d'une mémoire à très court terme qui ne reconnaît les choses que par leur apparence immédiate. Si la chaise rouge se transforme en une « ligne plate » ou est masquée, ces systèmes perdent souvent sa trace, pensant qu'il s'agit d'un nouvel objet ou qu'il a disparu pour toujours. Ils s'appuient sur un « album photo » de ce à quoi l'objet ressemblait par le passé pour faire la correspondance.

G2TAM (Geometry Grounded Track Anything Model) est un nouveau système d'IA qui réfléchit différemment. Au lieu de simplement mémoriser des photos, il construit une carte mentale 3D de la pièce telle qu'elle apparaît. Il comprend que la « ligne plate » et les « pieds » sont en réalité la même chaise rouge parce qu'ils s'inscrivent dans le même espace 3D.

Voici une décomposition de son fonctionnement, utilisant des analogies simples :

1. L'idée centrale : « Mémoire 3D » vs « Album photo »

  • L'ancienne méthode (L'album photo) : Les systèmes actuels conservent une pile de photos (une banque de mémoire) d'un objet. Si l'objet tourne ou est bloqué, le système tente de trouver une photo correspondante. Si l'angle est trop différent ou si l'objet est caché trop longtemps, le système s'embrouille.
  • La méthode G2TAM (La carte mentale) : G2TAM ne se contente pas de regarder l'image ; il déduit instantanément la forme 3D de la scène. Il traite cette forme 3D comme sa « mémoire ». Même si la chaise rouge est cachée derrière un mur, G2TAM sait exactement où elle se trouve dans l'espace 3D car il comprend la géométrie de la pièce. Il n'a pas besoin d'une pile de photos ; il possède une carte persistante et invisible.

2. Comment il reçoit des instructions (Le système de « Prompt »)

Vous pouvez dire à G2TAM ce qu'il doit suivre de trois manières, tout comme vous pourriez donner des directions à un ami :

  • Pointer : Vous touchez un endroit sur l'écran (ex : « Cette chaise rouge »).
  • Encadrer : Vous dessinez un carré autour d'un objet (ex : « La chaise à l'intérieur de ce cadre »).
  • Parler : Vous dites : « Trouve la chaise la plus proche de la fenêtre ».

G2TAM prend ces instructions et les traduit instantanément dans sa carte mentale 3D. Il ne cherche pas seulement une tache rouge ; il cherche l'objet 3D qui correspond à votre description dans cet espace spécifique.

3. La « Magie » de l'entraînement

L'article affirme que G2TAM devient meilleur pour le suivi car il apprend deux choses simultanément :

  1. Comment dessiner l'objet (Segmentation).
  2. Comment construire la pièce en 3D (Reconstruction).

Imaginez cela comme un étudiant apprenant à dessiner une voiture. S'il s'entraîne uniquement à dessiner la voiture de face, il pourrait échouer lorsqu'on lui demande de la dessiner de profil. Mais s'il s'entraîne à construire un modèle 3D de la voiture tout en la dessinant, il comprendra comment les roues sont reliées au châssis sous tous les angles. G2TAM fait cela : en apprenant à reconstruire le monde en 3D, il devient beaucoup plus difficile pour lui de perdre la trace d'un objet lorsque la caméra bouge ou que l'objet est caché.

4. Ce qu'il peut faire (Basé sur les affirmations de l'article)

Les chercheurs ont testé G2TAM et ont constaté qu'il excelle pour :

  • Suivre à travers le chaos : Il peut suivre un objet même si la caméra tourne follement ou si l'objet disparaît pendant un long moment, car il sait où l'objet devrait se trouver dans l'espace 3D.
  • Comprendre le langage : Il peut trouver des objets basés sur des descriptions complexes (ex : « la chaise près de la fenêtre ») et les suivre à travers différents angles de caméra.
  • Construire le monde : Tout en assurant le suivi, il crée également une carte 3D de la scène, incluant la position de la caméra et la profondeur de la pièce.

5. Le nouveau « Gymnase » (Dataset)

Pour entraîner et tester cela, les auteurs ont construit un nouveau jeu de données appelé InsTrack. Imaginez cela comme un parcours d'obstacles géant et complexe rempli de vidéos et de scans 3D. Ils ont créé des défis spécifiques où les objets sont cachés, les caméras bougent rapidement et les instructions sont complexes, afin de prouver que G2TAM est plus robuste que les systèmes précédents.

L'essentiel

G2TAM est un système qui combine la vision (ce à quoi l'objet ressemble) avec la compréhension de l'espace (où se trouve l'objet en 3D). En ancrant sa mémoire dans la géométrie du monde plutôt que dans une simple liste de photos, il peut suivre des objets de manière plus fiable, même lorsqu'ils bougent, changent de forme ou disparaissent de la vue. C'est une étape vers une IA qui comprend le monde comme les humains le font : comme un lieu 3D stable, et non comme une simple série d'images en 2D.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →