← Derniers articles
💻 computer science

INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning

Le papier présente INST-IT, une approche d'ajustement par instruction visuelle explicite qui améliore la compréhension des instances au niveau local des modèles multimodaux, renforçant ainsi leurs performances sur des tâches spécifiques et générales de compréhension d'images et de vidéos.

Auteurs originaux : Wujian Peng, Lingchen Meng, Yitong Chen, Yiweng Xie, Yang Liu, Tao Gui, Hang Xu, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

Publié 2026-03-17
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Wujian Peng, Lingchen Meng, Yitong Chen, Yiweng Xie, Yang Liu, Tao Gui, Hang Xu, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous regardez un film ou une photo avec un ami très intelligent, mais un peu distrait. Si vous lui demandez : « Qui est cet homme en rouge qui court vers la voiture ? », il pourrait vous répondre : « Il y a des gens, des voitures et de l'herbe. » Il voit l'ensemble de la scène, mais il a du mal à se concentrer sur l'objet précis qui vous intéresse.

C'est exactement le problème que les chercheurs de l'Université Fudan ont voulu résoudre avec leur nouvelle méthode appelée Inst-IT.

Voici une explication simple de leur travail, avec quelques analogies pour mieux comprendre :

1. Le Problème : L'œil de l'aigle vs. la vue d'ensemble

Les grands modèles d'intelligence artificielle (les "cerveaux" qui voient des images et des vidéos) sont devenus excellents pour décrire une scène globale. C'est comme un photographe qui prend une belle photo d'un paysage : il voit les montagnes, le ciel et la rivière.

Mais si vous lui demandez de vous dire exactement ce que fait le petit oiseau perché sur une branche spécifique, il peut se tromper ou être confus. Il manque de précision au niveau de l'instance (c'est-à-dire l'objet individuel).

2. La Solution : Le "Pointeur Magique" (Visual Prompt)

Pour aider l'IA à mieux se concentrer, les chercheurs ont inventé une astuce géniale : le "Pointeur Magique".

Imaginez que vous prenez une photo de votre famille et que vous collez un petit autocollant numéroté (1, 2, 3...) sur la tête de chaque personne.

  • Au lieu de dire simplement "regarde la photo", vous dites à l'IA : "Regarde la personne avec le numéro 2".
  • Dans le papier, ils appellent cela des "Set-of-Marks" (SoM). C'est comme si on donnait à l'IA un stylo surligneur pour qu'elle puisse entourer précisément ce qui l'intéresse avant de répondre.

3. L'Entraînement : Le "Cours de Détective"

Pour que l'IA apprenne à utiliser ce surligneur, les chercheurs ont créé deux choses principales :

  • Le Manuel d'Entraînement (Inst-IT Dataset) : Ils ont pris des milliers de vidéos et d'images et ont demandé à une IA très puissante (GPT-4o) de les annoter comme un détective. Au lieu de juste dire "il y a un chien", ils ont écrit : "Le chien numéro 3 porte un collier rouge et court vers la gauche". Ils ont fait cela pour des dizaines de milliers de vidéos, créant une immense bibliothèque de leçons précises.
  • L'Examen Final (Inst-IT Bench) : Ils ont créé un test spécial pour vérifier si l'IA a vraiment appris. Au lieu de demander "Qu'est-ce qu'il y a dans l'image ?", ils demandent : "Quelle est la différence entre la chemise de l'homme au numéro 1 et celle de la femme au numéro 2 entre la 3ème et la 5ème seconde ?".

4. Le Résultat : Un Super-Héros de la Vision

Après avoir suivi ce "cours de détective" avec le manuel et l'examen, les modèles d'IA sont devenus incroyablement performants :

  • Ils voient les détails : Ils ne confondent plus les objets.
  • Ils comprennent le temps : Dans une vidéo, ils savent qui bouge, qui disparaît et qui arrive, même si c'est rapide.
  • Ils sont plus intelligents en général : Ce qui est surprenant, c'est qu'en apprenant à regarder les détails, l'IA est devenue meilleure pour tout comprendre, pas seulement pour les détails. C'est comme si un étudiant qui apprenait à résoudre des équations mathématiques complexes devenait soudainement meilleur en lecture générale.

En résumé

Inst-IT, c'est comme donner à une IA des lunettes de réalité augmentée avec des étiquettes sur les objets. Au lieu de regarder le monde de manière floue et globale, l'IA apprend à pointer du doigt chaque élément, à comprendre ses mouvements et à répondre à vos questions précises.

C'est une avancée majeure pour rendre les assistants virtuels plus utiles dans la vraie vie, que ce soit pour aider un médecin à analyser une vidéo médicale, pour aider un automobiliste à voir un piéton spécifique, ou simplement pour répondre à vos questions sur votre propre famille sur une photo de vacances !

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →