← Derniers articles
🤖 AI

Show or Tell? Effectively prompting Vision-Language Models for semantic segmentation

Cet article étudie l'efficacité du prompting textuel par rapport au prompting visuel pour la segmentation sémantique dans les modèles vision-langage, révélant leur écart de performance significatif par rapport aux modèles spécialisés ainsi que la nature complémentaire des deux modalités, ce qui motive la proposition de PromptMatcher, une méthode sans entraînement qui combine les deux types de prompts pour atteindre des résultats de l'état de l'art.

Auteurs originaux : Niccolo Avogaro, Thomas Frick, Mattia Rigotti, Andrea Bartezzaghi, Filip Janicki, Cristiano Malossi, Konrad Schindler, Roy Assaf

Publié 2026-02-09
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Niccolo Avogaro, Thomas Frick, Mattia Rigotti, Andrea Bartezzaghi, Filip Janicki, Cristiano Malossi, Konrad Schindler, Roy Assaf

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un robot assistant super intelligent qui a lu presque tous les livres d'Internet et vu des milliards d'images. Vous voulez demander à ce robot de dessiner un contour autour de choses spécifiques dans une nouvelle photo, comme « trouve tous les avions » ou « mets en évidence les chats ». C'est ce qu'on appelle la segmentation sémantique.

L'article pose une question simple mais délicate : Comment dire au mieux à ce robot ce qu'il doit faire ? Devez-vous lui donner une instruction écrite (un prompt textuel), ou lui montrer une image de ce que vous voulez (un prompt visuel) ?

Voici l'histoire de leur découverte, expliquée simplement :

1. Le dilemme du « Montrer » vs « Dire »

Les chercheurs ont testé deux façons de parler à ces modèles d'IA géants :

  • La méthode du « Dire » (Prompts textuels) : Vous tapez : « Segmente tous les chats ». C'est comme donner un ordre verbal.
  • La méthode du « Montrer » (Prompts visuels) : Vous montrez au robot une photo d'un chat avec un cercle rouge autour, et vous dites : « Fais comme ça ». C'est comme pointer du doigt en disant : « Comme celui-ci ».

Ils ont découvert que les deux méthodes ont des défauts.

  • Le texte est complexe car le langage est imprécis. Les mots peuvent être déroutants. Si vous demandez au robot de trouver un « fjord » (un type d'entrée de mer profonde), il pourrait être confus car le mot est rare. Si vous demandez des « vêtements du haut », il pourrait ne pas savoir si vous parlez d'une chemise, d'une veste ou d'un chapeau. Le robot fait parfois des erreurs ou « hallucine » (invente des choses) parce que les mots n'étaient pas assez clairs.
  • Le visuel est complexe car il est trop spécifique. Si vous montez une photo d'un chat spécifique, le robot pourrait se concentrer trop étroitement sur le motif de fourrure de ce chat exact et rater d'autres chats qui lui ressemblent légèrement.

2. La grande surprise : Le robot n'est pas encore parfait

Les auteurs ont comparé ces robots « généralistes » (qui essaient de tout faire) à des robots « spécialistes » (qui sont entraînés uniquement pour trouver des chats, ou uniquement pour trouver des avions).

Le résultat ? Les robots généralistes sont encore environ 30 % moins performants que les spécialistes. Même si ces modèles géants sont célèbres pour leur intelligence, ils ne sont pas encore tout à fait prêts à remplacer les experts lorsqu'il s'agit de dessiner des lignes précises autour d'objets dans des situations nouvelles et étranges.

3. Le secret de l'« Oracle »

Les chercheurs ont remarqué quelque chose de fascinant : les prompts textuels et visuels sont les meilleurs amis du monde.

  • Quand le prompt textuel échoue (par exemple, quand le robot est confus par le mot « fjord »), le prompt visuel réussit souvent.
  • Quand le prompt visuel échoue (par exemple, quand le robot est confus par un angle étrange), le prompt textuel réussit souvent.

Ils ont imaginé un « Oracle Magique » qui pourrait regarder chaque photo et savoir instantanément : « Pour cette photo spécifique, je devrais utiliser l'instruction textuelle. Pour celle-là, je devrais utiliser l'image. »

Si cet Oracle Magique pouvait basculer entre les deux méthodes parfaitement, la performance du robot bondirait de 11 %. Cela prouve que les deux méthodes se complètent parfaitement ; elles couvrent les angles morts l'une de l'autre.

4. La solution : PromptMatcher

Puisque nous ne pouvons pas avoir d'Oracle Magique, les auteurs ont construit un outil simple et gratuit appelé PromptMatcher.

Voyez cela comme une équipe de deux personnes qui vérifient le travail de l'autre :

  1. L'expert en texte (LISA) : Lit l'instruction et dessine un masque.
  2. L'expert en visuel (SoftMatcher+) : Regarde l'image d'exemple et dessine un masque.
  3. Le arbitre (Le Vérificateur) : C'est la partie ingénieuse. L'expert visuel agit comme un « critique » pour l'expert en texte. Si l'expert en texte dessine un masque qui semble bizarre ou qui ne correspond pas à l'image d'exemple, l'arbitre dit : « Non, c'est faux », et le jette.
  4. Le résultat final : Ils combinent les masques « approuvés » des deux experts pour créer un dessin parfait.

En conclusion

En combinant le « Montrer » et le « Dire », et en faisant en sorte que l'un vérifie le travail de l'autre, ils ont créé un système qui est meilleur que le meilleur robot textuel et meilleur que le meilleur robot visuel.

Ils n'ont pas eu besoin de réentraîner le robot ou de lui apprendre de nouvelles choses ; ils ont simplement trouvé comment lui poser les bonnes questions de la bonne manière. C'est un rappel que parfois, la meilleure façon d'amener une IA intelligente à accomplir une tâche n'est pas seulement de lui parler, mais de lui montrer ce que vous voulez dire, puis de lui faire vérifier son propre travail.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →