← Derniers articles
💬 NLP

Visual Word Sense Disambiguation with CLIP through Dual-Channel Text Prompting and Image Augmentations

Cet article présente un cadre d'interprétation de la désambiguïsation du sens des mots visuels qui exploite CLIP avec un double canal de sollicitation textuelle et des augmentations d'images pour résoudre l'ambiguïté lexicale, atteignant des améliorations de performance significatives sur le jeu de données SemEval-2023 tout en démontrant que des invites précises et alignées sur CLIP sont plus efficaces que des signaux externes bruités.

Auteurs originaux : Shamik Bhattacharya, Daniel Perkins, Yaren Dogan, Vineeth Konjeti, Sudarshan Srinivasan, Edmon Begoli

Publié 2026-02-09
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Shamik Bhattacharya, Daniel Perkins, Yaren Dogan, Vineeth Konjeti, Sudarshan Srinivasan, Edmon Begoli

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous jouez à un jeu de « Devinez l'image ». Quelqu'un vous donne un mot qui a deux sens très différents, comme le mot « banque ».

  • S'agit-il de l'endroit où vous gardez votre argent ?
  • Ou s'agit-il du bord boueux d'une rivière ?

Si je dis simplement « banque », vous pourriez être confus. Mais si je dis « rive de la banque » (ou « berge de la rivière »), votre cerveau choisit instantanément l'image de la rivière. Ce document traite de la façon d'apprendre à un ordinateur à faire la même chose, mais avec une variante : au lieu de simplement lire plus de mots, l'ordinateur doit regarder 10 images différentes et choisir celle qui correspond au sens du mot.

Voici comment les chercheurs ont résolu ce casse-tête, expliqué simplement :

Le Problème : Les « Lunettes Floues » de l'Ordinateur

Les grands modèles de langage (les cerveaux IA intelligents) sont excellents pour lire, mais ils se trompent parfois lorsqu'un mot a plusieurs sens. Si la phrase est courte, l'ordinateur peut ne pas savoir de quelle « banque » vous parlez. C'est comme essayer d'identifier une personne dans une pièce embrumée ; vous voyez une forme, mais vous n'êtes pas sûr s'il s'agit de votre ami ou d'un étranger.

La Solution : Une Stratégie en Deux Parties

Les chercheurs ont construit un système utilisant un outil appelé CLIP (qui est comme un traducteur super intelligent parlant à la fois l'« anglais » et l'« image »). Ils ont essayé de rendre les « lunettes » de l'ordinateur plus claires en utilisant deux astuces principales :

1. Le Prompt à « Double Canal » (L'indice verbal)

Au lieu de simplement donner la phrase brute à l'ordinateur (ex : « érosion de la banque »), ils lui ont donné un ensemble d'indices pour l'aider à se concentrer. Ils ont utilisé deux types d'indices :

  • Le canal « Sémantique » : Ce sont des définitions de dictionnaire mais écrites sous forme de phrases courtes et claires (ex : « le concept de rive de rivière »).
  • Le canal « Photo » : Ce sont des prompts qui décrivent ce à quoi la photo ressemble (ex : « une photo d'une rive de rivière avec érosion »).

Considérez cela comme un détective donnant à l'ordinateur une liste d'indices : « Cherche une rivière, pas un bâtiment ». En mélangeant ces indices, l'ordinateur obtient une idée beaucoup plus nette de ce qu'il recherche.

2. L'« Augmentation d'Image » (Le Kaléidoscope)

Pour les images, l'ordinateur ne se contente pas de regarder l'image une seule fois. Les chercheurs ont utilisé une technique appelée augmentation.
Imaginez que vous regardez une peinture. Pour mieux la comprendre, vous pourriez :

  • Zoomer sur les détails.
  • La regarder de côté.
  • Plisser les yeux pour voir les formes.
  • La retourner à l'envers.

L'ordinateur a fait la même chose. Il a pris chacune des 10 images candidates et a créé 28 « versions » différentes (recadrées, retournées, éclaircies, etc.). Il a ensuite fait la moyenne de toutes ces vues pour obtenir une « super-vue » de l'image. Cela aide l'ordinateur à ignorer les distractions comme une ombre étrange ou une personne debout dans un coin.

L'Expérience : Ce qui a fonctionné et ce qui n'a pas fonctionné

Les chercheurs ont testé ces astuces sur un ensemble de données appelé SemEval-2023, qui est essentiellement une immense banque de tests de mots et d'images complexes.

Ce qui a le mieux fonctionné :

  • Les indices verbaux (Prompts) : C'était le grand gagnant. Donner de meilleures descriptions à l'ordinateur (les indices à « double canal ») l'a rendu beaucoup plus intelligent. C'était comme donner une meilleure carte au détective. Cela a considérablement amélioré la précision de l'ordinateur sans trop le ralentir.
  • Le « Kaléidoscope » (Augmentation d'image) : Regarder les images sous tous les angles a aidé un peu, mais c'était coûteux. Cela demandait beaucoup de puissance de calcul pour traiter 28 versions de chaque image, et l'amélioration de la précision était très faible. C'était comme utiliser un marteau-piqueur pour casser une noix.

Ce qui n'a pas fonctionné :

  • Ajouter plus de langues : Les chercheurs ont essayé de traduire les indices en espagnol, en français et en allemand, espérant que différentes langues clarifieraient le sens. Au lieu de cela, cela a empiré les choses. C'était comme essayer de résoudre un puzzle en portant des casques antibruit diffusant de la friture ; l'information supplémentaire créait simplement de la confusion.
  • Ajouter des définitions de dictionnaire : Ils ont essayé de donner la définition officielle du mot à l'ordinateur. Bien que cela ait aidé un tout petit peu, le fait de trop compter sur le dictionnaire a en réalité fait que l'ordinateur oubliait le contexte de la phrase.

Le Résultat Final

En combinant les indices verbaux intelligents avec une quantité modérée de retouches d'image, les chercheurs ont construit un système qui est devenu meilleur pour choisir la bonne image.

  • Avant : L'ordinateur trouvait la bonne réponse environ 58 % du temps.
  • Après : L'ordinateur trouve la bonne réponse environ 62 % du temps.

À Retenir

La leçon principale de cet article est que la qualité l'emporte sur la quantité.

  • Donner à l'ordinateur quelques indices verbaux très précis (prompts) était bien plus efficace que de lui jeter une masse énorme de données supplémentaires (comme des traductions ou des définitions de dictionnaire).
  • Essayer de voir l'image sous tous les angles possibles (augmentation agressive) coûtait trop de temps et d'énergie pour un gain minime.

En résumé, la meilleure façon d'aider une IA à comprendre un mot complexe est de lui donner une description claire et ciblée de ce qu'elle doit chercher, plutôt que de la submerger avec trop d'options ou trop de bruit.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →