← Derniers articles
💻 computer science

What is the Right Embedding Space for Contrastive Learning in REC?

L'article présente C-REX, un cadre d'apprentissage contrastif supervisé de type plug-in qui améliore le comptage d'expressions de référence en déplaçant l'échantillonnage négatif du texte vers les jetons visuels au sein des images, atteignant ainsi des performances de pointe grâce à une discrimination visuelle et une généralisation fines et améliorées.

Auteurs originaux : Kostas Triaridis, Panagiotis Kaliosis, E-Ro Nguyen, Jingyi Xu, Dimitris Samaras, Hieu Le

Publié 2026-08-05
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Kostas Triaridis, Panagiotis Kaliosis, E-Ro Nguyen, Jingyi Xu, Dimitris Samaras, Hieu Le

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous appreniez à un robot à compter des objets dans une pièce en désordre. Si vous dites simplement « compte les chaises », le robot pourrait compter toutes les chaises, même les cassées ou celles qui sont peintes d'une couleur différente. Mais que se passe-t-il si vous voulez que le robot compte uniquement « les chaises rouges avec des roues » ? C'est une tâche délicate appelée Référence d'Expression de Comptage (Referring Expression Counting). C'est comme demander à un ami de trouver « l'homme au chapeau bleu » dans une foule de gens portant des chapeaux. Le défi est que le robot doit comprendre les détails infimes de l'image (le chapeau bleu) et les faire correspondre parfaitement aux mots que vous avez prononcés.

Pour faire cela, les ordinateurs utilisent souvent une technique appelée Apprentissage Contrastif (Contrastive Learning). Voyez cela comme un jeu de « Trouvez les différences ». L'ordinateur apprend en regardant une image et une phrase, puis en essayant de déterminer quelles parties de l'image correspondent à la phrase et lesquelles ne correspondent pas. Habitement, l'ordinateur compare l'image aux mots côte à côte, en essayant de les faire « s'emboîter » dans son cerveau. Mais parfois, la façon dont l'ordinateur comprend les images et la façon dont il comprend les mots ne s'alignent pas parfaitement, comme si l'on essayait de faire entrer un pion carré dans un trou rond. Ce document pose une question simple mais cruciale : y a-t-il un meilleur endroit pour que l'ordinateur joue à ce jeu de « Trouvez les différences » ?

Les auteurs de cet article, Kostas Triaridis et son équipe, suggèrent que l'ordinateur joue le jeu dans la mauvaise pièce. Au lieu de comparer des images à des mots (ce qui est désordonné et déroutant), ils proposent que l'ordinateur ne compare que des images à d'autres images. Ils appellent leur nouvelle méthode C-REX.

Voici comment fonctionne C-REX, en utilisant une analogie amusante : Imaginez que vous êtes un enseignant essayant de trier une pile de photos d'animaux mélangées.

  • L'ancienne méthode (Image-Texte) : Vous tenez une photo de chien et une carte qui dit « Chien ». Ensuite, vous tenez une photo de chat et une carte qui dit « Chien ». Vous essayez d'apprendre à l'élève à faire correspondre la photo à la carte. Mais parfois, l'élève est confus parce que la carte et la photo ne se ressemblent pas du tout. De plus, vous n'avez que quelques cartes à lui montrer, donc l'élève n'a pas assez de pratique.
  • La nouvelle méthode (C-REX) : Vous jetez les cartes. À la place, vous montrez simplement à l'élève une énorme pile de photos. Vous dites : « Regarde cette photo de chien. Maintenant, regarde toutes ces autres photos. Lesquelles sont aussi des chiens ? Lesquelles ne sont définitivement pas des chiens ? » Parce que vous avez des centaines de photos dans la pile, l'élève peut s'exercer à repérer les différences encore et encore. Il apprend à voir les petits détails qui font qu'un chien est un chien, sans être distrait par les mots déroutants.

L'article conclut que cette approche « uniquement par l'image » est bien meilleure. En se concentrant entièrement sur les détails visuels à l'intérieur de l'image, l'ordinateur apprend à distinguer des choses très similaires — comme une personne faisant du vélo par rapport à une personne faisant de la moto — avec beaucoup plus de précision. Les auteurs ont testé cela sur trois modèles informatiques différents et ont constaté que C-REX les rendait nettement plus intelligents. En fait, les modèles ont été jusqu'à 28 % meilleurs pour compter correctement (mesuré par un score appelé MAE) et 24,5 % meilleurs pour gérer les grosses erreurs (mesuré par l'RMSE).

Les chercheurs ont également montré que ce tour de force ne sert pas seulement à compter des choses spécifiques avec des mots ; cela fonctionne pour compter n'importe quel type d'objet aussi. Ils l'ont même testé sur un cerveau de robot très avancé et polyvalent (un grand modèle de langage) et ont constaté que la méthode spécialisée C-REX était toujours bien plus performante pour cette tâche.

En résumé, l'article suggère que lorsqu'on apprend aux ordinateurs à compter des choses spécifiques dans une foule, nous ne devrions pas compter sur leur capacité à faire correspondre les mots aux images. Au lieu de cela, nous devrions les laisser comparer des images à des images, en leur offrant un immense terrain de jeu d'exemples visuels pour apprendre. Ce simple changement les rend beaucoup plus précis, stables et prêts pour le monde réel.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →