← Derniers articles
💬 NLP

Towards Robust Evaluation of Visual Activity Recognition: Resolving Verb Ambiguity with Sense Clustering

Cet article propose un cadre de regroupement vision-langage qui résout l'ambiguïté des verbes dans la reconnaissance d'activités visuelles en regroupant les verbes synonymes et dépendants de la perspective en grappes de sens, offrant ainsi une méthode d'évaluation plus robuste et alignée sur l'humain par rapport aux métriques standards de correspondance exacte.

Auteurs originaux : Louie Hong Yao, Nicholas Jarvis, Tianyu Jiang

Publié 2026-01-27
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Louie Hong Yao, Nicholas Jarvis, Tianyu Jiang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un enseignant corrigeant la dissertation d'un élève sur une image. L'image montre une personne sur un vélo.

Si l'élève écrit : « La personne fait du vélo », et que votre corrigé indique « La personne pédale », un programme informatique strict pourrait marquer cela comme faux. Il voit « faire du vélo » et « pédaler » comme deux mots différents, et donne donc un zéro.

Mais n'importe quel humain dirait : « Attendez, c'est la même chose ! L'élève a raison. »

Ce document traite de la correction de ce système de notation injuste pour les ordinateurs qui tentent de comprendre ce qui se passe dans les images.

Le Problème : Le piège de la « seule bonne réponse »

Actuellement, les ordinateurs sont testés sur la reconnaissance d'activités visuelles (identifier des actions dans des photos) à l'aide d'une méthode appelée « Correspondance Exacte » (Exact Match). Cela signifie que la réponse de l'ordinateur doit être le même mot exact que l'étiquette humaine.

Les auteurs soutiennent que ce système est défaillant car :

  1. Les synonymes existent : « Enseigner » et « donner un cours » décrivent le même événement.
  2. Les perspectives changent : Une photo d'une fanfare peut être décrite comme « défiler » (en se concentrant sur les jambes) ou « jouer de la musique » (en se concentrant sur la musique). Les deux sont vraies, mais ce sont des mots différents.

Si un ordinateur devine « donner un cours » mais que l'étiquette est « enseigner », l'ordinateur reçoit une note d'échec, même s'il a parfaitement compris l'image.

La Solution : La méthode du « Group Hug » (Le câlin collectif)

Les chercheurs proposent une nouvelle façon de noter ces ordinateurs. Au lieu de chercher un seul mot magique, ils construisent des « Clusters de Sens » (Sense Clusters).

Pensez à l'organisation d'un placard en désordre. Au lieu d'essayer de trouver un t-shirt spécifique, vous regroupez les t-shirts similaires.

  • Étape 1 : Ils prennent une image et demandent à des modèles d'IA puissants (comme GPT-4o et Llama) de la décrire en utilisant de nombreux verbes différents.
  • Étape 2 : Ils utilisent un algorithme de tri intelligent pour regrouper ces verbes. Si « monter », « faire du vélo » et « cyclisme » apparaissent tous avec les mêmes images, ils sont placés dans le même « cluster ».
  • Étape 3 : Si une image appartient à un cluster, et que l'ordinateur devine n'importe quel mot à l'intérieur de ce cluster, il obtient des points.

Ce qu'ils ont découvert

Ils ont testé ce nouveau système de notation sur le jeu de données imSitu (une vaste collection de 126 000 images avec des étiquettes d'action). Voici ce qu'ils ont découvert :

  • La règle des « Quatre Perspectives » : En moyenne, une seule image peut être correctement décrite par environ quatre « clusters » de mots différents. Par exemple, une image d'un professeur peut avoir un cluster pour « enseigner », un autre pour « donner un cours », un autre pour « instruire » et peut-être un pour « éduquer ».
  • De meilleures notes pour les modèles intelligents : Lorsqu'ils ont ré-évalué les modèles informatiques existants en utilisant leur nouvelle méthode de « cluster », leurs scores ont augmenté de manière significative.
    • Exemple : Un modèle qui obtenait 56 % de réussite avec l'ancienne méthode est passé à 72 % avec la nouvelle méthode.
    • Pourquoi ? L'ancienne méthode punissait le modèle pour l'utilisation d'un synonyme ou d'une perspective différente. La nouvelle méthode a réalisé que le modèle était en réalité intelligent.
  • Accord humain : Lorsque les chercheurs ont demandé à de vrais humains de noter les modèles, les scores de la méthode « cluster » correspondaient beaucoup mieux aux humains que la méthode « correspondance exacte ». L'ancienne méthode était trop sévère ; la nouvelle méthode est juste.

Pourquoi ne pas simplement utiliser des « Scores de Similitude » ?

Les auteurs ont également testé un outil populaire appelé CLIPScore, qui tente de mesurer à quel point un mot est similaire à une image en utilisant des mathématiques. Ils ont découvert que, bien qu'il soit bon pour les choses générales, il peine avec les verbes d'action spécifiques. C'est comme un juge qui dirait : « Cette image et le mot 'manger' sont similaires à 90 % », même si la personne sur la photo est en train de « cuisiner ». Le contexte se perd. Leur méthode de « cluster » est plus précise car elle regroupe les mots en fonction de la façon dont ils sont réellement utilisés dans les images réelles.

L'essentiel

Le papier ne prétend pas que cela guérira les maladies ou construira des voitures autonomes immédiatement. Il propose plutôt une meilleure règle pour mesurer la capacité de notre IA à comprendre les images.

En réalisant qu'il n'y a pas qu'un seul mot « correct » pour une action, mais plutôt toute une famille de mots corrects, nous pouvons cesser de pénaliser l'IA pour sa créativité et commencer à lui donner crédit pour sa compréhension réelle de la scène. C'est comme dire enfin à l'élève : « Oui, 'faire du vélo' est une réponse correcte pour 'pédaler'. »

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →