← Derniers articles
🤖 AI

CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models

Cet article introduit CompareBench, une suite de tests exhaustive comprenant TallyBench, OmniCaps et un ensemble de données de comparaison visuelle de 1 200 questions, afin d'évaluer et de révéler les faiblesses systématiques des modèles de vision-langage actuels concernant le comptage d'objets ainsi que le raisonnement géométrique, spatial et temporel.

Auteurs originaux : Jie Cai

Publié 2026-08-31✓ Author reviewed
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jie Cai

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La vision humaine ne consiste pas seulement à voir ; il s'agit de comparer. Lorsque nous regardons une pièce, nous ne nous contentons pas de constater l'existence de chaises et de tables ; nous jugeons instantanément quelle chaise est la plus haute, quelle table est la plus proche, combien de tasses se trouvent sur le comptoir, ou si une photographie montre une scène du passé ou du présent. Cette capacité à peser une chose par rapport à une autre est une partie fondamentale de notre compréhension du monde. Au cours des dernières années, les ordinateurs ont appris à voir avec une compétence remarquable, étant capables de décrire des images et de répondre à des questions sur ce qu'elles contiennent. Ces systèmes, connus sous le nom de modèles de vision-langage, sont les moteurs de nombreux outils modernes capables de lire un graphique, de décrire une photo ou de résoudre un casse-tête visuel. Pourtant, alors que ces machines sont devenues expertes en reconnaissance et en description, il est resté incertain si elles possèdent la même compréhension intuitive de la comparaison que celle que les humains utilisent chaque seconde de la journée.

Un chercheur a désormais construit un test spécialisé pour répondre à cette question, créant une nouvelle suite d'évaluation conçue pour isoler l'acte spécifique de comparer l'information visuelle. Il a constaté que, bien que les systèmes informatiques les plus avancés soient performants sur des tâches générales, ils éprouvent des difficultés significatives lorsqu'on leur demande de faire des comparaisons directes concernant la quantité, la taille, la distance ou le temps. L'étude révèle que même les modèles les plus intelligents peuvent échouer à compter des objets qui sont clairement visibles, mal juger lequel de deux articles est le plus long, ou se tromper sur la personne qui se tient la plus proche de la caméra. Le cherchenaire a découvert que ces systèmes trébuchent souvent sur des tâches triviales pour un humain, suggérant que la capacité de comparer des détails visuels reste une faiblesse systématique de l'intelligence artificielle actuelle.

Pour étudier cet écart, le chercheur a construit un ensemble complet de tests appelé CompareBench, qui est soutenu par deux autres ressources qu'il a développées : TallyBench et OmniCaps. TallyBench est une collection de deux mille images, chacune associée à une question simple demandant à l'ordinateur de compter un type d'objet spécifique, comme des chiens, des livres ou des cuillères. Cette ressource sert de fondation pour tester la capacité d'un modèle à compter des éléments individuels et fournit également les images sources pour la tâche de comparaison de quantités. OmniCaps est un ensemble plus restreint de sept cent seize images présentant des événements historiques, des monuments célèbres et des personnalités notables, chacune étiquetée avec une date spécifique. Cette collection permet au chercheur de tester si un modèle peut comprendre le passage du temps en ordonnant les images de manière chronologique. Le test principal, CompareBench, réunit ces éléments dans douze cents questions qui demandent à l'ordinateur de faire des comparaisons directes. Ces questions sont divisées en quatre catégories : la comparaison de quantités, la comparaison de propriétés géométriques comme la longueur et l'épaisseur, le jugement de relations spatiales comme la profondeur et la hauteur, et l'ordonnancement d'événements dans le temps. La sous-partie de comparaison de quantités puise spécifiquement dans TallyBench pour former six cents questions.

Le chercheur a testé neuf versions différentes de systèmes de vision par ordinateur de pointe provenant de trois grandes entreprises technologiques. Il a demandé à ces modèles de résoudre les douze cents questions de comparaison et les deux mille tâches de comptage. Les résultats ont montré une division claire entre la performance humaine et la performance des machines. Les humains ont obtenu des scores quasi parfaits sur presque toutes les tâches, comptant les objets et jugeant les tailles avec aisance. Les modèles informatiques, cependant, ont montré des erreurs persistantes. Sur les tâches de comptage, les meilleurs modèles ont obtenu environ quatre-vingt-sept pour cent de bonnes réponses, ce qui signifie qu'ils ont manqué ou mal compté des objets dans plus d'une image sur dix. Sur les tâches de comparaison, la performance variait selon la catégorie. Les modèles étaient raisonnablement bons pour comparer des quantités, mais ils avaient des difficultés significatives avec le raisonnement spatial, échouant souvent à déterminer quel objet était plus proche de la caméra ou quel point était plus haut du sol. Ils avaient également des problèmes avec les comparaisons géométriques, comme décider lequel de deux livres était le plus épais.

L'une des découvertes les plus surprenantes est apparue dans la catégorie de la comparaison temporelle, ou basée sur le temps. Dans cette section, les modèles devaient regarder des images de scènes historiques, de monuments ou de personnages célèbres et décider lequel apparaissait plus tôt dans l'histoire. Ici, les modèles informatiques ont en fait surpassé les sujets humains de test. Les humains, qui étaient limités à l'observation des seules preuves visuelles dans les images, ne pouvaient souvent pas déterminer l'ordre correct car les images se ressemblaient beaucoup. Les modèles informatiques, cependant, avaient accès à une vaste quantité de connaissances préexistantes sur l'histoire, l'architecture et les figures célèbres. Ils pouvaient puiser dans cette base de données interne pour ordonner correctement les images, même lorsque les indices visuels seuls étaient insuffisants. Cela suggère que, bien que les modèles manquent d'une véritable compréhension visuelle de l'espace et de la taille, ils peuvent parfois compenser cela en utilisant leur immense mémoire de faits pour résoudre des problèmes qui nécessitent des connaissances externes.

Malgré ces succès occasionnels, l'étude souligne que la capacité fondamentale de comparer des éléments visuels n'est toujours pas pleinement maîtrisée par l'intelligence artificielle. Le chercheur a observé que les modèles confondaient fréquemment la longueur d'un objet avec sa hauteur, ou échouaient à distinguer un objet au premier plan d'un objet à l'arrière-plan. Il a également constaté que les modèles manquaient souvent des objets partiellement cachés lors du comptage, une tâche que les humains gèrent instinctivement. Le chercheur a conclu que les systèmes actuels ne sont pas encore fiables pour les tâches exigeant une comparaison visuelle fine, et que ces échecs ne sont pas de simples erreurs aléatoires mais des limitations systématiques dans la façon dont les modèles traitent l'information visuelle. En fournissant un ensemble de tests focalisés qui isole ces compétences spécifiques, ce nouveau benchmark offre un moyen clair de mesurer le progrès dans ce domaine. Le chercheur espère qu'en rendant ses données et ses méthodes publiques, d'autres scientifiques pourront utiliser ces outils pour construire de meilleurs modèles capables, à terme, d'égaler la capacité humaine à voir, comparer et comprendre le monde qui nous entoure.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →