← Derniers articles
🤖 AI

AnnoBench: A Benchmark for Visualization Annotation Generation

Cet article introduit AnnoBench, un nouveau benchmark conçu pour évaluer et faire progresser l'automatisation des annotations de visualisation en testant systématiquement les contraintes visuelles, sémantiques et stylistiques à travers divers types de graphiques et spécifications de prompts en utilisant l'évaluation par VLM-as-a-judge.

Auteurs originaux : Md Rahat-uz-Zaman, Md Dilshadur Rahman, Andrew McNutt, Paul Rosen

Publié 2026-07-29
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Md Rahat-uz-Zaman, Md Dilshadur Rahman, Andrew McNutt, Paul Rosen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous regardez une carte. Une carte est excellente pour montrer où se trouvent les choses, mais parfois, vous avez besoin d'une petite note pour dire : « Attention, il y a un dragon ici ! » ou « Ce chemin mène à un trésor. » Dans le monde des données, ces petites notes sont appelées annotations. Ce sont les petites étiquettes textuelles, les flèches et les mises en évidence qui nous aident à comprendre un graphique. Mais créer ces notes est délicat. Si vous placez la note au mauvais endroit, elle pourrait masquer les données qu'elle est censée expliquer. Si vous écrivez un fait erroné, vous pourriez induire les gens en erreur en leur faisant croire qu'une tendance est à la hausse alors qu'elle est en réalité à la baisse.

Pendant longtemps, les ordinateurs sont devenus très doués pour lire ces cartes et ces graphiques. Nous avons construit des cerveaux informatiques « intelligents » (appelés modèles de langage étendus et modèles de langage et de vision) capables de regarder l'image d'un graphique et de vous dire ce qu'il contient. Mais il y a un fossé entre lire un graphique et le corriger. C'est comme la différence entre un touriste qui sait lire un panneau dans une langue étrangère et un guide local capable de réécrire le panneau sans faire s'effondrer le bâtiment. Nous n'avions pas de bonne méthode pour tester si ces guides informatiques pouvaient réellement accomplir la tâche d'ajouter ces notes utiles correctement. C'est le problème que cet article traite.

Le nouveau test : AnnoBench

Les chercheurs derrière cet article, une équipe de l'Université de l'Utah, ont décidé de construire un test géant et super organisé appelé AnnoBench. Voyez cela comme un immense parcours d'obstacles conçu spécifiquement pour voir si un ordinateur peut ajouter un post-it sur un graphique sans rien gâcher.

Auparavant, si vous vouliez tester la capacité d'un ordinateur à lire des graphiques, vous lui posiez des questions comme : « Quelle est la barre la plus haute ? » ou « Décris cette image ». Mais demander à un ordinateur d' ajouter une étiquette est beaucoup plus difficile. Il doit faire trois choses à la fois :

  1. Trouver le bon endroit : Il doit savoir exactement quelle partie du graphique pointer.
  2. Dire la vérité : Il doit s'assurer que le fait qu'il écrit est réellement soutenu par les données.
  3. Ne pas casser le graphique : Il doit ajouter la note sans masquer les données ou rendre le graphique bizarre.

Pour tester cela, l'équipe a créé un ensemble de données comprenant environ 342 graphiques. Ceux-ci n'étaient pas de simples dessins ; ils provenaient de véritables articles de presse professionnels (comme The New York Times et The Economist) et de bibliothèques de codage populaires. Ils se sont assurés que le test soit équitable en changeant les « ingrédients » du défi. Parfois, ils donnaient à l'ordinateur une image du graphique (comme un JPEG), parfois ils lui donnaient le code qui a construit le graphique (comme une recette), et parfois un mélange des deux. Ils ont également modifié la façon dont ils demandaient à l'ordinateur de travailler : parfois, ils donnaient un indice vague comme « Mettez en évidence la grande vague », et d'autres fois, des instructions super spécifiques comme « Dessinez un cadre autour de la vague de 1980 à 2020 ».

La grande découverte : Les ordinateurs sont bons pour suivre des ordres, mais mauvais pour deviner

Lorsqu'ils ont lancé les tests, ils ont découvert des modèles très clairs. La chose la plus importante qu'ils ont apprise est que la façon dont vous posez la question compte plus qu'on ne le pense.

Si vous donnez à l'ordinateur un indice vague (un prompt d'« intention »), il devient souvent paresseux. Il pourrait ajouter une simple étiquette textuelle alors que le graphique nécessitait en réalité une zone ombrée ou une flèche spécifique. C'est comme demander à un ami : « Améliore cette pièce », et il se contente de déplacer une lampe. Mais si vous lui donnez des instructions spécifiques (un prompt d'« exécution »), comme « Déplace la lampe dans le coin et peins le mur en bleu », il fait un bien meilleur travail. L'article suggère que les ordinateurs actuels sont excellents pour suivre des règles strictes, mais qu'ils sont encore assez mauvais pour déterminer la meilleure stratégie de conception par eux-mêmes.

Une autre découverte majeure concernait le type de graphique que vous leur montrez. Les chercheurs ont découvert que donner à l'ordinateur une image du graphique (une image matricielle/raster) était un désastre. Même si l'ordinateur pouvait voir l'image, lorsqu'il essayait d'ajouter une note, il modifiait accidentellement les données. Il pouvait étirer une barre ou décaler une ligne juste pour faire de la place au texte. C'est comme essayer d'écrire une note sur une photographie avec un marqueur ; vous pourriez accidentellement gribouiller sur le visage dans l'image.

Cependant, lorsqu'ils ont donné à l'ordinateur le code qui a construit le graphique (plus précisément le code D3.js), les ordinateurs ont bien mieux performé. Ils pouvaient ajouter la note parfaitement sans briser les données sous-jacentes. Il s'avère que les ordinateurs sont bien meilleurs pour éditer la « recette » (le code) que pour éditer le « gâteau » (l'image).

Le problème du « Juge »

L'équipe a également essayé d'utiliser d'autres ordinateurs intelligents pour noter les résultats, une méthode appelée « VLM-as-a-Judge » (le VLM comme juge). Ils voulaient voir si un ordinateur pouvait dire si un autre ordinateur avait fait du bon travail. Ils ont constaté que ces juges informatiques étaient corrects pour noter les graphiques basés sur le code, mais qu'ils étaient terribles pour noter les graphiques basés sur des images. Lorsqu'un ordinateur ajoutait une note à une image et déformait accidentellement les données, le juge informatique disait souvent : « Ça a l'air bien ! » parce que la note était au bon endroit visuellement. Mais un humain regardant le même résultat dirait : « Attendez, vous avez changé les chiffres ! » Cela suggère que nous ne pouvons pas encore faire pleinement confiance aux ordinateurs pour évaluer ces tâches, surtout lorsque des images sont impliquées.

Ce que cela signifie

L'article ne prétend pas que les ordinateurs ont résolu le problème de l'annotation de graphiques. En fait, il montre qu'ils ont encore un long chemin à parcourir. La principale conclusion est que pour amener les ordinateurs à écrire de bonnes notes pour les graphiques, nous devons leur donner les bons outils (comme le code plutôt que de simples images) et des instructions très claires.

Les chercheurs ont construit un site web spécial, le Navigateur AnnoBench, afin que quiconque puisse tester ces tests par soi-même. Ils espèrent que cela aidera les développeurs à construire de meilleurs outils pour l'avenir. Pour l'instant, la leçon est claire : si vous voulez qu'un ordinateur annote un graphique, ne lui montrez pas seulement une image en disant « répare ça ». Donnez-lui le code, dites-lui exactement quoi faire, et gardez peut-être un œil humain sur les résultats, juste au cas où.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →