← Nieuwste papers
🤖 AI

AnnoBench: A Benchmark for Visualization Annotation Generation

Dit artikel introduceert AnnoBench, een nieuwe benchmark die is ontworpen om de automatisering van visualisatie-annotaties te evalueren en te bevorderen door systematisch visuele, semantische en stilistische beperkingen te testen over diverse grafiektypen en promptspecificaties met behulp van VLM-as-a-judge evaluatie.

Oorspronkelijke auteurs: Md Rahat-uz-Zaman, Md Dilshadur Rahman, Andrew McNutt, Paul Rosen

Gepubliceerd 2026-07-29
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Md Rahat-uz-Zaman, Md Dilshadur Rahman, Andrew McNutt, Paul Rosen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je naar een kaart kijkt. Een kaart is geweldig om te laten zien waar dingen zich bevinden, maar soms heb je een klein briefje nodig om te zeggen: "Pas op, hier zit een draak!" of "Dit pad leidt naar schatten." In de wereld van data worden deze briefjes annotaties genoemd. Het zijn de kleine tekstlabels, pijlen en highlights die ons helpen een grafiek te begrijpen. Maar het maken van deze aantekeningen is lastig. Als je het briefje op de verkeerde plek zet, kan het de data die het juist moet uitleggen, afdekken. Als je het verkeerde feit opschrijft, kun je mensen misleiden door te doen alsof een trend omhoog gaat terwijl deze eigenlijk omlaag gaat.

Lama tijd hebben computers heel goed geworden in het lezen van deze kaarten en grafieken. We hebben "slimme" computerbreinen gebouwd (Large Language Models en Vision Language Models) die naar een afbeelding van een grafiek kunnen kijken en kunnen vertellen wat deze zegt. Maar er zit een grote kloof tussen het lezen van een grafiek en het verbeteren ervan. Het is als het verschil tussen een toerist die een bord in een vreemde taal kan lezen en een lokale gids die daadwerkelijk het bord kan herschrijven zonder dat het gebouw instort. We hadden geen goede manier om te testen of deze computergidsen de taak van het correct toevoegen van die behulpzame aantekeningen daadwerkelijk konden uitvoeren. Dat is het probleem dat dit artikel aanpakt.

De Nieuwe Test: AnnoBench

De onderzoekers achter dit artikel, een team van de University of Utah, besloten een enorme, supergeorganiseerde test te bouwen genaamd AnnoBench. Denk aan het als een enorme hindernisbaan, specif으로 ontworpen om te zien of een computer een plakbriefje aan een grafiek kan toevoegen zonder er iets aan te verpesten.

Voorheen, als je de vaardigheid van een computer om grafieken te lezen wilde testen, stelde je vragen zoals: "Wat is de hoogste staaf?" of "Beschrijf deze afbeelding." Maar een computer vragen om een label toe te voegen, is veel moeilijker. Het moet drie dingen tegelijk doen:

  1. De juiste plek vinden: Het moet precies weten naar welk deel van de grafiek het moet wijzen.
  2. De waarheid spreken: Het moet ervoor zorgen dat het feit dat het opschrijft, daadwerkelijk wordt ondersteund door de data.
  3. De grafiek niet kapot te maken: Het moet de aantekening toevoegen zonder de data af te dekken of de grafiek er vreemd uit te laten zien.

Om dit te testen, creëerde het team een dataset met ongeveer 342 grafieken. Dit waren niet zomaar eenvoudige tekeningen; ze kwamen uit echte professionele nieuwsartikelen (zoals van The New York Times en The Economist) en van populaire programmeerbibliotheken. Ze zorgden ervoor dat de test eerlijk was door de "ingrediënten" van de uitdaging te veranderen. Soms gaven ze de computer een afbeelding van de grafiek (zoals een JPEG), soms gaven ze het de code die de grafiek bouwde (zo als een recept), en soms gaven ze een mix van beide. Ze veranderden ook hoe ze de computer lieten werken: soms gaven ze een vage hint zoals "Highlight de grote golf," en op andere momenten gaven ze super-specifieke instructies zoals "Teken een kader rond de golf van 1980 tot 2020."

De Grote Ontdekking: Computers Zijn Goed in Orders Opvolgen, Slecht in Raden

Wanneer ze de tests uitvoerden, ontdekten ze enkele zeer duidelijke patronen. Het belangrijkste wat ze leerden is dat hoe je de vraag stelt, belangrijker is dan je denkt.

Als je de computer een vage hint geeft (een "intent" prompt), wordt hij vaak lui. Hij voegt misschien een simpel tekstlabel toe wanneer de grafiek eigenlijk een gearceerd vlak of een specifieke pijl nodig had. Het is alsof je een vriend vraagt: "Maak deze kamer mooier," en hij verplaatst alleen een lamp. Maar als je hem specifieke instructies geeft (een "execution" prompt), zoals "Verplaats de lamp naar de hoek en schilder de muur blauw," dan doet hij het veel beter. Het artikel suggereert dat huidige computers uitstekend zijn in het volgen van strikte regels, maar nog steeds vrij slecht in het zelfstandig bedenken van de beste ontwerpstrategie.

Nog een enorme bevinding ging over het soort grafiek dat je ze laat zien. De onderzoekers ontdekten dat het aan de computer geven van een afbeelding van de grafiek (een rasterafbeelding) een ramp was. Hoewel de computer de afbeelding kon zien, probeerde hij bij het toevoegen van een aantekening vaak per ongeluk de data te veranderen. Het kan een staaf uitrekken of een lijn verschuiven, alleen maar om ruimte te maken voor de tekst. Het is als proberen een aantekening op een foto te schrijven met een stift; je kunt per ongeluk het gezicht op de foto beschrijven.

Echter, wanneer ze de computer de code gaven die de grafiek bouwde (specifiek D3.js code), presteerden de computers veel beter. Ze konden de aantekening perfect toevoegen zonder de onderliggende data te breken. Het blijkt dat computers veel beter zijn in het bewerken van het "recept" (de code) dan in het bewerken van de "taart" (de afbeelding).

Het "Rechter"-probleem

Het team probeerde ook andere slimme computers te gebruiken om de resultaten te beoordelen, een methode genaamd "VLM-as-a-Judge". Ze wilden zien of een computer kon beoordelen of een andere computer zijn werk goed had gedaan. Ze ontdekten dat deze computer-rechters oké waren in het beoordelen van code-gebaseerde grafieken, maar verschrikkelijk waren in het beoordelen van afbeelding-gebaseerde grafieken. Wanneer een computer een aantekening aan een afbeelding toevoegde en per ongeluk de data vervormde, zei de computer-rechter vaak: "Ziet er goed uit!" omdat de aantekening visueel op de juiste plek stond. Maar een mens die naar hetzelfde resultaat kijkt, zou zeggen: "Wacht, je hebt de cijfers veranderd!" Dit suggereert dat we computers nog niet volledig kunnen vertrouwen om deze taken te beoordelen, vooral wanneer afbeeldingen in het spel zijn.

Wat Dit Betekent

Het artikel beweert niet dat computers het probleem van grafiek-annotatie hebben opgelost. Sterker nog, het laat zien dat ze nog een lange weg te gaan hebben. De belangrijkste les is dat we, om computers goede aantekeningen voor grafieken te laten schrijven, ze de juiste tools moeten geven (zoals code in plaats van alleen afbeeldingen) en zeer duidelijke instructies.

De onderzoekers hebben een speciale website gebouwd, de AnnoBench Browser, zodat iedereen deze tests zelf kan proberen. Ze hopen dat dit zal helpen ontwikkelaars om betere tools voor de toekomst te bouwen. Voor nu is de les duidelijk: als je wilt dat een computer een grafiek annoteert, laat hem dan niet alleen een plaatje zien en zeg "fix het." Geef hem de code, vertel hem precies wat hij moet doen, en houd misschien een menselijk oog op de resultaten voor het geval dat.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →