← Nieuwste papers
💬 NLP

ChartAnno: Evaluating MLLMs for Chart Annotation Generation

Dit artikel introduceert ChartAnno, een benchmark bestaande uit 1.200 realistische grafieken die ontworpen zijn om de capaciteiten van multimodale grote taalmodellen bij het genereren van grafiekannotaties te evalueren, waarbij wordt onthuld dat hoewel specifieke instructies en propriëtaire modellen betere resultaten opleveren, het afleiden van abstracte intentie en het benutten van grafiekafbeeldingen nog steeds significante uitdagingen vormen.

Oorspronkelijke auteurs: Zhenghan Chen, Zekai Shao, Lidan Tan, Xin Lin, Xingchen Zeng, Yi Shan, Ziyue Lin, Xiaoliang Fu, Xinyuan Liu, Yuetong Guo, Fen Wang, Bongshin Lee, Siming Chen

Gepubliceerd 2026-08-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhenghan Chen, Zekai Shao, Lidan Tan, Xin Lin, Xingchen Zeng, Yi Shan, Ziyue Lin, Xiaoliang Fu, Xinyuan Liu, Yuetong Guo, Fen Wang, Bongshin Lee, Siming Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de kapitein van een ruimteschip bent en je computer heeft zojuist een prachtige, complexe sterrenkaart getekend. De kaart is perfect, maar hij is stil. Hij toont de sterren, maar vertelt je niet waarom ze daar zijn, welke het gevaarlijkst zijn, of waar de schat verborgen ligt. Om de kaart bruikbaar te maken, moet je aantekeningen, pijlen en labels toevoegen—dit wordt chart annotatie genoemd. Het is de kunst om een ruwe afbeelding te veranderen in een verhaal dat iedereen kan begrijpen.

In de wereld van kunstmatige intelligentie zijn er superintelligente robots die Multimodale Large Language Models (MLLM's) worden genoemd. Denk aan deze robots als wezens die tegelijkertijd tekst kunnen lezen, plaatjes kunnen bekijken en computercode kunnen schrijven. We hebben ze al geleerd om grafieken te begrijpen en zelfs om er nieuwe vanaf nul te tekenen. Maar er is een lastige kloof: kunnen deze robots naar een bestaande grafiek kijken en de juiste aantekeningen toevoegen om deze uit te leggen? Het gaat niet alleen om het tekenen van een lijn; het gaat erom te begrijpen wat die lijn betekent en vervolgens de code te schrijven om een label precies op de juiste plek te plaatsen. Dit is de uitdaging waar dit artikel over gaat: AI leren om een behulpzame gids te zijn voor data, in plaats van alleen een kaartenmaker te zijn.

Maak kennis met CHARTANNO, een nieuwe "trainingsgrond" die door onderzoekers is gecreëerd om te testen hoe goed deze AI-robots in deze specifieke taak zijn. De onderzoekers hebben een enorme bibliotheek gebouwd van 1.200 echte grafieken—variërend van nieuwsafbeeldingen tot wetenschappelijke artikelen—en elke grafiek gekoppeld aan een reeks instructies. Ze gaven de robots niet slechts één type instructie; ze testten ze met drie niveaus van detail, zoals een videogame met toenemende moeilijkheidsgraad:

  1. Het niveau "Vage Doelstelling": De robot krijgt de opdracht: "Benadruk de belangrijkste trend." De robot moet raden wat dat betekent en hoe hij dat moet weergeven.
  2. Het niveau "Actieplan": De robot krijgt de opdracht: "Teken een paarse box rond de jaren 1890 tot 1900 en plaats een label in het midden." De robot weet wat hij moet doen, maar moet nog de exacte kleuren en afmetingen bepalen.
  3. Het niveau "Blauwdruk": De robot krijgt een recept: "Teken een paarse box van x=0 tot x=10 met een specifieke tint paars en plaats de tekst op coördinaten (4, 15)."

De onderzoekers vroegen vervolgens aan 10 verschillende AI-modellen (sommige gemaakt door grote techbedrijven, andere zijn open-source) om de computercode te schrijven die deze annotaties zou toevoegen. Ze controleerden of de code daadwerkelijk werkte, of de grafiek er juist uitzag, of de betekenis duidelijk was en of het ontwerp mooi was.

Dit is wat ze vonden, en het is een beetje een gemengd beeld. Allereerst zijn de grote tech-modellen (zoals die van Google en OpenAI) nog steeds de kampioenen; ze doen over het algemeen het beste werk bij het begrijpen van de "vage doelstellingen" en het creëren van prachtige ontwerpen. Echter, sommige open-source modellen halen ze snel in; één model genaamd Kimi K2.5 presteert bijna net zo goed als de dure, gesloten reuzen.

De studie onthulde ook enkele verrassende waarheden over hoe deze robots denken. Wanneer de instructies super specifiek waren (het "Blauwdruk"-niveau), deden de robots het erg goed. Maar wanneer de instructies vaag waren (het "Vage Doelstelling"-niveau), struikelden ze vaak; ze hadden moeite met het raden van wat het belangrijkste deel van de grafiek eigenlijk was. Het is alsoك het geven van een recept met exacte maten aan een chef-kok versus simpelweg zeggen: "Maak iets lekkers"; de robots zijn geweldig in het volgen van recepten, maar leren nog steeds hoe ze creatieve chefs moeten zijn.

Een andere interessante ontdekking ging over wat de robots moeten zien. Je zou denken dat het tonen van de afbeelding van de grafiek de robot enorm zou helpen. Maar de onderzoekers ontdekten dat het aan de robot geven van de code die de grafiek heeft gemaakt, veel belangrijker was. De afbeelding hielp een beetje om de annotaties er mooi uit te laten zien, maar zonder de code (die de werkelijke datanummers en structuur bevat), raakten de robots de weg kwijt. Sterker nog, als je ze alleen de afbeelding liet zien en de code verborgen, stortte hun prestatie in. Het blijkt dat voor deze AI-robots weten wat de wiskunde achter de afbeelding is, nuttiger is dan alleen naar de afbeelding zelf kijken.

Ten slotte merkten de onderzoekers op dat de taak veel moeilijker wordt naarmate de grafieken complexer worden. Als een grafiek veel datapunten heeft of een lange, ingewikkelde codeverandering vereist om de annotatie toe te voegen, beginnen zelfs de slimste robots fouten te maken. Ze schrijven dan code die niet werkt, of ze plaatsen een label op de verkeerde plek.

Kortom, CHARTANNO laat ons zien dat hoewel AI heel goed wordt in het tekenen en lezen van grafieken, het leren om ze te verklaren met annotaties nog steeds een werk in uitvoering is. De robots zijn uitstekend in het volgen van strikte instructies, maar hebben nog hulp nodig bij het zelfstandig begrijpen van het "grotere plaatje". De onderzoekers hopen dat deze nieuwe test zal helpen bij het bouwen van betere AI-tools die op een dag elke verwarrende grafiek kunnen veranderen in een helder, behulpzaam verhaal voor iedereen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →