← Nieuwste papers
🤖 AI

Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams

Dit artikel introduceert Diagram-MMU, een multimodale benchmark bestaande uit 3,7k wetenschappelijke diagrammen en 18,3k gevalideerde vragen om MLLM's te evalueren op diagram-naar-code parsing, bewerking en vraagbeantwoording, wat onthult dat hoewel modellen uitblinken in redeneren, ze moeite hebben met codegeneratietaken tenzij ze in agentic settings opereren.

Oorspronkelijke auteurs: Weihao Bo, Shan Zhang, Yanpeng Sun, Jie Liu, Yongke Yao, Jinhao Du, Wei He, Kai Zou, Zechao Li, Jingdong Wang

Gepubliceerd 2026-08-13
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Weihao Bo, Shan Zhang, Yanpeng Sun, Jie Liu, Yongke Yao, Jinhao Du, Wei He, Kai Zou, Zechao Li, Jingdong Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een wetenschapper bent die een paper schrijft over een nieuwe ontdekking. Je hebt een prachtige grafiek met je gegevens, een schakelschema van je experiment, of een moleculaire structuur van een nieuw medicijn. In de oude dagen zou je dit met de hand hebben getekend of een computerprogramma hebben gebruikt om een afbeeldingsbestand te maken (zoals een PNG of JPG) en dat in je document te plakken. Maar moderne wetenschappers gebruiken vaak een speciale taal genaand LaTeX om hun papers te schrijven, omdat het er zo professioneel uitziet en wiskunde perfect afhandelt. Binnen LaTeX is er een superkrachtige tool genaamd TikZ. Zie TikZ als een set zeer precieze instructies voor een robotkunstenaar. In plaats van de robot een afgewerkte afbeelding te geven, geef je hem een lijst met commando's zoals "teken een rode cirkel hier", "verbind deze lijn met die andere" en "schrijf het getal 5 hier". Als de robot de instructies perfect opvolgt, tekent hij exact het diagram dat je nodig hebt, en past het perfect in je paper.

Stel je nu voor dat je een superintelligent computerbrein hebt genaamd een Multimodal Large Language Model (MLLM). Je zou kunnen denken: "Als dit brein een afbeelding kan lezen en begrijpen wat het betekent, kan het dan niet gewoon naar mijn diagram kijken en de TikZ-instructies voor mij schrijven?" Dit is de grote vraag die deze paper aanpakt. Wetenschappers willen dat deze AI-hersenen een diagram kunnen bekijken, de wetenschap erachter kunnen begrijpen, en dan de code kunnen schrijven om het te recreëren of zelfs te veranderen (zoals een staafdiagram veranderen in een lijngrafiek) door simpelweg naar een verzoek te luisteren. Dit is onderdeel van een nieuwe trend genaamd "vibe writing", waarbij je gewoon beschrijft wat je wilt, en de AI het zware werk doet. Maar heeft de AI werkelijk de vaardigheden om dit te doen, of doet het alleen maar alsof het het begrijpt?

De onderzoekers achter Diagram-MMU besloten een gigantische, rigoureuze test te bouwen om erachter te komen. Ze creëerden een benchmark (een gestandaardiseerde test) met 3.744 unieke wetenschappelijke diagrammen en 18.305 verschillende vragen en taken. Deze diagrammen bestrijken zes verschillende wetenschappelijke werelden: grafieken (zoals grafieken), platte geometrie, 3D-vormen, netwerkgrafieken, chemische moleculen en elektrische circuits. Ze vroegen de AI niet alleen om naar de afbeelding te kijken; ze testten het op drie specifieke uitdagingen:

  1. Parsing: Een diagram bekijken en de code schrijven om het vanaf nul te tekenen.
  2. Editing: Een diagram en de code bekijken, en vervolgens de code aanpassen om te voldoen aan een nieuwe instructie (zoals "maak de weerstand blauw" of "verander dit parallel circuit in een series circuit").
  3. Question Answering: Een diagram bekijken en een vraag beantwoorden over de wetenschap binnenin (zoals "wat is de totale weerstand?").

Ze testten ook of de AI kon optreden als een behulpzame assistent die weet wanneer hij informatie moet opzoeken. Ze gaven de AI een speciale "zoektool" om TikZ-syntax (de regels van de taal) op te zoeken als de AI vastliep, en ze testten of de AI zijn stappen kon plannen: "Eerst moet ik de afbeelding begrijpen, dan zoek ik de regel op, en dan schrijf ik de code."

Dus, wat hebben ze gevonden? De resultaten waren een mix van "wow" en "oeps". De AI-modellen zijn eigenlijk heel goed in het denken over de diagrammen. Wanneer ze vragen werden gesteld zoals "Welke staaf is de hoogste?" of "Zijn deze twee componenten met elkaar verbonden?", hadden de modellen meestal gelijk (tot 86% nauwkeurigheid). Ze begrijpen de wetenschap!

Echter, wanneer het kwam tot het schrijven van de code om de diagrammen te tekenen, hadden de modellen aanzienlijke problemen. Zelfs de beste modellen kregen slechts ongeveer 31% tot 57% van de basisbouwstenen (zoals cirkels, lijnen en tekst) op de juiste plek. Het is also[f] de AI een perfect huis in detail kan beschrijven, maar wanneer het probeert het daadwerkelijk te bouwen met bakstenen, plaatst het de ramen in het dak en de deur in de vloer. Het artikel suggereert dat hoewel deze modellen goed zijn in redeneren, ze nog steeds vrij slecht zijn in de fijnmazige visuele perceptie die nodig is om een afbeelding te vertalen naar precieze code.

De studie keek ook naar de vraag of het geven van een "zoektool" aan de AI (het laten opzoeken van regels) hielp. Voor de bewerkings-taken hielp het een beetje. Maar voor de vraag-beantwoording-taken maakte het de boel vaak erger, omdat de AI in de war raakte door te veel informatie of de verkeerde vragen stelde. Eén model, Claude-4.6 Opus, viel op als het meest consistente model; het werd beter in alle drie de taken wanneer het de zoektool kreeg, maar de meeste andere modellen struikelden.

Kortom, het artikel onthult een grappige kloof: de huidige AI kan een brilante wetenschapper zijn die jouw diagrammen perfect begrijpt, maar het is nog steeds een onhandige kunstenaar wanneer het probeert ze te tekenen met de TikZ-taal. De auteurs hopen dat deze test zal helpen ontwikkelaars betere tools te bouwen, zodat wetenschappers in de toekomst hun diagrammen echt gewoon in de "vibe" kunnen creëren zonder zich zorgen te maken over de code.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →