Math-Vision Diagrams: A Comprehensive Benchmark for Evaluating LLM Mathematical Diagram Generation Capabilities
Dit artikel introduceert "Math-Vision Diagrams", de eerste uitgebreide benchmark die is ontworpen om de capaciteiten van Large Language Models bij het genereren van wiskundig nauwkeurige diagrammen vanuit tekstuele prompts te evalueren door text-to-code en text-to-image paradigma's te verenigen, waarbij significante huidige beperkingen in deze cruciale vaardigheid worden onthuld.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot probeert te leren hoe hij een perfect blauwdruk van een huis moet tekenen. Je zou niet alleen zeggen: "Teken een huis," en hopen dat er een huis uitkomt met rechte muren en een deur op de juiste plek. Je zou precies moeten uitleggen waar de hoeken komen, hoe lang de balken zijn, en dat het dak een specifieke hoek moet hebben. Dit is de wereld van mathematische diagramgeneratie. Het bevindt zich op het snijvlak van twee superkrachten: mathematisch redeneren (de intellectuele logica die weet dat de hoeken van een driehoek samen 180 graden moeten zijn) en visuele creatie (het artistieke vermogen om de afbeelding daadwerkelijk te tekenen). Voor een lange tijd zijn computers erg goed geworden in het bekijken van plaatjes en het beantwoorden van vragen daarover, of het schrijven van code om eenvoudige grafieken te maken. Maar een computer vragen om naar een wiskundig probleem te kijken en dan vanuit het niets de exacte, mathematisch correcte diagram te tekenen? Dat is als een kok vragen om een recept te lezen en dan direct een taart te bakken die er precies uitziet als een foto, met de glazuur perfect gespoten en de lagen gelijkmatig. Het is een enorme uitdaging omdat wiskunde geen ruimte laat voor "bijna goed". Als een lijn slechts een millimeter afwijkt of een label op de verkeerde plek staat, wordt de hele diagram nutteloos, zoals een kaart die je van een klif af leidt.
Dit is precies het probleem dat een team van onderzoekers van Pandita AI Inc. besloot aan te pakken. Ze realiseerden zich dat we weliswaar genoeg tests hebben om te zien of robots wiskundige problemen kunnen oplossen met behulp van plaatjes, maar dat we geen eerlijke manier hadden om te testen of robots die plaatjes ook daadwerkelijk kunnen creëren. Dus bouwden ze een nieuwe speeltuin genaamd Math-Vision Diagrams. Denk aan een grote, rigoureuze kunstles voor AI, waarbij de leraar (de benchmark) de student (de AI) een tekstuele beschrijving geeft en een tekening eist die niet alleen mooi is, maar ook mathematisch perfect.
De onderzoekers begonnen met het verzamelen van een enorme collectie van 3.040 lastige wiskundige problemen uit echte competities, variërend van meetkunde tot statistiek. Ze filterden dit terug naar 2.920 problemen die zwaar leunden op visuele diagrammen. Vervolgens gebruikten ze een slimme mix van andere AI-modellen en menselijke wiskundige experts om de oorspronkelijke, soms vage probleemstellingen om te zetten in kristalheldere instructies. In plaats van bijvoorbeeld alleen te zeggen "teken een cirkel", zouden de nieuwe prompts zeggen: "Teken een cirkel met een horizontale en verticale diameter die elkaar in het midden snijden, gelabeld met 'O'". Ze lieten zelfs menselijke experts controleren of deze instructies duidelijk genoeg waren zodat een mens de afbeelding perfect zou kunnen tekenen, waarbij ze de instructies beoordeelden op een schaal van 1 tot 5.
Zodra ze hun "examenvragen" klaar hadden, legden ze 11 verschillende AI-modellen op de proef. Sommige van deze modellen zijn als architecten die gedetailleerde blauwdrukken (code) schrijven die een computer vervolgens omzet in een afbeelding (text-to-code). Anderen zijn als digitale schilders die proberen de afbeelding direct vanuit de beschrijving te schilderen zonder eerst code te schrijven (text-to-image). De onderzoekers maten hoe goed de tekeningen overeenkwamen met de oorspronkelijke wiskundige problemen met behulp van verschillende instrumenten: door te controleren of de lijnen en randen perfect op één lijn lagen, hoe vergelijkbaar de algemene look was met het doelwit, en of de code daadwerkelijk werkte zonder vast te lopen.
De resultaten waren een mix van indrukwekkende vooruitgang en enkele nederige realiteitschecks. De studie toonde aan dat geen enkel AI-model een meester is in alles. De "architect"-modellen (de code-generatoren) waren over het algemeen beter in het krijgen van de wiskunde en de structuur goed—zoals ervoor zorgen dat een vierkant ook echt vier gelijke zijden heeft—maar ze faalden vaak in het voltooien van de taak omdat hun code niet compileerde, waardoor ze in 10% tot 30% van de gevallen vastliepen. De "schilder"-modellen (de directe beeldgeneratoren) waren ongelooflijk betrouwbaar en produceerden bijna altijd een afbeelding, maar hun tekeningen misten vaak de precieze mathematische structuur, met lijnen die iets golvend waren of labels die op de verkeerde plek stonden.
Een van de meest interessante bevindingen was dat zelfs de meest geavanceerde modellen, inclusief enkele van de grootste namen in AI, aanzienlijk worstelden. Het best presterende model, Claude Opus 4.6, slaagde erin de visuele look en de wiskundige structuur vrij dichtbij te brengen, maar maakte nog steeds fouten. Ondertussen presteerde een model genaamd GPT-5.4 verrassend slecht; het creëerde vaak te complexe tekeningen die wiskundig onjuist waren, wat suggereert dat "te veel nadenken" over het probleem het tekenproces juist kan verwarren. De onderzoekers merkten ook op dat terwijl eenvoudige meetkunde beheersbaar werd voor deze AI's, complexere onderwerpen zoals statistische grafieken of abstracte topologische vormen een grote hindernis bleven.
Uiteindelijk suggereert het artikel dat we ons nog in de beginfase van deze technologie bevinden. Hoewel AI nu in staat is om degelijke diagrammen te genereren, heeft het de "perfecte precisie" die nodig is voor serieuze wiskunde en wetenschap nog niet volledig onder de knie. Het team heeft al hun data, code en testinstrumenten beschikbaar gesteld voor iedereen, in de hoop dat door precies aan te geven waar deze modellen falen, we kunnen helpen bij het bouwen van de volgende generatie AI die eindelijk een perfecte cirkel kan tekenen, elke keer weer.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.