GeoBuildBench: A Benchmark for Interactive and Executable Geometry Construction from Natural Language
Dit artikel introduceert GeoBuildBench, een nieuwe benchmark bestaande uit 489 Chinese meetkundeproblemen die de vaardigheid van multimodale agenten evalueert om uitvoerbare domeinspecifieke taalprogramma's te genereren voor het construeren van meetkundige diagrammen uit natuurlijke taal, waarbij significante uitdagingen in structurele nauwkeurigheid en constraint-fulfilment aan het licht komen ondanks een redelijke initiële prestatie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot leert hoe je een perfect geometrisch vorm moet tekenen, uitsluitend op basis van een mondelinge beschrijving, zoals "Teken een driehoek waarbij één zijde twee keer zo lang is als de andere, en de bovenste hoek 90 graden bedraagt."
De meeste huidige AI-modellen zijn als studenten die goed zijn in het gissen van het antwoord op een meerkeuzetoets of het beschrijven hoe een afbeelding eruitziet. Maar deze paper introduceert een nieuwe uitdaging genaamd GeoBuildBench, die test of een AI daadwerkelijk het tekenen stap voor stap kan uitvoeren, strikte regels volgt en zijn eigen fouten corrigeert wanneer de tekening er verkeerd uitziet.
Hier is een uiteenzetting van de paper met eenvoudige analogieën:
1. Het Probleem: De "Goedkope Truc" versus de "Bouwtekening"
Vroeger vroegen onderzoekers AI-modellen om naar een meetkundig probleem en een afbeelding te kijken, en vervolgens gewoon te zeggen: "Het antwoord is 45 graden." De AI kon vaak het juiste getal raden door patronen in de tekst of het beeld te herkennen, zelfs als het niet echt begreep hoe de vorm was opgebouwd.
GeoBuildBench verandert het spel. In plaats van om een antwoord te vragen, vraagt het de AI om te handelen als een architect.
- De Taak: De AI moet een computerprogramma schrijven (een reeks instructies) om de vorm vanaf nul op te bouwen.
- De Haken: De AI kan de vorm niet zomaar "zeggen" dat hij bestaat. Het moet de vorm fysiek construeren met behulp van een speciale, beperkte woordenschat (een "Domain-Specific Language" of DSL).
- De Analogie: Stel je voor dat je het spel "Lego" speelt waarbij je niet zomaar kunt zeggen: "Bouw een toren." Je moet specifieke commando's geven: "Plaats hier een rode baksteen, en daarbovenop een blauwe baksteen." Als je probeert een baksteen in de lucht te plaatsen, zegt de spelengine: "Fout! Die baksteen bestaat nog niet."
2. De Omgeving: De "Strenge Leraar"
De onderzoekers bouwden een digitaal speelveld waar de AI probeert deze vormen te bouwen.
- De Lus: De AI schrijft een reeks instructies -> De computer probeert het te bouwen -> De computer controleert of de vorm geldig is.
- De Feedback: Als de AI probeert een lijn te tekenen die nergens mee verbonden is, of als het vergeet een cirkel te tekenen die vereist was, zegt de computer direct: "Je hebt een cirkel gemist!" of "Je probeerde twee lijnen te verbinden die parallel zijn en nooit zullen samenkomen!"
- Het Doel: De AI moet blijven proberen, de feedback lezen en zijn instructies herschrijven totdat de vorm perfect is.
3. De Dataset: 489 "Leerboek" Puzzels
Het team creëerde een benchmark met 489 meetkundige problemen afkomstig uit Chinese wiskundeleerboeken.
- De Filter: Ze waren zeer zorgvuldig om problemen te verwijderen die afhankelijk waren van het bekijken van een afbeelding om de tekst te begrijpen (bijvoorbeeld: "Zoals getoond in Figuur 1, is hoek A..."). Ze behielden alleen problemen waarbij de tekst alleen voldoende informatie bood om de vorm te bouwen.
- De Variatie: De problemen variëren van "Zeer Makkelijk" (Niveau 1) tot "Moeilijk" (Niveau 4), en omvatten driehoeken, cirkels en complexe hoeken.
4. De Resultaten: De "Hallucinaties" van de AI
De onderzoekers testten verschillende toonaangevende AI-modellen (zoals GPT-5.1, Gemini en anderen) in deze omgeving. Hier is wat ze vonden:
- Het Goede Nieuws: De slimste modellen (GPT-5.1 en Gemini) kregen ongeveer 75-79% van de problemen goed. Ze konden vaak de juiste vorm bouwen.
- Het Slechte Nieuws: Zelfs de beste modellen hadden moeite met structurele hallucinaties.
- Wat is een hallucinatie hier? Het is wanneer de AI een instructie schrijft zoals "Teken een lijn die Punt X en Punt Y verbindt", maar het heeft Punt X of Punt Y eerder in de instructies nooit daadwerkelijk gecreëerd. Het is alsof een kok zegt: "Voeg de geheime saus toe", zonder ooit de saus te hebben gemaakt.
- Het "Ongedefinieerde Referentie" Probleem: De meest voorkomende fout was het refereren naar objecten die nog niet bestonden. De AI vergat bij te houden wat het al had gebouwd.
- Het Herstelprobleem: Wanneer de computer de AI vertelde: "Je hebt een fout gemaakt," konden de slimste modellen dit snel oplossen (meestal in 1 of 2 pogingen). De zwakkere modellen bleven dezelfde fout keer op keer maken, zonder in staat te zijn om van de feedback te leren.
5. De "Visuele" Verrassing
De onderzoekers testten wat er gebeurde als ze de AI een afbeelding gaven van de vorm die het op dat moment aan het bouwen was (visuele feedback).
- Het Resultaat: Het was een gemengd pakket. Voor sommige modellen hielp het zien van de afbeelding hen om betere ideeën te bedenken, maar het maakte hen ook verwarder over welke specifieke punten ze al hadden getekend. Het is alsof je een schilder een spiegel geeft: ze zien misschien hun fout, maar ze kunnen ook afgeleid raken en vergeten welke kwast ze vasthielden.
6. De Conclusie: "Waarschijnlijk" is niet hetzelfde als "Correct"
De belangrijkste les is dat er goed uitzien niet hetzelfde is als correct zijn.
- Een AI kan een afbeelding genereren die voor het menselijk oog eruitziet als een driehoek, maar als de computer de wiskunde controleert, raken de lijnen misschien niet echt elkaar, of zijn de hoeken verkeerd.
- GeoBuildBench bewijst dat hoewel AI goed wordt in het praten over meetkunde, het nog steeds moeite heeft om meetkunde te doen op een rigoureuze, stap-voor-stap, foutloze manier. Het benadrukt een kloof tussen "het antwoord raden" en "de waarheid bouwen".
Kortom: Deze paper bouwde een rigoureuze "rijexamen" voor AI-meetkundevaardigheden. Het vond dat hoewel sommige AI-bestuurders de bestemming kunnen bereiken, veel van hen nog steeds verkeerde afslagen nemen, vergeten om hun spiegels te controleren, en af en toe tegen muren rijden, zelfs als het eruit ziet alsof ze weten waar ze naartoe gaan.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.