← Nieuwste papers
💬 NLP

GEB-Bench: Abstract Structures Told in Many Voices

GEB-Bench introduceert een nieuwe benchmark die het vermogen van AI-modellen evalueert om abstracte structurele motieven over diverse modaliteiten heen te herkennen en in kaart te brengen, wat een consistente en wetmatige kloof onthult tussen herkenning met één stem en abstractie over meerdere stemmen heen die zelfs in frontier-modellen voortduurt.

Oorspronkelijke auteurs: Tong Zhang, Zhiyuan Shi, Yun Peng, Tao Xie

Gepubliceerd 2026-08-10
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tong Zhang, Zhiyuan Shi, Yun Peng, Tao Xie

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Grote Vormveranderer-test

Stel je voor dat je naar een rivierdelta kijkt die uitmondt in de oceaan. Stel je nu voor dat je naar een grillige blikseminslag in de lucht kijkt. Voor een mens zien deze er volkomen verschillend uit: de één is water en zand, de ander is vuur en lucht. Maar als je je ogen een beetje dichtknijpt en naar de vorm van de vertakkingen kijkt, zul je beseffen dat ze hetzelfde geheime blauwdruk delen. Ze volgen beide een patroon van splitsen en verspreiden dat wiskundigen een "fractaal" of een specif kind van een vertakkingsstructuur noemen. Dit vermogen om het onzichtbare skelet onder het rommelige oppervlak te zien, is wat we abstract redeneren noemen. Het is de superkracht die ons laat begrijpen dat een verhaal over een koning en een verhaal over een computerprogramma beide over "macht" kunnen gaan, zelfs als de woorden totaal verschillend zijn.

Lange tijd hebben wetenschappers zich afgevraagd of kunstmatige intelligentie (AI) deze superkracht bezit. We hebben modellen gebouwd die een kat in een foto kunnen benoemen of een gedicht over de maan kunnen schrijven, maar kunnen ze ook de diepe, verborgen structuren zien die een rivier, een verhaal, een wiskundige vergelijking en een computercode met elkaar verbinden? Dit is de grote vraag. Als een AI dit niet kan, is het slechts een zeer chique papegaai die patronen nabootst zonder de "waarom" of de "hoe" erachter te begrijpen. Het is alsof je een robot hebt die het recept voor een cake kan opzeggen, maar niet begrijpt wat "bakken" eigenlijk betekent.

De "Veelstemmige" Uitdaging

Maak kennis met GEB-BENCH, een nieuwe, lastige test ontworpen om te zien of AI-modellen deze verborgen vormen kunnen herkennen. De makers noemden het naar een beroemd boek genaamd Gödel, Escher, Bach, dat gaat over hoe dezelfde vreemde, lusvormige ideeën voorkomen in wiskunde, kunst en muziek. De test is gebouwd op een simpel maar sluw idee: neem één enkele abstracte vorm (zoals een lus, een spiraal of een spiegelbeeld) en vertel hetzelfde verhaal over deze vorm in vier totaal verschillende "stemmen".

Denk aan het als een spelletje "Telefoontje" (of Telefoontje spelen), maar in plaats van een bericht te fluisteren, vertaal je een vorm.

  1. De Scène-stem: Een afbeelding van iets natuurlijks, zoals een nautilusschelp of een rivierdelta, waarbij de vorm verborgen zit in de compositie.
  2. De Verhalende stem: Een kort volksverhaal waarin de vorm verborgen zit in de manier waarop het verhaal wordt verteld. Bijvoorbeeld, het verhaal zou een "krabcanon" kunnen zijn, waarbij de tweede helft van het verhaal de eerste helft is, maar dan achterstevoren gelezen, woord voor woord.
  3. De Wiskundige stem: Een zuivere, precieze wiskundige stelling die de vorm beschrijft met behulp van symbolen.
  4. De Skelet-stem: Een kale lijntekening, zoals een draadmodel, die de vorm laat zien zonder al te veel details.

De crux? De makers van de test hebben alle "opvulling" weggehaald. Ze hebben ervoor gezorgd dat de rivierdelta en de blikseminslag geen enkele kleur of textuur delen. Ze hebben ervoor gezorgd dat de verhalen niet dezelfde woorden gebruiken. Het enige dat telt, is de onzichtbare structuur. De AI moet naar een plaatje van een rivier kijken en zeggen: "Ah, dit heeft dezelfde vorm als die wiskundige stelling!" of "Dit verhaal vertelt dezelfde structurele grap als die lijntekening."

De Bevindingen: De "Belasting" van Vertaling

De onderzoekers testten 37 verschillende AI-modellen, van de kleine, open-source modellen tot de enorme, superintelligente "frontier"-modellen van grote technologiebedrijven. Ze kwamen tot een fascinerende en ook een beetje teleurstellende conclusie: AI is goed in het herkennen van een vorm in één stem, maar verschrikkelijk in het overbrengen ervan naar een andere stem.

Stel je voor dat je een vriend heel goed kunt herkennen wanneer hij zijn favoriete rode jas draagt (de "Wiskundige Stem"). Maar als diezelfde vriend verschijnt in een clownspak (de "Verhalende Stem") of een camouflagepak (de "Scène-stem"), herken je hem misschien helemaal niet meer. De AI-modellen konden de vorm vaak wel identificeren wanneer deze werd gepresenteerd als een zuivere wiskundige vergelijking of een eenvoudige lijntekening. Maar zodra ze die vorm moesten vertalen naar een natuurlijke scène of een volksverhaal, stortte hun prestatie als een baksteen in.

Het artikel noemt dit de "mapping tax" (de vertaalbelasting). Elk model, hoe slim ook, moet deze belasting betalen. Zelfs de meest geavanceerde modellen, die meestal als de "frontier" van AI worden beschouwd, worstelen met het leggen van de verbanden tussen een afbeelding en een verhaal. De studie toonde aan dat terwijl deze modellen de vorm in de wiskundige stem in ongeveer 86% van de gevallen herkenden, hun vermogen om diezelfde vorm te koppelen aan een verhalende stem daalde naar ongeveer 44%. Het is een enorme kloof.

De "Formele Geometrie" Valstrik

Hier komt het echt bizarre deel: de AI gokte niet zomaan. Wanneer ze het fout hadden, maakten ze specifieke fouten die een logisch patroon volgden. Het artikel noemt dit "formele geometrie".

Stel je voor dat je probeert het verschil te zien tussen een "lus" (een cirkel) en een "vreemde lus" (een cirkel die op een verwarrende manier op zichzelf terugkeert). De AI-modellen verwarden deze twee vaak. Ze raakten niet in de war omdat de plaatjes op elkaar leken; ze raakten in de war omdat de wiskundige regels die de twee vormen definiëren, buren van elkaar zijn. Het is alsoam je leert autorijden en je blijft een "stopbord" verwarren met een "voorrangsbord" omdat het allebei rode achthoeken zijn, ook al zijn de regels voor het gebruik ervan verschillend.

De studie toonde aan dat de fouten van de AI veel voorspelbaarder waren op basis van deze wiskundige regels dan op basis van hoe de plaatjes er voor een mens uitzagen. Als je de AI een plaatje liet zien dat eruitzag als een "vreemde lus", zou het vaak een "lus" noemen, omdat die twee concepten in de wereld van de wiskunde vlak naast elkaar liggen. Dit suggereert dat de AI niet alleen een afbeelding "ziet", maar probeert deze te matchen met een bibliotheek van wiskundige concepten, maar daarbij vastloopt op de kleine lettertjes.

Het "Oppervlakte"-Probleem

De onderzoekers ontdekten ook dat de "ruis" van de echte wereld de zaken moeilijker maakt voor AI. Ze testten de modellen met afbeeldingen die varieerden van een eenvoudige lijntekening (zeer schoon) naar een rommelige, realistische foto (zeer chaotisch). Naarmate de afbeeldingen realistischer en "ruiziger" werden, verslechterde de prestaties van de AI.

Het is alsof je een liedje probeert te horen in een stille kamer versus in een luidruchtig, druk concert. De AI kan de melodie (de structuur) horen in de stille kamer, maar het omgevingsgeluid (de oppervlakkige details van de foto) overstemt het. De studie toonde aan dat het hebben van een groter, krachtiger model de AI niet immuun maakte voor deze ruis; het gaf het alleen een beetje meer "headroom" om de chaos aan te kunnen. Het loste het probleem niet op; het vertraagde alleen de crash.

De Kern van het Verhaal

De belangrijkste les van dit artikel is dat het herkennen van een structuur en het vertalen ervan naar verschillende werelden twee verschillende vaardigheden zijn. De AI-modellen die we vandaag de dag hebben, worden erg goed in het herkennen van structuren wanneer ze duidelijk worden gepresenteerd (zoals in de wiskunde of eenvoudige diagrammen). Maar ze worstelen nog steeds met het toepassen van dat begrip op de rommelige, complexe en diverse wereld van natuurlijke scènes en verhalen.

Het artikel zegt niet dat AI "kapot" is of dat het nooit zal leren. Het zegt alleen dat er op dit moment een specifieke, meetbare kloof bestaat. De modellen kunnen de vorm in het wiskundige boek zien, maar ze kunnen diezelfde vorm nog niet zien in de rivierdelta of het volksverhaal. En totdat ze die kloof kunnen overbruggen, missen ze het ware "aha!"-moment van abstract redeneren — het vermogen om te zien dat de rivier, het verhaal en de wiskunde allemaal hetzelfde lied zingen, alleen in verschillende stemmen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →