← Nieuwste papers
💬 NLP

Do AI Models Perform Human-like Abstract Reasoning Across Modalities?

Dit artikel toont aan dat het evalueren van abstract redeneren bij AI uitsluitend op basis van nauwkeurigheid misleidend is, aangezien het capaciteiten overschat in tekstgebaseerde taken waarbij modellen vertrouwen op oppervlakkige sluiproutes en ze onderschat in visuele taken waarbij modellen vaak de beoogde abstracties begrijpen ondanks het feit dat ze deze niet correct toepassen.

Oorspronkelijke auteurs: Claas Beger, Ryan Yi, Shuhao Fu, Kaleda Denton, Arseny Moskvichev, Sarah W. Tsai, Sivasankaran Rajamanickam, Melanie Mitchell

Gepubliceerd 2026-02-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Claas Beger, Ryan Yi, Shuhao Fu, Kaleda Denton, Arseny Moskvichev, Sarah W. Tsai, Sivasankaran Rajamanickam, Melanie Mitchell

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een docent bent die een puzzel aan een leerling geeft. De puzzel laat een paar voorbeelden zien van hoe een patroon verandert (zoals "verplaats het rode blok naar links") en vraagt de leerling vervolgens om diezelfde regel toe te passen op een nieuwe, onbekende afbeelding.

Een tijdlang hebben we AI getest op deze puzzels met behulp van een "scorekaart" die alleen telt hoe vaak de AI het uiteindelijke antwoord goed heeft. Als de AI de juiste afbeelding geeft, geven we het een A+.

Deze paper stelt een diepere vraag: Begreep de AI de regel echt, of had het gewoon geluk door een vreemde truc te ontdekken?

Hier is het verhaal van wat de onderzoekers hebben gevonden, eenvoudig uitgelegd:

1. De twee manieren om de test af te leggen

De onderzoekers testten top-AI-modellen (zoals OpenAI's o3, Claude en Gemini) op twee verschillende manieren:

  • De Tekstmodus: Ze voerden de puzzel aan de AI als een lijst met getallen en woorden (bijv. "Grid 1 heeft een rood vierkant op 2,2...").
  • De Visuele Modus: Ze lieten de AI een echte afbeelding van de puzzel zien, precies zoals een mens die zou zien.

2. De "Tekst"-verrassing: Hoge scores, oppervlakkig begrip

Wanneer de AI de test in Tekstmodus maakte, deed het het ongelooflijk goed. Sterker nog, de beste AI (o3) haalde een hogere score dan de gemiddelde mens.

Maar hier is de adder onder het gras: De onderzoekers vroegen de AI om uit te leggen hoe het de puzzel had opgelost.

  • Mensen legden het meestal uit aan de hand van het echte concept, zoals "Verwijder de objecten boven en onder."
  • De AI gaf vaak verklaringen die technisch gezien correct waren voor de specifieke voorbeelden die getoond werden, maar die het grote plaatje misten.

De Analogie: Stel je een leerling voor die een wiskundetoets maakt. De docent vraagt: "Wat is 2 + 2?" De leerling antwoordt "4". De docent vraagt: "Hoe kwam je daarbij?" De leerling zegt: "Ik keek op de klok en de wijzers stonden op 4, dus ik gokte 4."
Het antwoord was juist, maar de redenering was een "shortcut" (een kortere weg). De AI deed dit constant. Het ontdekte accidentele patronen in de getallen (zoals "rood is altijd nummer 3, dus ik verwijder nummer 3") in plaats van het concept van een "object" te begrijpen.

Het Oordeel: In tekstmodus overschatten de hoge scores van de AI de werkelijke intelligentie. Het was goed in gokken, maar niet altijd goed in redeneren.

3. De "Visuele" verrassing: Lage scores, verborgen genie

Toen de onderzoekers overschakelden naar de Visuele Modus (het tonen van afbeeldingen), stortten de scores van de AI in. De AI gaf het uiteindelijke antwoord veel vaker fout dan mensen.

Echter, de onderzoekers keken opnieuw naar de verklaringen van de AI.
Ze ontdekten iets verrassends: Zelfs wanneer de AI de uiteindelijke afbeelding fout had, was de uitleg van de regel vaak wel correct!

De Analogie: Stel je een briljante architect voor die perfect kan beschrijven hoe je een huis bouwt ("Zet de bakstenen in een cirkel en voeg dan een dak toe"). Maar wanneer die architect daadwerkelijk probeert de stenen te leggen, blijft hij ze steeds laten vallen of legt hij ze op de verkeerde plek omdat zijn handen onhandig zijn.
De AI in de visuele modus was als deze architect. Het begreep het abstracte concept (de "regel") perfect, maar het worstelde met het "zien" van de afbeelding duidelijk genoeg om de regel correct toe te passen. Het kon niet precies bepalen hoe groot het raster was of waar de objecten zich bevonden.

Het Oordeel: In visuele modus onderschatten de lage scores van de AI de werkelijke intelligentie. De AI begreep de logica wel goed, maar faalde in het "perceptie"-gedeelte van de taak.

4. Het "Tool"-effect

De onderzoekers gaven de AI ook een "rekenmachine" (Python-code) om te helpen.

  • In Tekstmodus: De rekenmachine hielp niet veel. De AI was al goed in de logica, maar slecht in de shortcuts.
  • In Visuele Modus: De rekenmachine hielp enorm veel. Wanneer de AI code kon gebruiken om naar de afbeelding te "kijken" en pixels te tellen, gingen de scores omhoog. Dit bewees dat de AI niet "dom" was in de logica; het had alleen hulp nodig om de afbeelding te zien.

De Grote Conclusie

Als je alleen naar de uiteindelijke score kijkt (de "A+"), zou je kunnen denken dat AI een genie is in tekstmodus maar een mislukking in visuele modus.

Maar wanneer we kijken naar hoe ze denken:

  • In Tekst: Zijn ze vaak aan het "valsspelen" met slimme shortcuts die in de echte wereld niet werken.
  • In Visueel: Zijn ze "onhandige" genieën die de regels begrijpen, maar ze niet helemaal goed kunnen uitvoeren.

De paper concludeert dat om echt te weten of AI "menselijk" wordt, we niet alleen kunnen controleren of het antwoord juist is. We moeten ook controleren of de redenering juist is. Anders zijn we ofwel te enthousiast over hun tekstvaardigheid, ofwel onderschatten we hun visuele potentieel.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →