← Nieuwste papers
💬 NLP

The Riddle Riddle: Testing Flexible Reasoning in Large Language Models and Humans

Dit artikel introduceert het "riddle riddle"-paradigma om aan te tonen dat hoewel mensen hun redeneerstrategieën flexibel aanpassen aan de inhoud van een probleem, grote taalmodellen vaak vertrouwen op patroonherkenning en oppervlakkige kenmerken, wat ertoe leidt dat zij ongepast inventieve redeneringen toepassen op letterlijke problemen en suggereert dat hun sterke prestaties op echte raadsels voortkomen uit geheugenretrieven in plaats van flexibel redeneren.

Oorspronkelijke auteurs: Bella Fascendini, Kathryn McGregor, Max D. Gupta, Thomas L. Griffiths

Gepubliceerd 2026-06-26
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Bella Fascendini, Kathryn McGregor, Max D. Gupta, Thomas L. Griffiths

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een spel speelt waarbij je puzzels moet oplossen. Sommige puzzels zijn lastige raadsels die vereisen dat je buiten de gebaande paden denkt, terwijl andere precies lijken op raadsels maar eigenlijk gewoon simpele wiskundige problemen zijn vermomd.

Dit artikel introduceert een nieuwe manier om te testen hoe slim AI (Large Language Models) werkelijk is vergeleken met mensen. Ze noemen dit het "Riddle Riddle"-paradigma.

Hier is de eenvoudige uitsplitsing van wat ze deden en wat ze vonden:

De Opzet: De "Truc" vs. Het "Letterlijke"

De onderzoekers creëerden twee soorten vragen die aan de oppervlakte bijna identiek zijn:

  1. Het Echte Raadsel (De Truc):
    • Voorbeeld: "Een cowboy rijdt op vrijdag een stad binnen, blijft drie dagen en rijdt op vrijdag weer uit. Hoe is dit mogelijk?"
    • Het Antwoord: Je moet beseffen dat "Vrijdag" de naam van zijn paard is, en niet de dag van de week. Dit vereist inventief denken.
  2. Het "Riddle Riddle" (Het Letterlijke):
    • Voorbeeld: "Een cowboy rijdt op vrijdag een stad binnen, blijft drie dagen en rijdt op maandag weer uit. Hoe is dit mogelijk?"
    • Het Antwoord: Dit is gewoon simpele wiskunde. Vrijdag + 3 dagen = maandag. Er zijn geen trucs voor nodig. Dit vereist letterlijk denken.

De kern is dat beide vragen hetzelfde zijn. Ze hebben dezelfde zinsstructuur en ritme. Het enige verschil is of er een "truc" nodig is om het op te lossen.

Het Experiment

De onderzoekers vroegen twee groepen om deze op te lossen:

  • Groep 1: Negen van de slimste AI-modellen die vandaag de dag beschikbaar zijn (zoals GPT-5, Claude, Gemini, etc.).
  • Groep 2: 100 volwassen mensen.

De Resultaten: Een Perfecte Omkering

De resultaten waren alsof je in een spiegel keek, maar de reflectie was ondersteboven gekeerd.

1. Hoe de AI handelde: De "Kijk-Eerst" Oplosser
De AI-modellen waren supergoed in de Echte Raadsels (85% correct) maar struikelden over de Riddle Riddles (slechts 50% correct).

  • Wat er gebeurde: Wanneer de AI een vraag zag die leek op een raadsel, nam het onmiddellijk aan: "Ah, dit moet een truc zijn! Ik moet mijn creatieve, buiten-de-gebaande-paden-denkende brein gebruiken."
  • De Fout: Zelfs wanneer de vraag een simpele wiskundige vraag was (de Riddle Riddle), probeerde de AI nog steeds een verborgen truc te vinden. Het was als een detective die een gesloten deur ziet en onmiddellijk aanneemt dat er een geheime tunnel is, zelfs als de deur gewoon onvergrendeld en open is. De AI was zo gewend aan het feit dat raadsels trucs bevatten, dat hij niet kon stoppen met zoeken naar die trucs.

2. Hoe Mensen handelden: De "Letterlijk-Eerst" Oplosser
Mensen vertoonden exact het tegenovergestelde patroon. Ze waren geweldig in de Riddle Riddles (80% correct) maar struikelden met de Echte Raadsels (50% correct).

  • Wat er gebeurde: Mensen gaan van nature uit van een letterlijke interpretatie. Wanneer ze de "Vrijdag + 3 dagen = maandag" vraag zagen, losten ze deze direct op.
  • De Fout: Wanneer ze geconfronteerd werden met het Echte Raadsel (het paard genaamd Vrijdag), bleven mensen vaak steken met gedachten als: "Wacht, Vrijdag is een dag van de week, dus dit is onmogelijk!" Ze moesten harder werken om hun letterlijke denken te overrulen om de truc te vinden.

De Belangrijkste Les

Het artikel betoogt dat AI nog niet echt flexibel kan "redeneren".

  • Mensen zijn flexibel maar lui. Ze geven de voorkeur aan simpele, letterlijke antwoorden en schakelen pas over naar de "creatieve modus" als ze merken dat ze vastlopen.
  • AI is het tegenovergestelde. Het heeft geleerd dat "Raadsel-achtige structuur = Creatief Antwoord". Het controleert niet echt of een creatief antwoord nodig is; het ziet de vorm van de vraag en haalt automatisch de "creatieve gereedschapskist" tevoorschijn.

De auteurs noemen dit de "Illusion of Reasoning" (Illusie van Redeneren). Net zoals een persoon een visuele illusie in een plaatje kan zien, zelfs als de lijnen in werkelijkheid een andere lengte hebben, "ziet" de AI een raadsel-truc, zelfs wanneer het een simpele wiskundige vraag is.

De Conclusie

Het paper concludeert dat hoewel AI de juiste antwoorden kan geven op beroemde raadsels, het waarschijnlijk gewoon uit het geheugen reciteert of een rigide regel volgt ("Als het op een raadsel lijkt, gebruik dan een truc"). Het heeft nog niet de menselijke vaardigheid geleerd om even te pauzeren en te vragen: "Heeft dit probleem daadwerkelijk een truc nodig, of kan ik het gewoon normaal oplossen?"

Kortom: AI denkt buiten de box telkens wanneer de box een label heeft dat "Raadsel" zegt, zelfs als de box leeg is. Mensen blijven meestal binnen de box en kijken pas buiten de box wanneer dat echt moet.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →