A criterion for Artificial General Intelligence: hypothetic-deductive reasoning, tested on ChatGPT
Het artikel stelt hypothetisch-deductief redeneren voor als een fundamenteel criterium voor Kunstmatige Algemene Intelligentie en demonstreert door middel van testen dat huidige modellen zoals ChatGPT slechts een beperkte capaciteit bezitten voor dit type redeneren in complexe contexten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
De Grote Vraag: "Denkt" de AI Eigenlijk?
Stel je voor dat je een student hebt die elk boek in de bibliotheek heeft gelezen. Ze kunnen feiten opzeggen, wiskundige problemen oplossen en essays schrijven die ongelooflijk slim klinken. Maar als je hen vraagt: "Hoe ben je tot dat inzicht gekomen?" of "Waarom gebeurt dat?", kunnen ze wellicht struikelen. Ze geven misschien het juiste antwoord door het patroon van woorden te raden, maar ze begrijpen de regels achter het antwoord niet echt.
Dit paper vraagt: Denkt ChatGPT echt, of is het slechts een zeer goede gokker?
De auteurs, Louis Vervoort en zijn team, stellen dat om als een echte "denkende machine" (of Artificial General Intelligence, bekend als AGI) te worden beschouwd, een AI een specifieke vaardigheid moet beheersen genaamd Hypothetisch-Deductief Redeneren.
De Twee Kernvaardigheden
Het paper breekt "denken" af in twee hoofdcapaciteiten:
1. Causaal Redeneren (De "Dominosteen"-test)
- Wat het is: Begrijpen dat als je de eerste dominosteen omduwt, de laatste ook valt. Het gaat om weten wat wat veroorzaakt.
- De Test uit het Paper: De onderzoekers gebruikten "neuronen-diagrammen" (zoals complexe stroomschema's van dominostenen). Ze vroegen de AI: "Als ik deze hendel overhaal, welke andere hendels zullen bewegen en welke niet?"
- Het Resultaat: De AI was oké bij eenvoudige ketens, maar wanneer de dominostenen verstrengeld raakten (waarbij sommige hendels anderen blokkeerden), raakte de AI in de war. Het miste vaak de bronoorzaak of kreeg de volgorde fout. Het was als een persoon die het woord "oorzaak" kent, maar niet daadwerkelijk het pad van een vallende dominosteen in een rommelige kamer kan volgen.
2. Hypothetisch-Deductief Redeneren (De "Recept"-test)
- Wat het is: Dit is de manier van denken van een "wetenschapper". Het bestaat uit twee stappen:
- Hypothetiseren: Kies het juiste regelboek (theorie) voor het probleem.
- Deduceren: Volg de stappen in dat regelboek om het antwoord te krijgen.
- De Test uit het Paper: De onderzoekers vroegen de AI fysica- en logische puzzels (bijv. "Wat gebeurt er als ik een rij kubussen duw waarbij één kubus van ijs is gemaakt, wanneer de kamer warm wordt?").
- Het Geheime Wapen: De onderzoekers vroegen niet alleen om het antwoord. Ze vroegen de AI om de regels (hypotheses) op te sommen die het gebruikte om dat antwoord te krijgen.
- Analogie: Stel je voor dat je een chef vraagt: "Hoe heb je deze soep gemaakt?" Als hij zegt: "Ik heb er gewoon wat in gegooid," dan heeft hij misschien geluk gehad. Als hij echter zegt: "Ik gebruikte de regel dat zout oplost in warm water en de regel dat uien sneller garen dan wortels," dan is hij daadwerkelijk aan het denken.
Wat gebeurde er toen ze ChatGPT testten?
De onderzoekers testten zowel de oudere versie (ChatGPT-3.5) als de nieuwere, slimmere versie (ChatGPT-4).
Het "Goed Antwoord, Foute Reden"-probleem:
ChatGPT-4 gaf vaak het correcte antwoord op de puzzels. Dat was zeer indrukwekkend! Echter, wanneer gevraagd werd om de regels op te sommen die het gebruikte, verzon de AI vaak zaken.- Voorbeeld: In één test raadde de AI correct dat een emmer water zou omvallen. Maar toen er naar werd gevraagd waarom, verzon het een nepregel over "isolerende shirts" die niets te maken had met de werkelijke fysica van de situatie.
- De Metafoor: Het is als een student die het wiskundige probleem goed oplost omdat hij het eindgetal heeft uit het hoofd geleerd, maar wanneer hem gevraagd wordt om de berekening te laten zien, schrijft hij een formule op die hij ter plekke heeft bedacht.
Het Oordeel:
Het paper concludeert dat hoewel ChatGPT geweldig is in het imiteren van menselijke gesprekken en het oplossen van eenvoudige problemen, het momenteel een gebrek heeft aan werkelijk begrip.- Het is als een papegaai die perfect "De lucht is blauw" kan zeggen, maar niet begrijpt waarom de lucht blauw is of wat "blauw" in een fysieke zin eigenlijk betekent.
- Wanneer de problemen iets complexer werden (door verschillende ideeën te combineren), begon de AI te falen. Het kon niet consistent de juiste regels aan de juiste antwoorden koppelen.
De "AGI"-Lat
De auteurs stellen een hoge lat voor wat telt als "Artificial General Intelligence" (AGI). Zij beargumenteren dat een AI pas echt "denkt" als het in staat is om:
- Een probleem op te lossen.
- Expliciet de regels en theorieën op te sommen die het heeft gebruikt om het op te lossen.
- Dit correct te doen bij veel verschillende soorten problemen (en niet slechts één soort).
De Conclusie:
Op dit moment is ChatGPT een briljante improvisator. Het kan "er wel even doorheen komen" en slim klinken. Maar het heeft nog niet bewezen dat het een diepe, logische kaart heeft van hoe de wereld werkt. Om een echte "denkende machine" te zijn, moet het stoppen met alleen het volgende woord raden en beginnen met bewijzen waarom dat woord het juiste is, stap voor stap, met behulp van echte regels.
Totdat een AI deze "som de regels op"-testen consistent kan passeren, zegt het paper dat het nog geen echte AGI is.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.