Human-Level Reasoning: A Comparative Study of Large Language Models on Logical and Abstract Reasoning
Deze studie evalueert en vergelijkt de logische en abstracte redeneergaven van negen prominente Large Language Models met menselijke prestaties aan de hand van acht op maat gemaakte vragen, waarbij significante tekortkomingen in de deductieve vermogens van de modellen aan het licht komen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een kamer vol hebt met ongelooflijk getalenteerde bibliothecarissen. Deze bibliothecarissen (de Large Language Models, of LLM's) hebben bijna elk boek ter wereld gelezen. Ze kunnen feiten opzeggen, gedichten schrijven en talen vertalen sneller dan wie dan ook. Maar de vraag die dit artikel stelt is: Begrijpen ze eigenlijk wat ze lezen, of zijn ze gewoon heel goed in het raden van het volgende woord in een zin?
Om dit te ontdekken, heeft de auteur, Benjamin Grando Moreira, een "logica-sportschool" ingericht en 15 van deze digitale bibliothecarissen uitgenodigd om te strijden tegen een groep menselijke studenten en professoren.
Hier is een eenvoudige uitsplitsing van wat er gebeurde, gebruikmakend van enkele alledaagse metaforen.
De Test: Een Puzzeldoos, Geen Triviaquiz
In plaats van de modellen te vragen "Wie was de eerste president?" (wat ze uit het geheugen kunnen beantwoorden), gaf de onderzoeker ze 8 lastige puzzels. Deze puzzels waren als raadsels die de modellen dwongen om verborgen regels te ontdekken, in plaats van alleen feiten te herinneren.
Denk er zo over na:
- Het Menselijk Brein is als een detective die naar aanwijzingen kijkt, punten verbindt en zegt: "Aha! Ik zie het patroon!"
- Het AI-Brein is als een supersnelle patroonherkenningsmachine die zegt: "Ik heb dit woord eerder gezien, dus ik raad het volgende woord op basis van wat er meestal op volgt."
De 8 Uitdagingen (De "Obstacle Course")
Het papier testte de modellen op zaken zoals:
- Het Raadsel van de Dag van de Week: Als "ZON + 1 = MAA," wat is "DIEN + 2?" (De meeste modellen haalden dit, maar sommigen raakten in de war door de afkortingen).
- Het Olifantenlied: Een gek patroon waarbij het aantal keren dat je "bother" zegt, verandert op basis van of het aantal olifanten even of oneven is. Mensen zagen het patroon gemakkelijk; veel AI's bleven hangen in de herhaling.
- De Geheime Code: Een eenvoudige letterverschuiving (zoals A wordt B). De meeste modellen kraakten dit, maar sommige deden de hoofdlettergebruik verkeerd.
- De Strijkvragen bij Wiskunde: "Wat is 3 + 3 x 5?" Het juiste antwoord is 18. Maar de test gaf opties zoals 16, 20, 30 en 45. 18 was niet eens een optie!
- De Twist: Veel modellen (en sommige mensen) raakten in de war. Ze zagen dat de wiskunde klopte maar de opties fout waren, en sommigen kozen gewoon het "dichtstbijzijnde" foute antwoord in plaats van te zeggen: "Hé, geen van deze is juist."
- Het Maand-Mysterie: Dit was het moeilijkst. Er werd gevraagd om een verborgen code te vinden voor de maand "Mei". De code hield in dat je het nummer van de maand kwadrateerde (5 kwadraat = 25) en het aantal letters in het woord "Mei" telde (4 letters), en ze vervolgens aan elkaar plakte om 254 te krijgen.
- Het Resultaat: Mensen waren oké in dit, maar de AI's faalden grotendeels. Ze probeerden complexe wiskundige formules te gebruiken die niet pasten, in plaats van de simpele "plak de getallen aan elkaar"-truc te zien.
- De Taalwissel: Het matchen van Portugese maandafkortingen aan Spaanse namen. Mensen hadden moeite met dit als ze geen Spaans kenden, maar de AI's (die veel talen kennen) excelleerden hierin.
- De Tweelidige Dag: Een mix van Engelse en Portugese dagen van de week met een verborgen regel over wanneer de taal gewisseld moet worden. Zowel mensen als AI's vonden dit lastig.
- De Binaire Code: Getallen optellen die lijken op basis-10 (zoals 1000) maar eigenlijk in basis-2 (binair) zijn. Alleen de slimste modellen realiseerden zich: "Wacht, dit zijn geen normale getallen!" en losten het op.
Het Scorebord: Wie Won?
De onderzoeker gaf punten voor:
- 10 punten: Het juiste antwoord geven.
- 5 punten: De logica goed hebben, zelfs als het uiteindelijke getal fout was.
- 0 punten: Het fout hebben of opgeven.
De Resultaten:
- De Mensen: De professoren (de experts) presteerden het beste overall, vooral op de lastige puzzels. De studenten deden het goed, maar hadden meer moeite met de abstracte raadsels.
- De AI's: Gemiddeld scoorden de AI's ongeveer 73 punten van de 100, terwijl de mensen ongeveer 70 scoorden.
- Wacht, wonnen de AI's niet? Ja, een klein beetje! Maar hier is de crux: De AI's waren geweldig in de makkelijke dingen (zoals maanden in verschillende talen kennen) en verschrikkelijk in de vreemde, abstracte zaken (zoals het olifantlied of de verborgen nummercode).
- De beste AI-modellen (zoals GPT-4o en Claude) scoorden bijna perfect, maar de zwakkere modellen (zoals Sabiá 3) scoorden erg laag.
De Belangrijkste Conclusie
Het artikel concludeert dat deze AI-modellen als briljante papegaaien zijn. Ze kunnen menselijke gesprekken nabootsen en standaardproblemen perfect oplossen. Echter, wanneer je ze vraagt om buiten de kaders te denken, een vreemd patroon te herkennen, of te beseffen dat een vraag een instinker is, struikelen ze vaak.
- Mensen zijn beter in "vloeiende intelligentie" — het on the fly ontdekken van nieuwe regels.
- AI's zijn beter in "gekristalliseerde intelligentie" — het gebruiken van de enorme hoeveelheid data die ze al hebben opgeslagen.
De studie laat zien dat hoewel AI angstaanjagend goed wordt in praten, het nog steeds niet echt het kunstje beheerst om te denken zoals een mens dat doet, vooral wanneer de regels van het spel verborgen of ongewoon zijn. De AI is nog steeds grotendeels aan het raden op basis van wat het eerder heeft gezien, in plaats van werkelijk de logica achter de puzzel te begrijpen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.