← Nieuwste papers
💬 NLP

Theory-Grounded Evaluation of Human-Like Fallacy Patterns in LLM Reasoning

Dit onderzoek toont aan dat de fouten van taalmodellen bij logisch redeneren steeds vaker overeenkomen met voorspelde menselijke denkfouten naarmate hun algehele capaciteit toeneemt, en dat het omkeren van de volgorde van premissen deze fouten aanzienlijk kan verminderen.

Oorspronkelijke auteurs: Andrew Keenan Richardson, Ryan Othniel Kearns, Sean Moss, Vincent Wang-Mascianica, Philipp Koralus

Gepubliceerd 2026-03-24
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Andrew Keenan Richardson, Ryan Othniel Kearns, Sean Moss, Vincent Wang-Mascianica, Philipp Koralus

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Titel van het Onderzoek: Waarom slimme AI's soms net zo domme fouten maken als mensen.

Stel je voor dat je een groep zeer intelligente studenten hebt. Ze kunnen moeilijke wiskundeproblemen oplossen, gedichten schrijven en zelfs medische diagnoses stellen. Maar als je ze een logische puzzel geeft, maken ze soms precies dezelfde rare fouten als een gemiddelde mens.

Dit is wat onderzoekers van de Universiteit van Oxford hebben ontdekt. Ze hebben gekeken of de fouten die Large Language Models (LLMs) – de "hersenen" achter chatbots zoals ChatGPT – maken, lijken op de bekende, voorspelbare fouten die mensen maken.

Hier is de uitleg, vertaald naar alledaags taalgebruik:

1. Het Experiment: De "Logische Trap"

De onderzoekers gebruikten een speciaal recept (een theorie genaamd ETR) om logische puzzels te maken die als een valstrik werken.

  • De Analogie: Stel je een magische deur voor. Als je de sleutel op de verkeerde manier vasthoudt, denk je dat de deur open gaat, maar in werkelijkheid blijft hij dicht. Mensen lopen hier vaak in de val.
  • Het Doel: Ze hebben 38 verschillende AI-modellen (van kleine tot zeer grote, slimme modellen) deze 383 "valstrik-puzzels" voorgelegd.

2. De Verassende Resultaten: Hoe slimmer, hoe menselijker (in fouten)

Je zou denken: "Hoe slimmer de AI, hoe minder fouten hij maakt." Dat klopt voor veel dingen, maar hier gebeurde er iets vreemds:

  • De "Slip-up" Trend: Naarmate de AI's slimmer werden (gemeten aan hun score in een wedstrijd genaamd Chatbot Arena), maakten ze niet minder fouten in dit specifieke type logica. Sterker nog: als ze een fout maakten, was het vaker een fout die exact leek op een menselijke fout.
  • De Metaphor: Denk aan een beginnende leerling die een fout maakt omdat hij de regels niet kent. Een meester die een fout maakt, doet dat vaak omdat hij in een psychologische valstrik trapt. De onderzoekers zagen dat de "meesters" (de slimste AI's) steeds vaker in diezelfde psychologische valstrikken trappen als mensen. Ze worden niet "logischer", ze worden "menselijker" in hun onlogische momenten.

3. De "Voorkeursvolgorde" Truc

Een van de coolste ontdekkingen heeft te maken met de volgorde van de regels.

  • De Menselijke Zwakte: Mensen zijn gek op volgorde. Als je zegt: "A is waar, en B is waar", denken we anders na dan als je zegt: "B is waar, en A is waar". Dit heet het orde-effect.
  • De AI-Truc: De onderzoekers draaiden de volgorde van de zinnen om.
    • Origineel: AI maakt een menselijke fout.
    • Omgedraaid: De AI ziet de valstrik plotseling niet meer en geeft het juiste antwoord!
  • De Les: Dit bewijst dat AI's niet alleen "rekenen" zoals een computer, maar ook "lezen" en "reageren" zoals mensen, inclusief onze verwarring over de volgorde van informatie.

4. Waarom is dit belangrijk?

Je zou kunnen denken: "Ach, het zijn maar fouten in een puzzel." Maar dit is cruciaal voor de toekomst:

  • Vertrouwen: Als we AI's gebruiken in ziekenhuizen of rechtbanken, willen we dat ze logisch nadenken. Als ze steeds dezelfde menselijke valstrikken inlopen, kunnen ze gevaarlijke beslissingen nemen die lijken op die van een mens in paniek.
  • Geen "Magische" Oplossing: Het onderzoek laat zien dat het simpelweg "slimmer" maken van AI (meer data, grotere modellen) niet automatisch zorgt voor perfect logisch denken. We moeten de AI's leren om niet in die menselijke valstrikken te trappen.

Samenvattend in één zin:

De slimste AI's van vandaag zijn zo goed geworden in het nabootsen van menselijk denken, dat ze helaas ook de menselijke "blinde vlekken" en logische valstrikken hebben overgenomen; en soms helpt het simpelweg om de volgorde van de zinnen om te draaien om ze weer op het juiste spoor te krijgen.

De Kernboodschap: AI wordt niet alleen slimmer, het wordt ook steeds meer "menselijk" – en dat betekent helaas dat het ook steeds menselijker fouten gaat maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →