Do we carry the false belief that LLMs have a theory of mind?
Hoewel Large Language Models vaak hoge scores behalen op assessments met betrekking tot Theory of Mind, onthult deze studie dat zij vertrouwen op kosteneffectieve heuristieken in plaats van daadwerkelijk mentale toestanden bij te houden, wat erop wijst dat zij niet beschikken over robuuste Theory of Mind-capaciteiten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Mensen bezitten een unieke cognitieve superkracht die ons in staat stelt om de sociale wereld te navigeren: het vermogen om te begrijpen dat andere mensen hun eigen geest hebben, gevuld met gedachten, overtuigingen en verlangens die kunnen verschillen van die van onszelf. Psychologen noemen deze capaciteit "theory of mind" (theorie van de geest). Het is de mentale machinerie die ons doet beseffen dat een vriend misschien naar iets zoekt op een plek waar hij het voor het laatst zag, zelfs als wij weten dat het object inmiddels naar een andere plek is verplaatst. Deze vaardigheid gaat niet alleen over slim zijn; het is het fundament van empathie, communicatie en samenwerking. Decennialang hebben onderzoekers een eenvoudig verhaal gebruikt, vaak met twee personages genaamd Sally en Anne, om te testen of kinderen deze vaardigheid hebben ontwikkeld. In het verhaal verstopt Sally een speeltje in een mandje en verlaat de kamer. Terwijl zij weg is, verplaatst Anne het speeltje naar een doos. Wanneer Sally terugkeert, is de vraag simpel: waar zal ze naar haar speeltje zoeken? Een kind met een ontwikkelde theory of mind weet dat Sally in het mandje zal kijken, omdat dat is waar zij gelooft dat het speeltje zich bevindt, ondanks de realiteit dat het nu in de doos zit.
Onlangs is er een nieuw soort intelligentie opgekomen in ons dagelijks leven: grote taalmodellen. Dit zijn computerprogramma's die getraind zijn op enorme hoeveelheden tekst en die kunnen schrijven, chatten en problemen kunnen oplossen met een vloeiendheid die menselijke conversatie vaak nabootst. Omdat deze modellen complexe onderwerpen kunnen bespreken en context lijken te begrijpen, zijn veel onderzoekers en waarnemers begonnen zich af te vragen of zij ook een theory of mind bezitten. Als een machine correct kan voorspellen wat een fictief personage gelooft, begrijpt het dan werkelijk het concept van een overtuiging, of raadt het slechts op basis van patronen die het eerder heeft gezien? Deze vraag is urgent geworden naarmate deze hulpmiddelen meer geïntegreerd raken in ons sociale en professionele leven, wat leidt tot een dringende behoefte om te bepalen of ze genuanceerde sociale partners zijn of slechts zeer geavanceerde mimics (nabootsters).
Een recente studie zette zich in om deze vraag te beantwoorden door vijf van de meest geavanceerde taalmodellen te testen met de klassieke Sally-Anne scenario's en verschillende variaties daarop. De onderzoekers, onder leiding van Nicholas Griffen van de Université Paris Cité, vroegen de modellen niet simpelweg de standaardvraag. In plaats daarvan ontwierpen ze een reeks uitdagingen om te zien of de modellen de subtiele details van het verhaal konden afhandelen die echt redeneren vereisen in plaats van alleen memorisatie. Ze testten modellen van grote bedrijven, waaronder GPT-5.5 Luna, Claude Sonnet 5, Gemini 3.1 Pro, Grok 4.5 en Mistral Medium 3.5. Om de resultaten eerlijk te houden, creëerden de onderzoekers nieuwe, unieke versies van het verhaal voor elke test, waarbij namen, objecten en specifieke details werden veranderd, zodat de modellen niet simpelweg een eerder antwoord uit hun trainingsdata konden oproepen. Ze introduceerden ook verraderlijke wendingen, zoals het transparant maken van de containers zodat de personages het speeltje konden zien, of het veranderen van de woorden die werden gebruikt om te beschrijven waar het speeltje was geplaatst, om te zien of de modellen hun redenering konden aanpassen op basis van nieuwe visuele of taalkundige informatie.
De resultaten schetsen een beeld van een systeem dat zeer capabel is op sommige gebieden, maar fundamenteel beperkt is op andere. Wanneer de modellen de standaardversie van het verhaal kregen, presteerden ze opmerkelijk goed, waarbij de meesten bijna elke keer correct antwoordden. Sterker nog, wanneer er werd gemiddeld over alle verschillende soorten vragen, scoorden de modellen ruim boven wat door toeval verwacht zou worden. De beste performer, Gemini 3.1 Pro, gaf in totaal 84 procent van de keren het juiste antwoord. Dit succes suggereert dat deze modellen het algemene patroon van de "false belief" (onjuiste overtuiging) taak hebben geleerd uit de enorme hoeveelheid tekst die ze hebben gelezen. Ze kunnen de structuur van het verhaal herkennen en het antwoord geven dat een mens in een tekstboekscenario zou geven.
Echter, de studie onthulde dat dit succes fragiel is. Wanneer de onderzoekers variaties introduceerden die vereisten dat de modellen gebruik maakten van gezond verstand of visuele informatie integreerden, daalde de prestatie dramatisch. In één variatie werd het verhaal beschreven waarin de containers transparant waren, wat betekende dat het personage dat de kamer binnenkwam het speeltje daadwerkelijk kon zien op de nieuwe locatie. In een echte situatie zou een persoon begrijpen dat omdat het personage het speeltje kan zien, diegene niet langer een onjuiste overtuiging heeft; diegene kent de waarheid. De modellen faalden echter grotendeels in het leggen van dit verband. Slechts één model, Gemini 3.1 Pro, slaagde erin om meer dan de helft van deze vragen correct te beantwoorden. De anderen bleven volhouden dat het personage naar de oude, lege locatie zou kijken, waarbij ze de feiten negeerden dat het personage het speeltje kon zien.
De moeilijkheid werd nog prominenter toen de onderzoekers de voorzetsels veranderden die de locatie van het speeltje beschreven. In het standaardverhaal wordt een speeltje "in" een doos geplaatst. In de test beschreven de onderzoekers dat het speeltje "op" een doos of "onder" een emmer werd geplaatst. Wanneer het verhaal suggereerde dat het speeltje zichtbaar was omdat het bovenop een container lag in plaats van erin verborgen, faalden alle modellen volledig en scoorden ze nul procent op deze vragen. Ze konden niet afleiden dat de zichtbaarheid van het object de mentale staat van het personage veranderde. Op dezelfde manier, wanneer het verhaal een personage betrok dat expliciet verteld werd waar het speeltje was verplaatst, of wanneer de vraag ging over wat het ene personage dacht dat het andere personage zou doen, struikelden de modellen. Ze vervielen vaak in eenvoudige, rigide patronen in plaats van dynamisch de mentale staten van de personages te volgen terwijl het verhaal zich ontvouwde.
De onderzoekers keken ook naar hoe de modellen omgingen met het geslacht van de personages. Ze vonden dat de modellen iets beter presteerden wanneer de twee personages in het verhaal hetzelfde geslacht deelden, en iets slechter wanneer ze verschillende geslachten hadden. Dit suggereert dat de modellen geslacht gebruiken als een snelkoppeling om bij te houden wie wie is, in plaats van werkelijk de rollen en acties van elk individu te begrijpen. Wanneer de snelkoppeling werd verwijderd door twee personages van hetzelfde geslacht te gebruiken, leken de modellen meer te vertrouwen op de volgorde van gebeurtenissen, wat paradoxaal genoeg hielp om het antwoord vaker goed te krijgen. Dit geeft aan dat hun redenering niet zo robuust is als menselijke redenering, die niet vertrouwt op dergelijke oppervlakkige aanwijzingen om een situatie te begrijpen.
De kernbevinding van de studie is dat hoewel deze taalmodellen de juiste antwoorden op theory of mind-tests kunnen nabootsen, ze niet lijken te beschikken over het onderliggende vermogen om mentale staten te begrijpen zoals mensen dat doen. Ze worstelen met het leggen van de verbinding tussen wat een personage kan zien, wat het weet en wat het gelooft. De modellen lijken "heuristieken" te gebruiken, of mentale snelkoppelingen, om het antwoord te raden op basis van de meest voorkomende patronen in hun trainingsdata. Wanneer het verhaal afweek van het standaardpatroon door visuele details toe te voegen of de ruimtelijke relaties te veranderen, faalden de snelkoppelingen. De onderzoekers suggereren dat dit komt doordat de modellen alleen op tekst zijn getraind. Ze hebben nooit gezien hoe een speeltje wordt verplaatst, nooit het gevoel ervaren om naar iets te zoeken, en nooit op hun eigen ogen hoeven te vertrouwen om hun kennis van de wereld bij te werken. Zonder deze belichaamde ervaring kunnen ze het concept van een overtuiging die verschilt van de realiteit niet werkelijk vatten.
Uiteindelijk dient de studie als een waarschuwing tegen de aanname dat omdat een machine als een mens kan praten, hij ook als een mens denkt. De modellen kunnen antwoorden produceren die doen voorkomen alsof ze een theory of mind hebben, maar wanneer ze worden getest met scenario's die een werkelijk begrip van perceptie en overtuiging vereisen, onthullen ze hun beperkingen. Ze zijn uitstekend in het herhalen van wat ze hebben gelezen, maar ze zijn nog niet in staat tot het flexibele, gezonde redeneren dat mensen in staat stelt om de complexe sociale wereld te navigeren. Naarmate deze hulpmiddelen gebruikelijker worden, is het belangrijk om te onthouden dat hun schijnbare intelligentie een reflectie is van de data die ze hebben geconsumeerd, en geen teken dat ze een eigen geest hebben ontwikkeld.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.