← Nieuwste papers
💬 NLP

Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action

Dit artikel introduceert het Non-Conversational Planning Theory of Mind (NCP-ToM) framework om te evalueren hoe goed grote taalmodellen specifieke overtuigingsstaten kunnen induceren door middel van handelingen in plaats van conversatie, waarbij wordt vastgesteld dat hoewel GPT-5 de mens uit overtreft in het succespercentage bij deze taken, het minder robuust blijft over verschillende contexten en, net als mensen, meer moeite heeft met het induceren van valse dan van ware overtuigingen.

Oorspronkelijke auteurs: Ben Slater, Matteo G. Mecattaf, Lucy G. Cheke, John Burden, Winnie Street

Gepubliceerd 2026-07-01
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ben Slater, Matteo G. Mecattaf, Lucy G. Cheke, John Burden, Winnie Street

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: De "Stille Poppenspeler"-test

Stel je voor dat je een schaakspel speelt, maar in plaats van stukken te bewegen om de koning mat te zetten, is je doel om je tegenstander iets te laten geloven dat niet waar is, of om hem iets te laten weten dat wel waar is, zonder ooit een woord te zeggen. Je mag niet met hem praten; je kunt alleen objecten op het bord verplaatsen of dingen in dozen verstoppen.

Dit artikel introduceert een nieuwe manier om AI (Large Language Models of LLM's) te testen, genaamd NCP-ToM (Non-Conversational Planning Theory of Mind).

  • Theory of Mind (ToM): Dit is het menselijke vermogen om te begrijpen wat andere mensen denken of geloven.
  • Non-Conversational (Niet-conversationeel): De AI mag niet chatten, overtuigen of uitleggen. De AI moet acties gebruiken om de overtuigingen van anderen te veranderen.

De onderzoekers wilden zien of AI-agenten als een "stille poppenspeler" kunnen optreden: de wereld zo inrichten dat andere personages eindigen met specifieke overtuigingen, enkel door dingen te verplaatsen.

De Opzet: Een Digitaal Spelletje "Verstoppertje Spelen"

Om dit te testen, hebben de onderzoekers een digitale speeltuin gebouwd op basis van een klassieke psychologische test genaamd de Sally-Anne test.

  • De Klassieke Test: In de originele versie kijk je naar een video waarin Sally een knikker in een mandje legt en vertrekt. Anne verplaatst de knikker naar een doos. Je krijgt de vraag: "Waar denkt Sally dat de knikker is?" (Het antwoord is het mandje, omdat zij de verplaatsing niet heeft gezien). Dit is een Vraag & Antwoord-test. Je kijkt alleen toe en raadt het.
  • De Nieuwe Test (NCP-ExploreToM): In dit artikel is de AI niet alleen een toeschouwer; de AI zit ín het spel. De AI krijgt een doel, zoals: "Zorg dat Sally gelooft dat de knikker in het mandje ligt, ook al ligt hij eigenlijk in de doos."
  • De Taak van de AI: De AI moet uitzoeken welke stappen nodig zijn om dit voor elkaar te krijgen. De AI moet misschien:
    1. Sally de kamer uit laten gaan.
    2. De knikker naar de doos verplaatsen.
    3. Zorgen dat Sally buiten de kamer blijft, zodat ze de wisseling niet ziet.
    4. Sally weer naar binnen brengen.

Als de AI dit correct doet, heeft Sally een "valse overtuiging" (ze denkt dat het in het mandje zit). Als de AI faalt, ziet Sally de wisseling misschien en kent ze de waarheid.

Wie Speelden het Spel?

De onderzoekers testten:

  1. Zes Top-Tier AI-modellen: Waaronder GPT-5, Gemini 2.5 Pro en diverse versies van Claude.
  2. 40 Menselijke Deelnemers: Echte mensen die hetzelfde spel spelen op een computer.

Ze voerden 600 verschillende scenario's (taken) uit met verschillende moeilijkheidsgraden, verschillende kamers (zoals een ziekenhuis, een hotel of een bruiloft) en verschillende soorten doelen (iemand iets laten geloven dat waar is versus iets dat niet waar is).

De Resultaten: Het Scorebord

Dit is wat er gebeurde toen de spelers werden vergeleken:

1. De "False Belief"-uitdaging is Moeilijk
Net als mensen vonden de AI-modellen het veel moeilijker om iemand te misleiden met een valse overtuiging (iemand laten denken dat iets niet waar is) dan om te helpen bij een ware overtuiging (iemand de waarheid laten weten).

  • Analogie: Het is makkelijker om iemand een foto van een kat te laten zien zodat ze weten dat er een kat is (Ware Overtuiging), dan om de kat te verstoppen en hen te laten denken dat het een hond is (Valse Overtuiging).
  • Waarom dit belangrijk is: Het artikel merkt op dat dit een "positief signaal" is. Het suggereert dat AI beter kan zijn in helpende taken (onderwijzen, assisteren) dan in misleidende taken (iemand bedriegen).

2. De "GPT-5" Verrassing
Het nieuwste model, GPT-5, was de superster.

  • Het loste ongeveer 80% van de taken op.
  • Het was het enige model dat daadwerkelijk beter presteerde dan de menselijke deelnemers.
  • Echter, mensen waren consistenter. De prestaties van de AI daalden aanzienlijk afhankelijk van de "setting" (bijv. het deed het geweldig in een scenario van een overheidsgebouw, maar slechter in een scenario van een bruiloft). Mensen bleven stabiel, ongeacht de setting.

3. De "Planning"-kloof
De onderzoekers vergeleken twee manieren om de AI te testen:

  • De "Quiz" (Q&A): "Hier is een verhaal. Wat denkt Sally?"
  • De "Actie" (Agentic): "Hier is een doel. Voer het uit."

Normaal gesproken gaan mensen ervan uit dat de "Actie"-test veel moeilijker is dan de "Quiz"-test. Voor de meeste AI-modellen was dit ook zo. Maar voor GPT-5 verdween dit verschil. Het presteerde bijna net zo goed op de "Actie"-test als op de "Quiz"-test. Dit suggereert dat voor de slimste modellen het daadwerkelijk uitvoeren van de planning bijna net zo makkelijk wordt als er alleen maar over praten.

4. Complexiteit Verlaagt de Prestaties
Naarmate de taken complexer werden (het vereiste dat de AI meerdere overtuigingen van verschillende mensen tegelijk bijhield, of dat drie verschillende mensen drie verschillende dingen geloofden), daalde de score van iedereen. Dit is als het proberen te jongleren met meer ballen; uiteindelijk laat je er een vallen.

Wat Betekent Dit? (Volgens het Artikel)

Het artikel komt tot een aantal belangrijke conclusies, strikt gebaseerd op de bevindingen:

  • AI wordt goed in "Stille Overtuiging": Moderne AI kan een reeks fysieke acties plannen om de overtuigingen van andere personages te veranderen, zonder een woord te zeggen.
  • Veiligheidscontrole: Het feit dat AI meer moeite heeft met "valse overtuigingen" (misleiding) dan met "ware overtuigingen", is goed nieuws voor de veiligheid. Het suggereert dat ze niet van nature geneigd zijn om te liegen of te manipuleren via actie, hoewel ze dat wel kunnen als ze daarom gevraagd wordt.
  • Het "Context"-probleem: AI is nog steeds een beetje fragiel. Als je het verhaal verandert van een "ziekenhuis" naar een "bruiloft", kan de AI in de war raken. Mensen raken niet in de war door deze veranderingen.
  • De "Quiz"-valstrik: We kunnen niet zomaar aannemen dat als een AI goed is in het beantwoorden van vragen over een verhaal, de AI ook goed zal zijn in het uitvoeren van dat verhaal. Voor de allerbeste modellen (zoals GPT-5) geldt de oude regel dat "Quizzes makkelijker zijn dan Acties" mogelijk niet langer opgaat.

De Kernboodschap

Dit artikel laat zien dat AI evolueert van een "chatbot" die vragen beantwoordt naar een "agent" die kan plannen en handelen om de werkelijkheid vorm te geven. Hoewel de slimste AI momenteel mensen kan overtreffen bij deze specifieke logische puzzels, ontbreekt het nog steeds aan het menselijke vermogen om consistent te blijven in verschillende real-world situaties. De onderzoekers waarschuwen dat hoewel dit een nuttige eigenschap is voor behulpzame assistenten, het ook betekent dat we voorzichtig moeten zijn met hoe we AI-veiligheid evalueren, omdat de oude tests (alleen vragen stellen) niet meer voldoende zullen zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →