← Nieuwste papers
💬 NLP

Using Reinforcement Learning to Train Large Language Models to Explain Human Decisions

Dit artikel toont aan dat het inzetten van reinforcement learning met resultaatgerichte beloningen om vooraf getrainde grote taalmodellen te verfijnen, hen in staat stelt om als tweeledige cognitieve modellen te dienen die tegelijkertijd een sterke voorspellende nauwkeurigheid bereiken en interpreteerbare natuurlijke taalverklaringen genereren voor risicovolle menselijke keuzes.

Oorspronkelijke auteurs: Jian-Qiao Zhu, Hanbo Xie, Dilip Arumugam, Robert C. Wilson, Thomas L. Griffiths

Gepubliceerd 2026-02-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jian-Qiao Zhu, Hanbo Xie, Dilip Arumugam, Robert C. Wilson, Thomas L. Griffiths

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: AI Leren "Hardop Na te Denken"

Stel je voor dat je een superintelligente student hebt (een Large Language Model, of LLM) die ongelooflijk goed is in het raden wat je de volgende stap gaat zetten. Als je hen een lastig wiskundig probleem laat zien, kunnen ze meestal het juiste antwoord geven. Maar als je vraagt hoe ze dat antwoord hebben gevonden, zeggen ze misschien alleen maar: "Ik wist het gewoon," of geven ze een vage uitleg die niet echt ergens op slaat.

In de wereld van de psychologie willen wetenschappers modellen die niet alleen het antwoord raden (menselijk gedrag voorspellen), maar ook verklaren waarom mensen die keuzes maken (het cognitieve mechanisme onthullen).

Dit paper stelt de vraag: Kunnen we een AI leren om niet alleen menselijke beslissingen te voorspellen, maar ook om "hardop na te denken" op een manier die daadwerkelijk de menselijke psychologie verklaart?

Het Experiment: Het "Risicovolle Keuze" Spel

Om dit te testen, gebruikten de onderzoekers een klassiek psychologisch spel genaamd "risicovolle keuze". Stel je voor dat je twee opties krijgt aangeboden:

  • Optie A: Je krijgt gegarandeerd $27.
  • Optie B: Je hebt 90% kans om $25 te krijgen, maar 10% kans om $92 te krijgen.

De meeste mensen moeten kiezen tussen een veilige weddenschap en een riskant gokje. De onderzoekers hadden een enorme dataset van duizenden echte mensen die deze keuzes maakten. Ze wilden een AI trainen om naar de opties te kijken en te zeggen: "70% van de mensen kiest Optie A, en 30% kiest Optie B."

De Drie Trainingsmethoden

De onderzoekers probeerden drie verschillende manieren om de AI deze taak te leren, vergelijkbaar met drie verschillende coachingstijlen:

  1. De "Memoriseerder" (Standaard Training): Ze lieten de AI duizenden voorbeelden zien van vragen en de juiste antwoorden. De AI leerde het patroon te kopiëren. Het werd goed in het raden van de percentages, maar het leerde niet echt waarom. Het was als een student die het antwoordenblad uit het hoofd heeft geleerd, maar de wiskunde erachter niet kan uitleggen.
  2. De "Gemaskeerde Memoriseerder" (Centaur-stijl): Dit is een geavanceerde versie van de eerste methode waarbij de AI wordt gedwongen zich alleen te concentreren op de cijfers in het antwoord, en de rest van de tekst te negeren. Ook dit werd goed in het raden, maar genereerde nog steeds geen goede uitleg.
  3. De "Coach met een Scorebord" (Reinforcement Learning - RL): Dit is de ster van de show. Hier mocht de AI een "Chain of Thought" (een stapsgewijs redeneerproces) schrijven voordat hij het uiteindelijke antwoord gaf.
    • De Twist: De AI kreeg niet alleen punten voor het juiste antwoord. Het kreeg punten gebaseerd op hoe dicht de uiteindelijke voorspelling bij lag van wat echte mensen daadwerkelijk deden.
    • Het Resultaat: Om de punten te verdienen, besefte de AI dat hij moest "denken" als een psycholoog. De AI begon dingen te schrijven als: "Mensen zijn risicomijdend," of "Ze berekenen de verwachte waarde." Door te proberen het spel te winnen (het menselijke data te matchen), leerde de AI per ongeluk de psychologische regels te verwoorden die mensen volgen.

De Resultaten: De AI Wordt een Psycholoog

De onderzoekers ontdekten dat de "Coach met een Scorebord" (RL) methode een gamechanger was om twee redenen:

  1. Het Voorspelde Goed: Het was net zo goed in het raden van wat mensen zouden kiezen als de andere methoden.
  2. Het Legde Goed Uit: De "hardop nadenkende" delen (de Chain of Thought) waren daadwerkelijk hoogwaardige psychologische verklaringen.
    • De Analogie: Stel je voor dat de andere methoden een weer-app zijn die zegt: "Het gaat regenen." De RL-methode is als een meteoroloog die zegt: "Het gaat regenen omdat een koufront botst met warme lucht, wat zorgt voor een lagedrukgebied."
    • De AI begon echte psychologische concepten te gebruiken zoals Risicomijdendheid (mensen haten verliezen), Verwachte Waarde (het rekenwerk doen op de kansen) en het Zekerheidseffect (mensen houden van een gegarandeerde winst).

De Vereiste van "Slimheid"

Er was echter een addertje onder het gras. De onderzoekers probeerden deze zelfde "Coach"-methode op een kleiner, zwakker AI-model.

  • De Analogie: Stel je voor dat je een complexe strategie probeert te leren aan een peuter versus een student. De peuter (het kleine model) kon de wiskunde of de strategie niet begrijpen, zelfs niet met de coach. Het raakte alleen maar in de war en gaf slechte antwoorden.
  • De Bevinding: De "Coach"-methode werkte alleen omdat het basis-AI al slim genoeg was om de concepten te begrijpen. Als de AI niet slim genoeg is om "Verwachte Waarde" te begrijpen, kun je het niet trainen om het uit te leggen.

De "Vormveranderende" Test

Om te bewijzen dat de AI niet simpelweg inget toenende zinnen herhaalde, veranderden de onderzoekers de regels van het spel. In plaats van echte menselijke data, voerden ze de AI data die gegenereerd was door een robot die alleen om wiskunde (Verwachte Waarde) gaf.

  • Het Resultaat: De AI veranderde direct van "denkwijze". Het stopte met praten over menselijke angsten en risicomijdendheid en begon puur over wiskunde en logica te praten.
  • De Les: Dit bewees dat de AI niet alleen een script kopieerde; het paste zijn redenering daadwerkelijk aan om overeen te komen met de data waarop het werd getraind. Het "leerde" echt de regels van het specifieke spel dat het speelde.

Samenvatting

Dit paper laat zien dat als je een slimme AI traint om menselijk gedrag te voorspellen met behulp van een beloningssysteem (zoals een score in een videogame), de AI vanzelf zal beginnen te "hardop na te denken" met dezelfde psychologische regels die mensen gebruiken. Het verandert de AI van een simpele gokker in een model dat kan verklaren waarom we de keuzes maken die we maken. Dit werkt echter alleen als de AI al slim genoeg is om die concepten te begrijpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →