Eliciting Trustworthiness Priors of Large Language Models via Economic Games
Dit artikel introduceert een nieuwe methode die gebruikmaakt van iteratief in-context leren en het Trust Game om de vertrouwen-priors van grote taalmodellen te achterhalen, waarbij wordt onthuld dat de vertrouwen-gedragingen van GPT-4.1 nauw aansluiten bij menselijke patronen en voorspeld kunnen worden door stereotypen van warmte en competentie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Idee: Hoe "betrouwbaar" is een AI?
Stel je voor dat je een nieuwe assistent inhuurt om je geld te beheren. Je geeft hem $10 en je zegt: "Ik ga dit vermenigvuldigen met 3, dus je hebt nu $30. Geef alsjeblieft een deel aan mij terug."
- Als hij je $15 teruggeeft: Dan is hij betrouwbaar.
- Als hij je $0 teruggeeft: Dan is hij dat niet.
Dit is de basisopstelling van een beroemd spel genaamd het Trust Game (Vertrouwensspel). Meestal gebruiken psychologen dit spel om te zien hoe mensen zich gedragen. Maar dit paper stelt een nieuwe vraag: Hoe gedragen Large Language Models (LLM's) zoals GPT-4 of Llama zich in dit spel? Hebben ze een "standaardinstelling" voor hoeveel ze anderen vertrouwen en hoeveel ze de gunst beantwoorden?
Het Probleem: Je kunt een AI niet zomaar vragen
Je zou kunnen denken: "Waarom vragen we de AI niet gewoon: 'Ben je betrouwbaar?'" De auteurs zeggen dat dat een slecht idee is.
- Het "Beleefde Robot"-probleem: Als je een AI vraagt: "Zul je mijn geld stelen?", zal de AI vrijwel zeker zeggen: "Nee, ik ben een behulpzame assistent."
- De Realiteit: Net als mensen kunnen AI's overtuigend en vloeiend zijn, maar in de praktijk toch risicovolle of onbetrouwbare keuzes maken. We moeten zien wat ze doen, niet alleen wat ze zeggen.
De Oplossing: Het "Telefoongame"-concept van vertrouwen
Om uit te vinden wat de werkelijke "vertrouwensinstellingen" van een AI zijn, hebben de onderzoekers een slimme methode uitgevonden die gebaseerd is op een concept genaamd Iterated In-Context Learning.
Denk hierbij aan een spelletje Telefoontje (het versturen van een berichtje door een groep), maar in plaats van een gefluisterd woord, geven ze een verhaal over geld door.
- De Opstelling: De onderzoekers creëren een keten van "generaties" van AI.
- De Eerste Stap: Ze laten de AI een paar voorbeelden zien van mensen die het Trust Game spelen (bijv. "Persoon A stuurde $5, Persoon B gaf $2 terug").
- De Beurt van de AI: De AI bekijkt deze voorbeelden en voorspelt: "Als ik Persoon B was, hoeveel zou ik dan teruggeven?" Stel dat het 40% voorspelt.
- De Lus: De onderzoekers nemen die voorspelling van 40% en gebruiken die om nieuwe nepvoorbeelden te genereren van mensen die het spel spelen. Ze voeren deze nieuwe voorbeelden aan de volgende AI in de keten.
- Het Resultaat: Ze herhalen dit proces 30 keer.
Waarom doen ze dit?
Stel je voor dat je probeert de "gemiddelde persoonlijkheid" van een groep te raden door naar hen te kijken terwijl ze een spel spelen. In het begin lijken de resultaten misschien willekeurig. Maar als je de resultaten steeds verder de lijn af doorgeeft, vervaagt de "ruis" en wat overblijft is het diepgewortelde instinct (of de "prior") van de AI over hoe vertrouwen werkt. Het is alsoals het afstemmen van een radio totdat de statische ruis verdwijnt en je de echte zender hoort.
Wat ze vonden
1. Sommige AI's zijn "Menselijk", anderen niet
De onderzoekers testten 20 verschillende AI-modellen. Ze vergeleken de gevonden "vertrouwensinstellingen" van de AI met de gemiddelde vertrouwensinstellingen van duizenden echte mensen.
- De Winnaar: GPT-4.1 kwam het dichtst in de buurt van menselijk gedrag. De "vertrouwensknop" van dit model stond bijna exact waar die van mensen staat.
- De Verliezers: Sommige andere modellen waren ofwel te gierig (gaven heel weinig geld terug) of hadden vreemde, gespleten persoonlijkheden (soms zeer vertrouwend, soms zeer wantrouwig).
2. De "Risico"-verbinding
Ze merkten iets interessants op: de AI-modellen die als "risicovoller" werden beoordeeld (meer geneigd om kansen te nemen of gewaagde dingen te zeggen), waren de modellen die het meest als mensen gedroegen in dit vertrouwensspel. De modellen die super strikt waren in het volgen van regels of het vermijden van risico's, gedroegen zich minder als echte mensen in dit sociale spel.
3. AI beoordeelt mensen op "Warmte" en "Competentie"
In het tweede deel van de studie gebruikten ze de meest menselijke AI (GPT-4.1) om het spel te spelen tegen verschillende "karakters" (persona's).
- Ze vroegen de AI om te spelen tegen een "Dokter", een "AI", "Elon Musk", "Malala Yousafzai", enzovoort.
- De Bevinding: De AI behandelde niet iedereen hetzelfde. Het gaf meer geld terug aan mensen die het als Warm (vriendelijk, zorgzaam) en Competent (slim, vaardig) beschouwde.
- De Magische Formule: De onderzoekers bouwden een eenvoudige wiskundige formule gebaseerd op twee zaken: Warmte en Competentie.
- Als een karakter alleen "Competent" (slim) was maar niet "Warm" (vriendelijk), vertrouwde de AI hen niet veel.
- Als een karakter "Warm" was maar niet "Competent", vertrouwde de AI hen een beetje meer.
- Het Zoete Punt: Als een karakter zowel Warm als Competent was (zoals een geliefde, slimme mentor), schoot het vertrouwen van de AI omhoog. Dit komt overeen met hoe mensen anderen beoordelen, ook.
De Conclusie
Dit paper laat zien dat we een "geldspel" kunnen gebruiken om in de hersenen van een AI te kijken en de verborgen regels over vertrouwen te ontdekken.
- Sommige AI's gedragen zich al heel erg als mensen als het gaat om vertrouwen.
- Deze AI's beoordelen anderen op dezelfde twee zaken als wij: Zijn ze aardig? Zijn ze bekwaam?
- Dit helpt ons te begrijpen dat AI niet alleen een rekenmachine is; het heeft sociale "biases" en instincten die we kunnen meten en bestuderen.
Wat het paper NIET zegt:
De auteurs beweren niet dat deze methode AI-veiligheid kan oplossen, mentale gezondheidsproblemen kan genezen of gebruikt kan worden om werknemers aan te nemen. Ze zeggen simpelweg: "Hier is een manier om te meten hoe een AI denkt over vertrouwen, en dit is wat we hebben gevonden."
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.