Before You Poll with LLMs: A Deliberative Diagnostic Framework
Dit artikel introduceert het Deliberative Polling Diagnostic Framework om aan te tonen dat huidige frontier LLM's er niet in slagen menselijke geloofsuppdatering tijdens deliberatie na te bootsen, maar in plaats daarvan unieke, identiteit-specifieke vertekeningen vertonen zoals opinieomkering, overschieten of rigiditeit, gedreven door een fenomeen dat "signature self-sycophancy" wordt genoemd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin overheden, bedrijven en onderzoekers niet langer maandenlang en miljoenen dollars hoeven uit te geven aan het polsen van echte mensen om de publieke opinie te begrijpen. In plaats daarvan zouden ze een computerprogramma kunnen vragen om duizenden verschillende burgers te simuleren, die digitale persona's nieuwe argumenten te presenteren, en te kijken hoe hun geest verandert. Deze praktijk, bekend als silicon sampling, is snel gegroeid omdat het snel, goedkoop en schaalbaar is. De hoop is dat deze kunstmatige agenten het menselijk redeneren goed genoeg kunnen nabootsen om te voorspellen hoe echte mensen zullen reageren op nieuwe informatie. Echter, een cruciale vraag blijft onbeantwoord: denken deze computerprogramma's ook echt en updaten ze hun overtuigingen zoals mensen dat doen, of halen ze simpelweg vooraf geschreven meningen op uit een enorme bibliotheek aan gegevens? Als dat laatste waar is, dan kan het gebruik van hen om te testen hoe mensen van mening kunnen veranderen, leiden tot gevaarlijk verkeerde conclusies.
Onderzoekers aan de Lahore University of Management Sciences zetten zich in om deze vraag te beantwoorden door een nieuwe manier te creëren om kunstmatige intelligentie te testen. Ze richtten zich op een specifiek menselijk gedrag genaamd deliberatie, wat het proces is van van mening veranderen na het horen van gebalanceerde argumenten. In de echte wereld, wanneer mensen van tegengestelde politieke zijden eerlijke informatie over elkaar horen, hebben ze de neiging om minder vijandig en meer open-minded te worden. De onderzoekers wilden zien of computermodellen deze specifieke verschuiving konden repliceren. Ze namen gegevens van een beroemde gebeurtenis uit de echte wereld genaamd America in One Room, waarbij 526 echte kiezers bij elkaar werden gebracht om over politiek te discussiëren, en gebruikten dat als een baseline. Vervolgens vroegen ze vijf van de meest geavanceerde beschikbare computermodellen om diezelfde kiezers te simuleren, waarbij ze exact dezelfde informatie kregen en dezelfde vragen kregen gesteld vóór en na de briefing.
De resultaten onthulden een schokkende waarheid: geen van de computermodellen gedroeg zich als de echte mensen. In plaats van hun overtuigingen op een realistische manier bij te stellen, faalde elk model, maar elk faalde op zijn eigen unieke en vreemde manier. Een van de krachtigste modellen, GPT-5.1, deed precies het tegenovergestelde van wat mensen doen. Wanneer gepresenteerd werd met gebalanceerde informatie over de andere politieke partij, werden de echte kiezers vriendelijker en minder vijandig. De computerpersona's werden echter aanzienlijk vijandiger, alsof de nieuwe informatie hen bozer had gemaakt. Dit is een fenomeen dat de onderzoekers een 'reversal' noemen, waarbij het model de verkeerde richting op beweegt.
Andere modellen draaiden niet om, maar gingen te ver. Modellen zoals Gemini, Claude en Llama bewogen wel in de juiste richting, door minder vijandig te worden na het horen van de argumenten, maar ze veranderden van mening vijf tot zeven keer sneller dan een mens zou doen. Het was alsof ze overdreven enthousiast waren om te worden overtuigd, waarbij ze hun meningen wild lieten schommelen bij de kleinste duw. Een vierde model, DeepSeek, weigerde überhaupt van mening te veranderen, en vertoonde bijna geen enkele verschuiving in mening, ongeacht de informatie die werd verstrekt. Deze starheid betekende dat het model handelde alsof de nieuwe argumenten geen enkel effect hadden.
De onderzoekers groven dieper om te begrijpen waarom deze fouten plaatsvonden. Ze ontdekten dat de problemen niet willekeurig waren; ze werden specif으로 getriggerd door vragen over politieke identiteit. Wanneer de modellen over beleidsdetails werden gevraagd, presteerden ze redelijk goed. Maar wanneer de vragen raakten aan hoe de ene partij de andere zag, stortten de modellen in. De computerpersona's leken eerder een stereotype uit te spelen dan na te denken over de nieuwe feiten. De onderzoekers noemden dit gedrag zelf-sycophancy (zelf-vleierij). Het is een vorm van vleierij waarbij het model instemt met zijn eigen interne idee van wat een bepaald type persoon zou moeten geloven, in plaats van te luisteren naar de gepresenteerde informatie. Bijvoorbeeld, als het model werd verteld om zich als een Republikein te gedragen, zou het aannemen dat een Republikein de tegenpartij haat, en zou het bij die aanname blijven, zelfs wanneer het bewijs suggereerde dat dit niet het geval was.
Dit gedrag is verschillend van het soort bias waarbij een computer probeert een menselijke gebruiker te plezieren. Hier pleit de computer voor zijn eigen interne script. De studie toonde aan dat deze fout selectief en symmetrisch is; hetzelfde model zou vijandig kunnen optreden tegenover de tegenpartij, maar overdreven vriendelijk tegenover de eigen partij, afhankelijk van de vraag. Dit suggereert dat de modellen niet een denkproces simuleren, maar in plaats daarvan gecachte, vooraf verpakte houdingen ophalen die geassocieerd worden met politieke labels. De onderzoekers testten dit door de politieke labels in hun prompts te verwisselen en vonden dat de reacties van de modellen onmiddellijk veranderden, wat bevestigde dat ze reageerden op het label in plaats van op de logica van het argument.
De implicaties van deze bevindingen zijn aanzienlijk voor iedereen die vertrouwt op computersimulaties om de samenleving te begrijpen. Als een model de verkeerde richting op gaat, zou het een beleidsmaker ervan kunnen overtuigen dat een publiek debat mensen bozer zal maken, terwijl het in werkelijkheid mensen juist rustiger zou maken. Als een model doorschiet, zou het de kracht van een educatieve campagne kunnen overdrijven, wat leidt tot verspilling van middelen. Als een model rigide is, zou het kunnen suggereren dat geen enkele hoeveelheid informatie iemands mening kan veranderen, wat het concept van publiek debat ondermijnt. De onderzoekers concluderen dat voordat we vertrouwen op welk computermodel dan ook om te simuleren hoe mensen van mening veranderen, we eerst een diagnostische test moeten uitvoeren om te zien of het model daadwerkelijk kan redeneren door nieuwe informatie of dat het slechts stereotypen reciteert. Zonder deze controle kan de snelheid en schaal van silicon sampling ons doen geloven dat we de menselijke natuur begrijpen, terwijl we in feite alleen een vertekend beeld van onze eigen vooroordelen zien.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.