Characterizing the ability of LLMs to recapitulate Americans' distributional responses to public opinion polling questions across political issues
Dit onderzoek introduceert een nieuw raamwerk waarbij grote taalmodellen direct worden gevraagd om verdelingen van meningen te voorspellen, wat volgens de auteurs goedkoper en nauwkeuriger is dan het simuleren van individuele respondenten, terwijl de prestaties bovendien systematiser voorspelbaar zijn over verschillende demografische groepen en onderwerpen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je wilt weten wat de hele Amerikaanse bevolking denkt over belangrijke onderwerpen zoals gezondheidszorg, immigratie of het klimaat. Vroeger deden onderzoekers dit door duizenden mensen te bellen of te mailen met vragenlijsten. Dit is echter duur, tijdrovend en steeds moeilijker: steeds meer mensen nemen de telefoon niet op of willen niet meedoen.
In dit artikel onderzoeken de auteurs of kunstmatige intelligentie (LLMs) deze mensen kan vervangen. Ze willen weten of een slimme computer kan voorspellen hoe de gemiddelde Amerikaan zou antwoorden op een enquête, zonder dat ze echt iemand hoeven te bellen.
Hier is de kern van hun onderzoek, vertaald in een simpel verhaal met een paar creatieve vergelijkingen:
1. De twee manieren om de computer te vragen
De onderzoekers hebben getest op twee verschillende manieren om de AI te laten "denken" als een mens:
Manier A: De "Siliconen Pop" (Single Individual Query)
Stel je voor dat je een poppetje maakt en zegt: "Je bent nu een man uit Texas die conservatief is. Wat vind jij van dit onderwerp?" De poppeter geeft één antwoord.
Om een beeld te krijgen van de hele bevolking, moet je dit poppetje 20 keer achter elkaar laten spelen. Maar hier zit een addertje onder het gras: de poppeter is vaak te zeker van zichzelf. Hij denkt steeds hetzelfde. Het resultaat is een saaie, eenduidige menigte, terwijl echte mensen juist heel verschillend denken. Het is alsof je een koor laat zingen waarbij iedereen exact dezelfde noot zingt, terwijl je in het echt een hele symfonie met verschillende tonen wilt horen.Manier B: De "Directe Distributie" (Direct Distribution Query)
Hier vragen ze de AI niet om één antwoord te geven, maar direct: "Geef me direct een grafiek met percentages: hoeveel mensen denken A, hoeveel denken B, en hoeveel denken C?"
Dit is alsof je de AI vraagt om direct het gemiddelde van een heel orkest te beschrijven, in plaats van één muzikant te laten spelen.
2. Wat bleek eruit?
De onderzoekers hebben de antwoorden van de AI vergeleken met de echte antwoorden van 60.000 Amerikanen (uit een grote enquête genaamd CES).
- De winnaar: De Directe Distributie (Manier B) won het ruimschoots.
- De AI gaf een veel realistischer beeld van hoe mensen verschillend denken. Bij de "Siliconen Pop" (Manier A) dachten de AI-antwoorden vaak allemaal hetzelfde, wat onnatuurlijk is.
- De Directe Methode was ook sneller en goedkoper. In plaats van 20 keer te vragen, hoefde je het maar één keer te vragen.
- Het was vooral beter in het voorspellen van de "spreiding": hoe verdeeld de meningen zijn.
3. Kunnen we weten wanneer de AI goed is?
Dit is misschien wel het coolste deel van het onderzoek. De onderzoekers ontdekten dat je van tevoren kunt voorspellen hoe goed de AI zal presteren, nog voordat je de vraag stelt.
Stel je voor dat je een weersvoorspelling doet. Je kijkt niet pas naar de lucht als het regent, maar je kijkt naar de barometer en de windrichting.
- De AI werkt het beste bij gematigde mensen (niet te links, niet te rechts).
- De AI werkt minder goed bij extreem conservatieve groepen (ze begrijpen hun standpunten soms niet helemaal).
- De AI werkt minder goed bij bepaalde onderwerpen, zoals abortus, maar beter bij andere, zoals immigratie.
Met een wiskundig model konden de auteurs deze "weersvoorspelling" maken. Ze kunnen nu zeggen: "Als je deze vraag stelt aan deze groep mensen, is de kans groot dat de AI een betrouwbaar antwoord geeft. Maar als je die andere vraag stelt, moet je beter een echte mens vragen."
4. Waarom is dit belangrijk?
Vroeger was het alsof je blindelings een gok deed met de AI: "Misschien werkt het, misschien niet."
Nu hebben we een GPS-systeem voor opiniepeilingen.
- Kostenbesparing: Het is veel goedkoper om een computer te vragen dan duizenden mensen te bellen.
- Betrouwbaarheid: Omdat we nu weten wanneer de AI fouten maakt, kunnen we die fouten corrigeren of de AI gebruiken om de echte mensenpeilingen aan te vullen (bijvoorbeeld om groepen te bereiken die moeilijk te bereiken zijn, zoals jongeren of specifieke minderheden).
Samenvattend
Deze paper zegt: "Vergeet die saaie poppetjes die steeds hetzelfde antwoord geven. Vraag de AI direct om het grote plaatje (de verdeling). En gelukkig kunnen we nu al voorspellen waar de AI goed is en waar hij wat minder goed is, zodat we slim kunnen beslissen wanneer we hem inzetten en wanneer we beter een echte mens moeten bellen."
Het is een stap in de richting van een nieuwe manier van democratie begrijpen: sneller, goedkoper, en met een beter inzicht in wat de mensen echt denken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.