← Nieuwste papers
💬 NLP

Emulate or Estimate? The Divergent Strengths of Base and Post-Trained Language Models for Opinion Simulation

Dit artikel lost tegenstrijdige bevindingen over het gebruik van grote taalmodellen voor opiniesimulatie op door onderscheid te maken tussen "emulatie" (het genereren van individuele reacties) en "estimatie" (het voorspellen van distributies), waarbij wordt aangetoond dat basismodellen uitblinken in het eerste terwijl post-getrainde modellen superieur zijn in het laatste.

Oorspronkelijke auteurs: Seth Grief-Albert, Jessica Bo, Difan Jiao, Ashton Anderson

Gepubliceerd 2026-08-05
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Seth Grief-Albert, Jessica Bo, Difan Jiao, Ashton Anderson

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de stemming van een enorme menigte probe_ert te begrijpen zonder iedereen individueel te vragen. Je zou een paar mensen kunnen vragen wat zij denken, of je zou een expert kunnen vragen om de algemene sfeer in te schatten. Dit is het soort puzzel waar wetenschappers voor staan wanneer ze kunstmatige intelligentie (AI) proberen te gebruiken om menselijke meningen te simuleren. In de wereld van de informatica, specif으로 in een vakgebied genaamd "Natural Language Processing", bouwen onderzoekers gigantische AI-modellen die bijna alles hebben gelezen wat er op het internet geschreven staat. Deze modellen zijn ongelooflijk goed in het voorspellen van welk woord volgt, wat hen doet lijken also op een perfecte vervanger voor echte mensen. Maar hier komt het lastige deel: alleen omdat een AI een overtuigend verhaal kan schrijven, betekent dat nog niet dat hij accuraat kan voorspellen hoe een hele groep mensen zal stemmen, zich zal voelen over de economie of een enquête zal beantwoorden. Wetenschappers discussiëren momenteel over de vraag of deze AI-"mensen" daadwerkelijk goed zijn in het nabootsen van menselijke diversiteit, of dat ze gewoon doen alsof ze iets anders zijn.

Dit artikel stapt in die discussie om een mysterie op te lossen: waarom zeggen sommige studies dat AI geweldig is in het simuleren van menselijke meningen, terwijl andere zeggen dat het er jammerlijk in faalt? De auteurs, onderzoekers van Queen's University en de University of Toronto, suggereren dat de verwarring voortkomt uit het verwarren van twee zeer verschillende taken. Ze noemen de eerste taak Emulatie. Dit is als het inhuren van een acteur om een specifiek personage te spelen. De AI genereert één enkele reactie alsof het een echt persoon is, en als je genoeg "acteurs" vraagt, tellen hun antwoorden vanzelf op om de vorm van de mening van de menigte te laten zien. De tweede taak is Estimatie (Schatting). Dit is als het vragen aan een statisticus om naar een menigte te kijken en simpelweg te zeggen: "Ik denk dat 60% voor optie A zal kiezen." De onderzoekers testten dit idee door twee soorten AI tegenover elkaar te zetten: "Base"-modellen (de ruwe, ongepolijste versies) en "Post-trained" modellen (de versies die zijn verfijnd om nuttige assistenten te zijn).

De resultaten van hun experimenten, uitgevoerd op echte enquêtegegevens van het Pew Research Center, onthullen een duidelijke splitsing in talenten. Wanneer de taak Emulatie was—het genereren van individuele tekstreacties om te zien hoe de menigte eruitziet wanneer je ze bij elkaar optelt—waren de Base-modellen de winnaars. Zij produceerden reacties die veel meer leken op echte menselijke data en deden er beter in om de verschillen tussen groepen (zoals Democraten versus Republikeinen of rijk versus arm) duidelijk te houden. Sterker nog, de "Post-trained" modellen leden vaak aan wat de auteurs "persona collapse" noemen, waarbij ze allemaal hetzelfde begonnen te klinken, als een koor van clones, waarbij ze de rommelige diversiteit van echte mensen verloren.

Echter, het verhaal draait om wanneer de taak Estimatie is. Wanneer de onderzoekers de AI simpelweg vroegen om "het percentage mensen te voorspellen dat deze optie zal kiezen", blonken de Post-trained modellen uit. Ze waren veel beter in het direct geven van de juiste getallen. De ruwe Base-modellen waren hier oké in, maar de gepolijste, behulpzame assistenten waren aanzienlijk nauwkeuriger in het voorspellen van de verdeling zonder dat ze een enkele zin van neptekst hoefden te genereren.

De auteurs suggereren dat dit gebeurt omdat het "post-training" proces de AI leert een behulpzame assistent te zijn. Wanneer je een assistent vraagt om de mening van een menigte te raden, gebruikt deze zijn kennis om een slim, direct antwoord te geven. Maar wanneer je diezelfde assistent vraagt om te acteren als een specifiek persoon, raakt hij vast in zijn rol als "behulpzame assistent", wat ervoor zorgt dat hij te uniform klinkt en de unieke eigenaardigheden van verschillende demografieën verliest. De ruwe Base-modellen zijn aan de andere kant niet gedwongen in die enkele "assistent"-box, waardoor ze een breder, chaotischer reservoir aan menselijke stemmen kunnen aanboren wanneer ze gevraagd worden tekst te genereren.

Het artikel concludeert daarom dat er niet één enkele "beste" AI is voor het simuleren van mensen. Als je tekst wilt genereren die voelt als een diverse groep mensen (zoals voor een videogame of een sociaal-wetenschappelijke simulatie), moet je de ruwe Base-modellen gebruiken. Maar als je alleen een snelle, nauwkeurige voorspelling nodig hebt van wat een groep zal denken, moet je de gepolijste Post-trained modellen vragen de schatting te maken. De verwarring in het vakgebied kwam niet doordat een bepaald type AI kapot was; het kwam doordat onderzoekers het verkeerde instrument gebruikten voor de specifieke taak die ze probeerden te volbrengen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →