LLMs for Survey Text Analysis – A Performance Comparison Between Humans and GPT-5 on Inductive Content Analysis
Deze studie toont aan dat GPT-5.4 de menselijke prestaties bij inductieve inhoudsanalyse van enquêtegegevens kan benaderen, waarbij het overeenstemmingsniveaus voor codering en thema-generatie bereikt die vergelijkbaar zijn met de menselijke interne consistentie, waardoor het potentieel als schaalbare ondersteuningstool voor kwalitatief onderzoek wordt gevalideerd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Kwalitatief onderzoek is de kunst van het betekenis geven aan woorden. Wanneer wetenschappers, sociologen of beleidsmakers de gedachten, gevoelens en ervaringen van mensen willen begrijpen, stellen zij vaak open vragen. In plaats van een vakje aan te kruisen, schrijft een persoon een paragraaf over hun leven, hun strijd of hun hoop. Om duizenden van deze paragrafen om te zetten in bruikbare kennis, moeten onderzoekers elke tekst lezen, de herhalende ideeën vinden en ze in categorieën indelen. Dit proces, bekend als inhoudsanalyse, vormt de ruggengraat van het begrijpen van menselijk gedrag, maar het is ongelooflijk traag en veeleisend. Decennialang was de enige manier om dit te doen het menselijk brein, dat regel voor regel las. Nu is er een nieuw soort instrument de kamer binnengekomen: grote taalmodellen. Dit zijn systemen van kunstmatige intelligentie die getraind zijn op enorme hoeveelheden tekst en die taal kunnen lezen, begrijpen en samenvatten. De grote vraag voor de wetenschappelijke gemeenschap is niet alleen of deze machines kunnen lezen, maar of ze kunnen denken als een menselijke onderzoeker wanneer de taak vereist dat er verborgen patronen worden gevonden zonder een vooraf geschreven regelboek.
Een team van onderzoekers van universiteiten uit heel Europa zette zich af om deze vraag te beantwoorden met een directe vergelijking. Zij namen een echte dataset uit een enquête onder 2.800 PhD-studenten in heel Europa, waarbij 10% van de reacties willekeurig werd geselecteerd om als basis voor de studie te dienen. Uit deze steekproef werd een totaal van 903 reacties over zes specifieke open vragen diepgaand geanalyseerd. Aan de ene kant van het experiment voerden vijf menselijke onderzoekers een zogenaamde inductieve inhoudsanalyse uit op deze antwoorden. Dit betekent dat zij niet begonnen met een lijst van categorieën om de antwoorden in te dwingen. In plaats daarvan lazen zij de tekst, identificeerden zij de kernideeën, creëerden zij hun eigen labels voor die ideeën en groepeerden zij die labels vervolgens in bredere thema's. Het is een creatief en interpretatief proces dat vertrouwt op menselijk oordeel om te beslissen wat belangrijk is. Aan de andere kant gebruikten de onderzoekers een geavanceerd taalmodel om exact dezelfde taak op dezelfde tekst uit te voeren. De machine kreeg dezelfde instructies om de antwoorden te lezen, de hoofdideeën te vinden en ze in thema's te groeperen, zonder vooraf te worden verteld waar naar gezocht moest worden.
De onderzoekers vergeleken vervolgens de twee sets resultaten om te zien hoe nauw de machine met de mensen overeenkwam. Ze zochten niet naar een perfecte match, omdat zelfs verschillende menselijke experts het vaak oneens zijn over hoe een specifieke zin gelabeld moet worden. In plaats daarvan maten zij de algehele afstemming van de groepen. De resultaten toonden een matig niveau van overeenstemming. Wanneer gekeken werd naar de specifieke labels die de onderzoekers en de machine voor de tekst hadden gecreëerd, kwamen zij in 61 procent van de gevallen overeen. Wanneer er werd gekeken naar de bredere thema's die zij vanuit die labels hadden opgebouwd, lag de overeenstemming iets lager, op 54 procent. Om dit in perspectief te plaatsen: de onderzoekers controleerden ook in hoeverre de vijf menselijke experts het onderling met elkaar eens waren. De mensen waren het in 68 procent van de gevallen met elkaar eens over de labels en thema's. Dit betekent dat de kloof tussen de mens en de machine niet groot was; de machine presteerde bijna even consistent als een menselijke expert bij een andere menselijke expert.
Het verhaal is echter niet uniform over alle onderwerpen. De overeenstemming tussen de mensen en de machine varieerde aanzienlijk afhankelijk van waar de studenten over schreven. Voor vragen over financiële situaties had de machine meer moeite en vertoonde het een lagere afstemming met de menselijke onderzoekers. Voor vragen over persoonlijke ervaringen of algemene feedback was de afstemming veel sterker. De studie suggereert dat de betrouwbaarheid van de machine sterk afhangt van de aard van de data en de helderheid van de tekst. Wanneer de tekst ambigu was of de interne logica van de eigen groepering van de machine wankel was, daalde de overeenstemming met de mensen. De onderzoekers ontdekten dat telkens wanneer de machine inconsistent was met zichzelf, het ook inconsistent was met de mensen, en hetzelfde gold voor het menselijke team. Dit geeft aan dat de moeilijkheid van het specifieke onderwerp een belangrijke rol speelt in hoe goed het hulpmiddel werkt.
De menselijke codeurs die deelnamen aan de studie werden ook gevraagd naar hun indrukken van het werk van de machine. Zij rapporteerden dat de categorisaties van de machine hun eigen denkproces weerspiegelden en dat zij de tool zouden vertrouwen om toekomstige data te helpen analyseren. De onderzoekers concludeerden dat deze systemen van kunstmatige intelligentie nog niet klaar zijn om het menselijk oordeel volledig te vervangen, vooral niet voor het complexe, hoogwaardige werk van het bouwen van theorieën. Echter, de bevindingen suggereren dat deze tools zeer effectief zijn bij het afhandelen van de vroege, arbeidsintensieve fasen van het sorteren van teksten. Ze kunnen het zware werk doen van het lezen van duizenden reacties en het vinden van de initiële patronen, waardoor menselijke onderzoekers zich kunnen concentreren op de diepere interpretatie en validatie van die patronen. De studie beweert niet dat de machine perfect is of dat het het probleem van tekstanalyse heeft opgelost, maar het suggereert wel dat het een krachtige, schaalbare partner is voor onderzoekers die betekenis moeten geven aan grote hoeveelheden menselijke verhalen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.