So Many Opinions, So Many LLMs: Comparing Large Language Models to Traditional Machine Learning for Open- Ended Survey Analysis
Deze studie vergelijkt large language models (LLM's) met traditionele machine learning voor het analyseren van open antwoorden in enquêtes, waarbij wordt vastgesteld dat hoewel LLM's een superieure classificatie-accuratesse bereiken in het begrijpen van complexe thema's en sentimenten, zij aanzienlijke afwegingen presenteren met betrekking tot consistentie en verklaarbaarheid in hun redenering.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een gigantische doos hebt met duizenden brieven van studenten, geschreven in hun eigen slordige, emotionele handschrift. Sommige zijn blij, sommige zijn boos, sommige zijn sarcastisch en sommige zijn gewoon verward. Jouw taak? Elke brief te lezen en ze te sorteren in zes emotie-bakken: Blijdschap, Verrassing, Liefde, Boosheid, Verdriet en Angst.
Lange tijd probeerden onderzoekers dit te doen met "Old School" computerprogramma's. Denk aan deze programma's als een zeer strikte bibliothecaris die alleen specifieke woorden kan tellen. Als de bibliothecaris het woord "geweldig" ziet, plakt er een "Blijdschap"-sticker op de brief. Als hij "slecht" ziet, plakt er een "Verdriet"-sticker op. Het is snel, en je kunt precies zien waarom de bibliothecaris die keuze heeft gemaakt. Maar hier is het probleem: deze bibliothecarissen laten zich gemakkelijk foppen. Ze missen de sarcasme, de vermoeidheid die verborgen zit achter een bedankje, of de subtiele hints dat een student eigenlijk woedend is, ook al gebruikt hij beleefde woorden.
In dit onderzoek besloten de onderzoekers een nieuw team helpers te testen: Large Language Models (LLMs). Je kunt deze zien als superintelligente, veelgelezen robots die bijna alles op het internet hebben gelezen. In tegenstelling tot de strikte bibliothecarissen proberen deze robots de vibe en de context van de zin te begrijpen, niet alleen de individuele woorden.
De Grote Confrontatie
De onderzoekers lieten de twee teams tegen elkaar strijden met echte studentenonderzoekgegevens uit 2019 en 2021 (293 brieven uit 2021 en 142 uit 2019). Ze hebben de robots niets nieuws geleerd; ze vroegen ze alleen om de brieven te sorteren met een eenvoudige instructie, een methode genaamd "zero-shot" prompting.
Wat de Oude Bibliothecarissen Deden
De traditionele computermodellen (zoals Support Vector Classifiers en Random Forests) waren oké in het sorteren van de brieven wanneer ze getraind werden op een specifieke set voorbeelden. Ze behaalden ongeveer 90% nauwkeurigheid op hun oefentoetsen. Maar toen ze geconfronteerd werden met de echte, rommelige studentenbrieven, begonnen ze een beetje gek te doen.
- In de batch uit 2019 besloot één model dat 99,3% van de brieven "Blijdschap" was. Het negeerde in feite alle andere emoties!
- In de batch uit 2021 waren de modellen het totaal niet met elkaar eens. De een dacht dat een brief "Liefde" was, terwijl de ander dacht dat het "Verdriet" was.
- De onderzoekers vonden dat deze oude modellen te gevoelig waren voor specifieke woorden (zoals "geweldig" of "goed") en de lastige, menselijke kant van taal niet aankonden. Ze waren broos, wat betekent dat als de data ook maar een klein beetje veranderde, hun sortering instortte.
Wat de Nieuwe Robots Deden
Het team van LLM's (inclusief GPT-4-Turbo, Claude 3.5, Meta's LLaMA 3 en Perplexity Sonar Pro) deed iets anders. Ze telden niet alleen woorden; ze probeerden het gevoel te begrijpen.
- Ze waren het met elkaar eens: Wanneer de vier verschillende robots naar dezelfde stapel brieven keken, sorteerden ze de brieven meestal op dezelfde manier. Bijvoorbeeld, in de data uit 2021 waren alle vier de robots het exact met elkaar eens over hoeveel brieven "Boosheid" bevatten (46 brieven).
- Ze gingen om met nuance: Ze waren veel beter in het herkennen van complexe emoties, zoals wanneer een student sarcastisch is of wanneer hun "dankjewel" eigenlijk doordrenkt is met vermoeidheid.
- De Cijfers: Hoewel het artikel geen enkelvoudige "nauwkeurigheidsscore" voor de robots geeft (omdat er geen menselijke antwoordsleutel is om ze mee te vergelijken), suggereert hun consistentie dat ze veel betrouwbaarder zijn voor dit soort rommelige, echte wereldgegevens dan de oude modellen.
Het Nadeel
De robots zijn geen perfecte tovenaars. De onderzoekers wijzen op een paar zaken om rekening mee te houden:
- De "Liefde" Glitch: Alle vier de robots leken meer brieven als "Liefde" te sorteren dan als "Blijdschap". De onderzoekers vermoeden dat dit komt omdat de robots hebben geleerd van sociale media, waar mensen zeggen "Ik hou van deze klas!" om te bedoelen "Ik vind deze klas echt leuk", en niet dat ze diepe romantische gevoelens hebben.
- De Black Box: In tegen tegenstelling tot de oude bibliothecarissen, kun je niet altijd zien waarom de robot een keuze heeft gemaakt. Het is moeilijker om hun werk te controleren.
- Kosten en Updates: Deze robots zijn duur in gebruik, en de bedrijven die ze maken, werken ze vaak bij. Als je volgend jaar dezelfde prompt gebruikt, kan de robot een iets ander antwoord geven omdat het een "nieuwe versie" is.
Het Verdict
De studie suggereert dat als je duizenden open eind antwoorden van studenten wilt analyseren, de nieuwe AI-robots het betere instrument zijn. Ze zijn veel beter in het begrijpen van de complexe, menselijke kant van taal en zijn consistenter over verschillende groepen studenten heen.
De onderzoekers zeggen echter niet dat dit een "opgelost" probleem is. Ze suggereren dat voor beslissingen met een hoge impact (zoals het wijzigen van schoolbeleid), de beste aanpak een teaminspanning is: laat de robots het zware werk doen om de brieven te sorteren, maar laat mensen het werk controleren om er zeker van te zijn dat de robots niet in de strik van sarcasme of bias lopen. Het is een krachtige nieuwe manier om naar studenten te luisteren, maar er moet nog steeds een mens aan het stuur zitten.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.