← Nieuwste papers
💬 NLP

Challenges in annotations by humans and LLMs: A case study of evaluative language

Dit artikel vergelijkt menselijke en door grote taalmodellen (LLM's) gegenereerde annotaties van evaluatieve taal in transcripten van TED-talks met behulp van de Appraisal-theorie, waarbij wordt geconstateerd dat LLM's zowel getrainde taalkundigen als trainees overtreffen in complexe annotatietaken, waarmee zij hun potentieel om onderzoek binnen de digitale geesteswetenschappen te ondersteunen aantonen.

Oorspronkelijke auteurs: Mirela Imamovic, Aenne Cecilia Kristine Knierim, Khushi Pitroda, Ekaterina Lapshinova-Koltunski

Gepubliceerd 2026-07-31
📖 1 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Mirela Imamovic, Aenne Cecilia Kristine Knierim, Khushi Pitroda, Ekaterina Lapshinova-Koltunski

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Technische Samenvatting: Uitdagingen in Annotaties door Mensen en LLM's: Een Casestudy van Evaluatieve Taal

Probleemstelling
Het artikel behandelt de toenemende complexiteit van annotatietaken in de digitale geesteswetenschappen en computationele sociale wetenschappen, met een specifieke focus op de identificatie en classificatie van evaluatieve taal. Hoewel Large Language Models (LLM's) veelbelovend zijn gebleken voor ongesuperviseerde NLP-taken, blijft hun vermogen om de prestaties van mensen te evenaren of te overtreffen bij hoogst subjectieve, complexe theoretische kaders nog onbewezen. De studie richt zich op de Appraisal theory (Martin & White, 2005), een functioneel model voor evaluatieve taal, specifiek het Attitude-subsysteem (Affect, Judgement, Appreciation). De auteurs benadrukken dat handmatige annotatie van deze categorieën tijdrovend is, gevoelig is voor een lage inter-annotator overeenstemming (IAA) en gecompliceerd wordt door contextafhankelijkheid, impliciete betekenissen en de moeilijkheid om subtiele categorieën van elkaar te onderscheiden. Het kernonderzoeksprobleem is bepalen of LLM's dezelfde uitdagingen tegenkomen als menselijke annotatoren bij dergelijke complexe taken en of zij effectieve instrumenten kunnen zijn voor het oplossen van dergelijke annotatieproblemen.

Methodologie
De studie maakt gebruik van een mixed-methods casestudy met een corpus van 190 Engelse TED-talk transcripten (het EmotionalizTED corpus) verspreid over elf domeinen (bijv. Wetenschap, Politiek, Geneeskunde). De methodologie is verdeeld in drie fasen:

  1. Menselijke Annotatie:

    • Annotatoren: 24 taalkundestudenten in opleiding (niet-moedertaalsprekers Engels, voornamelijk Duits) en één senior onderzoeker (die dient als de 'gold standard').
    • Taak: Zin-niveau classificatie van evaluatieve inhoud. Annotatoren bepaalden eerst of een zin evaluatief was (binair) en classificeerden deze vervolgens in Attitude-categorieën: Affect, Judgement, Appreciation, Ambiguous of Uncertain. Multi-labeling was toegestaan.
    • Evaluatie: Inter-Annotator Overeenstemming (IAA) werd gemeten met behulp van Cohen's Kappa (voor binaire evaluativiteit) en Krippendorff's alpha (voor multi-class subclassificatie). Er werd een kwalitatieve foutenanalyse uitgevoerd om bronnen van onenigheid te identificeren.
  2. Automatische Annotatie (LLM):

    • Prompt Engineering: Drie verschillende prompt-variaties werden ontworpen en vergeleken met behulp van het qwen3-30b-a3b-instruct-25075 model. Deze omvatten few-shot en zero-shot benaderingen, met variaties in context, persona, beperkingen en de inclusie van Chain-of-Thought (CoT) redenering.
    • Model Selectie & Tuning: De best presterende prompt werd toegepast op drie verschillende LLM's. Het meest effectieve model werd vervolgens gefinetuned met behulp van QLoRA om de prestaties te optimaliseren.
    • Proces: De LLM's volgden een tweetraps proces: (1) binaire classificatie van evaluativiteit, en (2) multiclass classificatie van Attitude-categorieën voor evaluatieve zinnen.
  3. Vergelijkende Analyse:

    • De prestaties van de gefinetunede LLM werden vergeleken met de gold standard (senior onderzoeker) en de student-annotatoren.
    • De studie onderzocht specifiek of LLM's worstelden met dezelfde specifieke linguïstische fenomenen (bijv. impliciete betekenis, doelwitidentificatie) die zorgden voor een lage overeenstemming bij mensen.

Belangrijkste Resultaten

  • Menselijke Prestaties: De inter-annotator overeenstemming onder student-linguïsten was variabel en vaak laag. Overeenstemming over de binaire beslissing "evaluatief vs. niet-evaluatief" varieerde van licht tot matig (Kappa \ge 0,51 in sommige domeinen zoals Entertainment en Politiek, maar daalde aanzienlijk in Geschiedenis en Psychologie). Overeenstemming over de specifieke Attitude-subcategorieën (Affect, Judgement, Appreciation) was nog lager, waarbij Krippendorff's alpha frequent onder de 0,50 viel en soms zelfs negatieve waarden bereikte.
  • Bronnen van Menselijke Fouten: Kwalitatieve analyse toonde aan dat menselijke onenigheid voortkwam uit:
    • Moeite met het onderscheiden tussen expliciete en impliciete betekenissen.
    • Verwarring over het "doelwit van evaluatie" (bijv. of een emotie toebehoort aan de spreker of aan een genoemde derde partij).
    • Uitdagingen met lange, complexe zinnen die geneste evaluatieve betekenissen bevatten.
    • Variaties in Engelse taalvaardigheid en domeinspecifieke kennis.
  • LLM Prestaties: De gefinetunede LLM behaalde een F1-score van 0,77 ten opzichte van de gold standard.
    • Vergelijking: De LLM presteerde beter dan de student-annotatoren en bereikte opmerkelijk genoeg een hogere overeenstemming met de senior onderzoeker (gold standard) dan de studenten deden.
    • Uitdaging-Alignment: De studie vond dat LLM's niet noodzakelijkerwijs worstelden met dezelfde specifieke problemen als mensen op dezelfde wijze; in plaats daarvan toonden ze een capaciteit om complexe classificatietaken consistenter uit te voeren dan de getrainde maar onervaren menselijke cohort.

Belangrijkste Bijdragen

  1. Annotatieschema: Het artikel presenteert een specifiek annotatieschema voor de Attitude-categorieën van de Appraisal theory, aangepast voor zin-niveau analyse in gesproken populaire wetenschappelijke discours.
  2. Empirische Vergelijking: Het biedt een directe empirische vergelijking tussen menselijke annotatoren (zowel trainees als experts) en LLM's in een complexe, subjectieve linguïstische taak.
  3. Prompt Optimalisatie: De studie demonstreert de impact van prompt-ontwerp (inclusief CoT en few-shot strategieën) op de prestaties van LLM's bij pragmatische annotatie.

Betekenis en Claims
De auteurs beweren dat LLM's effectief kunnen helpen bij het oplossen van complexe annotatietaken, waarbij ze potentieel de prestaties van linguïsten in opleiding overtreffen wat betreft consistentie en overeenstemming met expertstandaarden. Het artikel suggereert dat als LLM's succesvol complexe linguïstische theorieën zoals Appraisal kunnen annoteren via prompting en fine-tuning, dit nieuwe paden opent voor onderzoek in de digitale geesteswetenschappen. Specifiek impliceert dit dat uitgebreide, handmatig geannoteerde corpora niet altijd strikt noodzakelijk zijn voor het classificeren van grote delen van spraakdata, mits LLM's correct worden gestuurd. De studie concludeert dat LLM's een levensvatbare strategie bieden voor het opschalen van annotatieprocessen in interdisciplinaire velden, hoewel het erkent dat taak-specifieke validatie van modelprestaties noodzakelijk blijft.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →