← Nieuwste papers
💬 NLP

Multi-LLM Thematic Analysis with Dual Reliability Metrics: Combining Cohen's Kappa and Semantic Similarity for Qualitative Research Validation

Dit paper introduceert een open-source raamwerk voor betrouwbare kwalitatieve analyse met meerdere LLM's dat Cohen's Kappa en semantische gelijkenis combineert om consensus-thema's te valideren, waarbij Gemini 2.5 Pro de hoogste betrouwbaarheid behaalde.

Oorspronkelijke auteurs: Nilesh Jain, Hyungil Suh, Seyi Adeyinka, Leor Roseman, Aza Allsop

Gepubliceerd 2026-02-17
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Nilesh Jain, Hyungil Suh, Seyi Adeyinka, Leor Roseman, Aza Allsop

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een heel groot, ingewikkeld raadsel probeert op te lossen: een gesprek tussen een therapeut en een patiënt. Je wilt weten wat de belangrijkste boodschappen zijn in dat gesprek. In de wereld van onderzoek noemen we dit "kwalitatief onderzoek".

Vroeger was dit een zware klus. Je moest een groep mensen (zoals een panel van experts) bij elkaar roepen, ze elk het gesprek laten lezen, en dan kijken of ze het met elkaar eens waren over de belangrijkste thema's. Dit duurde lang, kostte veel geld en vaak waren ze het toch niet helemaal eens.

Nu hebben we een nieuwe, slimme oplossing: Kunstmatige Intelligentie (AI), of specifieker: grote taalmodellen (zoals ChatGPT of Gemini). Maar hier zit een addertje onder het gras: AI is soms wispelturig. Als je het dezelfde vraag twee keer stelt, kan het twee verschillende antwoorden geven. Hoe weet je dan of het antwoord betrouwbaar is?

Deze paper introduceert een slimme manier om dit probleem op te lossen. Hier is de uitleg, vertaald naar alledaagse taal:

1. Het Probleem: De "Wispelturige Vertaler"

Stel je voor dat je een vertaler hebt die een boek naar het Nederlands vertaalt. Maar deze vertaler is een beetje dronken of heeft net een nieuwe bril op. Soms zegt hij "hond", soms "dier", en soms "vierpotige vriend". Als je maar één keer vraagt, weet je niet of "dier" de juiste vertaling is of dat het toeval is.

In het verleden vroegen onderzoekers aan de AI: "Wat zijn de thema's?" en hoopten ze op een goed antwoord. Maar zonder controle was het een gok.

2. De Oplossing: Het "Zes Man Team"

De auteurs van dit paper zeggen: "Laten we de AI niet één keer laten werken, maar zes keer."

Ze laten dezelfde AI (bijvoorbeeld Gemini of GPT-4) het gesprek zes keer analyseren, maar ze geven de AI elke keer een heel klein, onzichtbaar verschil mee (een zogenaamde 'seed'). Het is alsof je zes verschillende vertalers uitnodigt, of één vertaler zes keer laat werken met een lichtjes andere insteek.

  • De Analogie: Stel je voor dat je een schilderij bekijkt. Als je er één keer naar kijkt, zie je misschien alleen de kleuren. Als je er zes keer naar kijkt, vanuit zes verschillende hoeken, zie je pas het volledige beeld. Als alle zes de hoeken zeggen: "Hier is een boom", dan weet je zeker dat er een boom staat. Als één zegt "een boom" en de ander "een struik", dan moet je daar extra naar kijken.

3. De Twee Meetlatjes (De "Reliability Metrics")

Om te controleren of deze zes keer werken goed zijn, gebruiken ze twee meetlatjes:

  • Meetlatje 1: Cohen's Kappa (De "Stemmen")
    Dit meet of de zes versies het exact met elkaar eens zijn over de onderwerpen. Het is alsof je kijkt of alle zes de vertalers dezelfde woorden gebruiken. Als ze het allemaal over "kunst" hebben, is de score hoog.
  • Meetlatje 2: Cosine Similariteit (De "Betekenis")
    Soms gebruiken ze andere woorden, maar bedoelen ze hetzelfde. Bijvoorbeeld: "mensen die moeite hebben met praten" versus "mensen die het moeilijk vinden om hun gevoelens te verwoorden". Woord voor woord zijn het niet dezelfde zinnen, maar de betekenis is identiek. Deze meetlatje kijkt naar de smaak van de zin, niet alleen de letters.

4. Wat Vonden Ze?

Ze testten dit met drie van de slimste AI's ter wereld (Gemini, GPT-4o en Claude) op een gesprek over kunst en therapie.

  • Het Resultaat: Het werkte verrassend goed! De AI's waren het bijna perfect met elkaar eens (een score van meer dan 80% tot 90%).
  • De Winnaar: De AI genaamd Gemini was het meest consistent. Het gaf bijna elke keer hetzelfde, sterke antwoord.
  • De Consensus: Door de zes antwoorden te combineren, konden ze de "echte" thema's filteren. Alles wat in 5 van de 6 runs terugkwam, was een betrouwbaar thema. Alles wat maar 1 keer terugkwam, was waarschijnlijk toeval of een "hallucinatie" van de AI en werd weggefilterd.

5. Waarom is dit geweldig?

  • Snelheid en Kosten: In plaats van 6 mensen te betalen om urenlang te lezen, kost dit een paar centen aan computerkracht en duurt het seconden.
  • Betrouwbaarheid: Het geeft onderzoekers een "veiligheidsnet". Ze weten nu niet alleen wat de AI zegt, maar ook hoe zeker ze kunnen zijn van dat antwoord.
  • Flexibiliteit: Het werkt met elke AI en elk type gesprek, zolang je maar de juiste vragen (prompts) stelt.

Samenvattend

Deze paper zegt eigenlijk: "Vraag de AI niet één keer, vraag het zes keer. Kijk of ze het met elkaar eens zijn. Als ze het eens zijn, heb je een betrouwbaar antwoord. Als ze het niet eens zijn, weet je dat je voorzichtig moet zijn."

Het is alsof je een groep vrienden vraagt om een film te bespreken. Als ze allemaal zeggen "De plot was geweldig", dan was de plot waarschijnlijk echt geweldig. Als één zegt "Geweldig" en de ander "Vervelend", dan is het misschien maar een mening van één persoon. Deze methode helpt onderzoekers om de echte "geweldige plots" van de AI te vinden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →