← Nieuwste papers
💻 computer science

Artificial Intelligence in Surgical Qualitative Research: A Comparison of Human and AI-Assisted Thematic Analysis

Deze studie vergelijkt menselijke en door AI ondersteunde thematische analyse in chirurgisch kwalitatief onderzoek, waarbij wordt vastgesteld dat hoewel beide methoden vergelijkbare overkoepelende thema's identificeren, door mensen gegenereerde codeboeken een hogere intercoderbetrouwbaarheid opleveren vanwege duidelijkere thematische grenzen, wat suggereert dat een hybride aanpak die de efficiëntie van AI combineert met menselijke verfijning optimaal kan zijn.

Oorspronkelijke auteurs: Bonnie E Laingen, Wesley H Iobst, Jarrett Dobbins, Jacob W Johnson, Gabriel E Cambronero, Lucas P Neff, Maggie E Bosley

Gepubliceerd 2026-06-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Bonnie E Laingen, Wesley H Iobst, Jarrett Dobbins, Jacob W Johnson, Gabriel E Cambronero, Lucas P Neff, Maggie E Bosley

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme doos hebt met 200 handgeschreven briefjes van chirurgen. Elk briefje geeft antwoord op één vraag: "Wat is het moeilijkste aspect aan het uitvoeren van een specifieke operatie (LCBDE) in jouw ziekenhuis?"

Je doel is om al deze briefjes te lezen, ze te sorteren in stapels op basis van de genoemde problemen, en elke stapel een label te geven. Dit proces wordt Thematische Analyse genoemd. Normaal gesproken doen mensen dit door te lezen, te discussiëren en labels te verfijnen totdat ze het met elkaar eens zijn over wat elke stapel betekent.

Dit artikel stelt een simpele vraag: Kan een robot (Artificiële Intelligentie) deze sorteerklus net zo goed doen als een mens?

Hier is het verhaal van hoe ze dit hebben getest, met behulp van enkele eenvoudige analogieën.

De Twee Teams

De onderzoekers zetten een race op tussen twee teams om dezelfde 200 briefjes te sorteren:

  1. Het Menselijke Team: Twee artsen lazen de briefjes. Ze begonnen zonder labels. Terwijl ze lazen, maakten ze hun eigen lijst met categorieën (zoals "Niet genoeg geld", "Niet genoeg tijd", "Slechte apparatuur"). Ze bleven deze labels verfijnen totdat ze zeer duidelijk en onderscheidend waren. Dit is hun Menselijke Codeboek.
  2. Het AI-Team: Ze voerden alle 200 briefjes in één grote batch in een krachtige AI (ChatGPT). Ze zeiden tegen de AI: "Bekijk deze briefjes en maak je eigen lijst met categorieën." De AI deed dit onmiddellijk zonder enige menselijke hulp of voorbeelden. Dit is het AI-Codeboek.

De Resultaten: Wie Sorteerde Beter?

Beide teams slaagden erin om dezelfde grote lijnen van de problemen te vinden. Of het nu een mens of een robot was die de briefjes las, ze waren het erover eens dat de belangrijkste kwesties waren:

  • Problemen met apparatuur
  • Geld-/kostenproblemen
  • Tijdsbeperkingen
  • Gebrek aan steun van leidinggevenden
  • De operatie niet vaak genoeg uitvoeren (Laag Volume)

Er was echter een verschil in hoe ze de briefjes sorteerden.

Het "Vage Stapel"-probleem

Denk aan de labels van het Menselijke Team als duidelijke, afgebakende dozen. Als een briefje zei: "We hebben niet de juiste instrumenten," ging het in de "Apparatuur"-doos. Als er stond: "We hebben geen tijd," ging het in de "Tijd"-doos. De dozen overlapten nauwelijks.

De labels van het AI-Team waren meer als vage, overlappende cirkels. De AI creëerde enkele zeer brede categorieën. Bijvoorbeeld, de AI had misschien een label genaamd "Workflow en Cultuur". Een enkel briefje over "Het ziekenhuis geeft de voorkeur aan een andere operatie" zou tegelijkertijd in drie verschillende AI-categorieën kunnen passen.

Omdat de categorieën van de AI zo breed en overlappend waren, raakten de twee menselijke codeerders die de AI-lijst gebruikten om de briefjes te sorteren, vaker in de war. Ze waren het niet altijd eens over in welke "vage" stapel een briefje thuishoorde.

Het Scorebord

De onderzoekers maten hoe vaak de twee codeerders het met elkaar eens waren (Inter-Coder Betrouwbaarheid).

  • Menselijk Team: Ze waren het 95,1% van de tijd eens. Hun "overeenstemmingsscore" (Kappa) was 0,75.
  • AI-Team: Ze waren het 92,3% van de tijd eens. Hun "overeenstemmingsscore" (Kappa) was 0,64.

Hoewel de AI nog steeds best goed was, waren de mensen iets consistenter. Het artikel merkt op dat het verschil statistisch significant was, wat betekent dat het geen toeval was; de menselijke labels waren simpelweg duidelijker.

De "Hybride" Oplossing

Het artikel concludeert dat de AI als een snelle, behulpzame assistent is die snel naar een rommelige kamer kan kijken en zegt: "Oké, dit zijn de belangrijkste soorten rommel: kleding, boeken en servies."

Maar de AI is misschien niet perfect in het definiëren van precies waar een "sok" thuishoort als deze gemengd is met een "handdoek". De mensen moeten daarna komen om te zeggen: "Eigenlijk, laten we een specifieke regel voor sokken maken, zodat iedereen precies weet waar ze horen."

De Conclusie:
Je kunt AI gebruiken voor het zware werk om de hoofdthema's snel te vinden. Maar om ervoor te zorgen dat de regels duidelijk zijn en iedereen de briefjes op dezelfde manier sorteert, moet een mens ingrijpen om de definities te verfijnen. De beste aanpak is een hybride: laat de AI de eerste ronde doen, en laat vervolgens mensen de labels polijsten.

Wat het Papier Niet Zegt

Het is belangrijk om te vermelden wat dit onderzoek niet beweerde:

  • Het zei niet dat AI klaar is om menselijke onderzoekers volledig te vervangen.
  • Het heeft de AI niet getest op lange, complexe interviews (alleen korte enquêtevragen).
  • Het heeft verschillende versies van AI of verschillende manieren om de AI vragen te stellen niet getest (het gebruikte een "zero-shot" methode, wat betekent dat het de AI vroeg dit te doen zonder voorafgaande training of voorbeelden).
  • Het beweerde niet dat de AI "fout" was over de thema's; de AI vond de juiste grote ideeën, het had alleen moeite om de lijnen tussen de categorieën zo duidelijk te trekken als mensen dat deden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →