← Nieuwste papers
📄 medicine

Do AI-generated surgical cases improve clinical reasoning? A quasi-experimental comparison in surgical clerkship

Deze quasi-experimentele studie toont aan dat studenten in de chirurgische klinische stage die getraind werden met door DeepSeek gegenereerde casussen, significant hogere scores op klinisch redeneren en gunstigere cognitieve belastingprofielen behaalden vergeleken met studenten die getraind werden met traditionele door experts geschreven casussen, wat suggereert dat door AI gegenereerde inhoud de medische opleiding effectief kan verbeteren wanneer deze wordt ondersteund door deskundige beoordeling.

Oorspronkelijke auteurs: Zhitao Dong, Gang Huang, Li Geng, Ruwen Zhang, Shengxian Yuan, Yong Xia, Hui Liu

Gepubliceerd 2026-09-10
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhitao Dong, Gang Huang, Li Geng, Ruwen Zhang, Shengxian Yuan, Yong Xia, Hui Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Chirurgie is evenzeel een mentale discipline als een fysieke. Voordat een chirurg ooit een scalpel oppakt, moet hij leren denken als een detective: aanwijzingen verzamelen uit de geschiedenis en symptomen van een patiënt, verschillende mogelijkheden afwegen en zich committeren aan een handelingswijze, zelfs wanneer het beeld incompleet is. Dit mentale proces, bekend als klinisch redeneren, is de motor van veilige medische praktijk. Wanneer het werkt, krijgen patiënten de juiste zorg; wanneer het faalt, worden er fouten gemaakt. Traditioneel leren medische studenten deze vaardigheid door te werken met geschreven verhalen over echte patiënten, genaamd casussen, onder begeleiding van docenten. Het creëren van deze verhalen is echter traag en kostbaar werk voor drukke artsen, en de resulterende collectie casussen voelt vaak repetitief aan, waarbij studenten alleen de meest typische versies van ziekten te zien krijgen in plaats van de rommelige, verwarrende realiteit die ze in het ziekenhuis zullen ervaren.

Kunstmatige intelligentie heeft onlangs een potentiële oplossing geboden voor deze flessenhals. Grote taalmodellen, computerprogramma's die zijn getraind op enorme hoeveelheden tekst, kunnen deze patiëntverhalen nu direct schrijven. Maar een kritische vraag bleef onbeantwoord: helpt het lezen van een door een machine geschreven verhaal een student daadwerkelijk om beter na te denken dan het lezen van een door een mens geschreven verhaal? Een team van onderzoekers in Shanghai zette zich in om het antwoord te vinden door te testen of casussen gegenereerd door een systeem van kunstmatige intelligentie de redeneervaardigheden van chirurgie-studenten effectiever konden verbeteren dan traditionele, door mensen geschreven casussen.

De studie vond plaats over twee afzonderlijke perioden van zes maanden in een groot academisch ziekenhuis in China. De onderzoekers werkten met twee groepen vijfdejaars medische studenten, elk bestaande uit dertig studenten die hun chirurgische stage liepen. De eerste groep, die diende als de controlegroep, besteedde hun tijd aan het doorwerken van vierentwintig patiëntencasussen die de afgelopen drie jaar door ervaren docenten waren geschreven. Dit waren de standaard, door experts geschreven verhalen die de afdeling altijd had gebruikt. De tweede groep, de experimentele groep, werkte aan een andere set van vierentwintig casussen. Deze waren niet door mensen geschreven, maar werden gegenereerd door een specif specifieke artificiële intelligentie-model genaamd DeepSeek. De onderzoekers hadden de twee sets casussen zorgvuldig gematcht, zodat ze exact dezelfde soorten ziekten besloegen, zoals appendicitis, galblaasontsteking en darmblokkades, waardoor het enige grote verschil was wie of wat de verhalen had geschreven.

Om te meten hoe goed de studenten leerden, vroegen de onderzoekers hen niet simpelweg om feiten te reproduceren of het juiste antwoord uit een lijst te kiezen. In plaats daarvan gebruikten ze een geavanceerd digitaal platform dat hun denkprocessen in kaart bracht. Terwijl studenten door nieuwe, nog niet eerder geziene patiëntenscenario's werkten, volgde het systeem elke beslissing die ze namen: welke vragen ze stelden, welke tests ze aan ordereden en hoe ze de resultaten interpreteerden. Hierdoor konden de onderzoekers niet alleen zien of de student de juiste diagnose stelde, maar ook hoe hij tot die conclusie kwam. Ze keken of de student belangrijke stappen miste, te snel conclusies trok of een logisch pad volgde dat een expert zou herkennen. Ze vroegen de studenten ook om te rapporteren over hoe mentaal belastend het werk aanvoelde en hoe zelfverzekerd zij waren over hun eigen vermogens.

De resultaten toonden een duidelijk voordeel voor de studenten die trainden met de door kunstmatige intelligentie gegenereerde casussen. Bij de uiteindelijke beoordeling scoorde de groep die met de door AI gegenereerde verhalen werkte significant hoger op hun algemene redeneerprestaties dan de groep die met de door mensen geschreven verhalen werkte. Het verschil was groot genoeg om als een aanzienlijke verbetering te worden beschouwd. Wanneer de onderzoekers de scores uitsplitsten, ontdekten zij dat de AI-groep beter was in twee specifieke zaken: ze waren nauwkeuriger in hun uiteindelijke diagnoses en ze waren veel beter in het volgen van een volledig, logisch pad van onderzoek zonder stappen over te slaan of te vroeg op een antwoord te landen. Misschien wel het belangrijkste: de studenten in de AI-groep maakten minder oordeelsfouten, zoals het negeren van tegenstrijdig bewijs of het laten vertroebelen van hun denken door hun eerste intuïtie.

De studie wierp ook licht op de vraag waarom dit gebeurd zou kunnen zijn. De studenten die met de AI-casussen werkten, gaven aan minder mentale spanning te ervaren door de manier waarop het materiaal werd gepresenteerd, en zij voelden zich beter in staat om een diep begrip van het onderwerp op te bouwen. Dit sluit aan bij een leertheorie die suggereert dat wanneer studenten worden geconfronteerd met een verscheidenheid aan verschillende scenario's, hun hersenen gedwongen worden harder te werken om de onderliggende patronen te vinden, in plaats van alleen een enkel, voorspelbaar verhaal te memoriseren. De kunstmatige intelligentie was in staat om deze gevarieerde scenario's moeiteloos te genereren. Voor elke ziekte creëerde de AI drie verschillende versies: één die er typisch uitzag, één met ongebruikelijke symptomen en één die complicaties had door andere gezondheidsproblemen. Deze variatie dwong de studenten om flexibeler te denken. In contrast hiermee volgden de door mensen geschreven casussen, hoewel accuraat, vaker een standaardpatroon, wat studenten mogelijk de kans gaf om te vertrouwen op denk-shortcuts.

Efficiëntie was een ander belangrijk bevinding. De onderzoekers ontdekten dat het genereren van deze casussen met behulp van kunstmatige intelligentie aanzienlijk sneller ging dan het met de hand schrijven ervan. Terwijl een menselijke expert vier tot acht uur nodig kan hebben om een enkele gedetailleerde casus te vervaardigen, kan de AI in enkele momenten een concept produceren. De menselijke faculteit speelde nog steeds een cruciale rol door ongeveer twaalf minuten per AI-gegenereerd verhaal te besteden aan het beoordelen ervan om te garanderen dat het medisch verantwoord en vrij van gevaarlijke fouten was. Eén casus werd zelfs afgewezen omdat de AI een medicijn voorstelde dat onveilig was voor de specifieke beschreven patiënt. Dit beoordelingsproces betekende dat de afdeling ongeveer honderd-en-zestig uur aan tijd van de faculteit bespaarde over het course van een jaar, tijd die kon worden ingezet voor het lesgeven en mentorschap.

De onderzoekers merkten er zorgvuldig bij op dat dit succes afhankelijk was van het hebben van menselijke experts in het proces. Kunstmatige intelligentie is een krachtig hulpmiddel voor het genereren van volume en variëteit, maar het is niet perfect. Het kan fouten maken, zoals het suggereren van het verkeerde medicijn, wat verklaart waarom een mens altijd het werk moet controleren voordat het de student bereikt. De studie erkende ook dat de studenten die de AI-casussen gebruikten, simpelweg gemotiveerd kunnen zijn omdat het materiaal nieuw en origineel was, een factor die hun prestaties een impuls zou kunnen hebben gegeven. Bovendien werd de studie uitgevoerd bij één enkel ziekenhuis met een specifieke groep studenten, dus de resultaten kunnen er in andere omgevingen of bij andere groepen leerlingen anders uitzien.

Ondanks deze beperkingen levert de studie sterk bewijs dat kunstmatige intelligentie op een betekenisvolle manier kan worden ingezet om medisch onderwijs te verbeteren. Het suggereert dat door AI te gebruiken om een bredere, diversere bibliotheek van patiëntverhalen te creëren, docenten studenten kunnen helpen de vorm van flexibel en robuust denken te ontwikkelen die vereist is voor chirurgie. De technologie vervangt de docent niet; het bevrijdt de docent eerder van de eentonigheid van het eindeloos schrijven van casusbestanden, zodat zij zich kunnen concentreren op het begeleiden van de geest van de studenten. Het uiteindelijke doel is niet om studenten de verhalen te laten memoriseren die de computer schrijft, maar om hen te trainen in het redeneren door de onzekerheid van het echte leven, waar elke patiënt een uniek puzzelstuk is dat niet met een simpele formule kan worden opgelost.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →