← Nieuwste papers
📄 allergy and immunology

Can Large Language Models Diagnose Primary Immunodeficiency from Patient-Described Symptoms?

Deze studie onthult dat hoewel grote taalmodellen effectief primaire immuundeficiëntie kunnen identificeren aan de hand van door artsen geschreven anamneses, hun diagnostische nauwkeurigheid aanzienlijk afneemt wanneer zij vertrouwen op de eigen beschrijvingen van symptomen door patiënten, wat een kritieke kloof in prestaties benadrukt op basis van de taal en de inkadering van medische input.

Oorspronkelijke auteurs: Reteig, L. C., Woloshin, S., Maglione, P. J., Farmer, J. R., Ong, M.-S.

Gepubliceerd 2026-10-04
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Reteig, L. C., Woloshin, S., Maglione, P. J., Farmer, J. R., Ong, M.-S.

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer

Voor miljoenen mensen is het pad naar een medische diagnose geen rechte lijn, maar een lange, verwarrende reis. Dit geldt vooral voor hen met zeldzame aandoeningen, waarbij symptomen vaag, algemeen of gemakkelijk aan te zien kunnen zijn voor iets anders. In de afgelopen jaren hebben veel van deze individuen zich tot een nieuw soort helper gewend: grote taalmodellen. Dit zijn geavanceerde computerprogramma's die getraind zijn op enorme hoeveelheden tekst en in staat zijn om gesprekken te voeren en vragen over gezondheid te beantwoorden. Ze zijn een standaardbron geworden voor mensen die proberen zin te geven aan hun eigen lichaam, vaak nog voordat ze een specialist zien. Maar een cruciale vraag blijft: kunnen deze digitale hulpmiddelen een patiënt werkelijk begrijpen wanneer de patiënt zelf het probleem beschrijft? Het antwoord hangt sterk af van wie er spreekt. Wanneer een arts een casus samenvat met precieze medische termen, begrijpt de computer het perfect. Wanneer een gewone persoon haar pijn, vermoeidheid of terugkerende infecties beschrijft in alledaagse taal, raakt de computer vaak de weg kwijt.

Een team van onderzoekers zette zich in om deze kloof tussen deskundige taal en patiëntentaal te testen, met de focus op een groep zeldzame stoornissen die bekend staan als primaire immuundeficiënties. Dit zijn aandoeningen waarbij het natuurlijke afweersysteem van het lichaam, dat normaal gesproken bacteriën en virussen bestrijdt, defect is of ontbreend is. Mensen met deze aandoeningen worden zeer vaak ziek, soms met ernstige infecties die ziekenhuisopname vereisen, en zij lopen een hoog risico op andere complicaties zoals auto-immuunziekten. Omdat deze aandoeningen zeldzaam en complex zijn, wachten patiënten vaak jaren op een correcte diagnose, een vertraging die gevaarlijk en emotioneel uitputtend kan zijn. Tijdens deze wachttijd wenden velen zich tot chatbots voor antwoorden. De onderzoekers wilden weten of deze chatbots de tekenen van een defect immuunsysteem konden herkennen wanneer de beschrijving rechtstreeks van de patiënt kwam, in plaats van van een arts.

Om dit te achterhalen, verzamelden de onderzoekers verhalen van eenentwintig volwassenen die al gediagnosticeerd waren met een primaire immuundeficiëntie. Al deze individuen hadden een lange vertraging ervaren bij het verkrijgen van hun diagnose. Het team vroeg hen om de allereerste symptomen te beschrijven die hen het gevoel gaven dat er iets mis was. De onderzoekers namen deze ruwe, ongefilterde beschrijvingen — precies zoals de patiënten ze zeiden, inclusief alle aarzelingen, herhalingen en alledaagse woorden — en voerden ze in een krachtig groot taalmodel. Ze verwijderden elke vermelding van de uiteindelijke diagnose, zodat de computer uitsluitend moest vertrouwen op de symptomen. Het doel was simpel: zou de computer suggereren dat de patiënt mogelijk een primaire immuundeficiëntie heeft, of in ieder geval herkennen dat het probleem met het immuunsysteem te maken had?

De resultaten toonden een scherp contrast tussen hoe de computer presteert met input van experts versus input van patiënten. In een eerder onderzoek met hetzelfde computermodel, waarbij artsen de patiëntgeschiedenissen schreven in professionele medische taal, identificeerde de computer de aandoening in negentig-zes procent van de gevallen correct. Het was bijna foutloos. Echter, toen de onderzoekers de woorden van de patiënten zelf gebruikten, daalde de prestatie van de computer drastisch. Het identificeerde de primaire immuundeficiëntie correct in slechts zeven van de eenentwintig gevallen, wat ongeveer één derde is. De computer slaagde er in de meerderheid van de gevallen niet in de specifieke aandoening te benoemen, zelfs niet terwijl de patiënten precies dezelfde ziektebeelden beschreven.

Ondanks het missen van de specifieke diagnose, was de computer niet geheel nutteloos. In zeventien van de eenentwintig gevallen suggereerde het dat de patiënt mogelijk algemene problemen met het immuunsysteem had, ook al benoemde het niet de specifieke zeldzame ziekte. Dit is een belangrijke bevinding, omdat het suggereert dat het hulpmiddel nog steeds als een nuttig signaal kan dienen. Voor een patiënt die door meerdere artsen is verteld dat de symptomen gewoon stress of allergieën zijn, kan een computer die "immuunsysteemproblemen" suggereert, hen aanmoedigen om een specialist te zoeken. De studie toonde echter ook aan dat de computer vaak andere, meer voorkomende aandoeningen raadde. Het suggereerde regelmatig allergieën, omgevingsfactoren zoals slechte luchtkwaliteit, of endocriene problemen zoals schildklierproblemen. Dit zijn de zaken die artsen als eerste overwegen, maar het kunnen ook doodlopende wegen zijn voor iemand met een werkelijke zeldzame immuunstoornis.

De onderzoekers ontdekten dat de computer de diagnose het meest waarschijnlijk correct kreeg wanneer het verhaal van de patiënt drie specifieke aanwijzingen bevatte: infecties die in de kindertijd begonnen, zeer ernstige infecties die ziekenhuisopname vereisten, of symptomen die helemaal geen infecties waren, zoals een groeistagnatie of spijsverteringsproblemen. Wanneer patiënten hun strijd op deze duidelijke, klassieke manieren beschreven, had de computer een grotere kans om de verbanden te leggen. Maar wanneer de beschrijvingen subtieler waren of gericht op het algemene gevoel van niet lekker zijn, had de computer moeite. Dit benadrukt een fundamentele zwakte: het hulpmiddel is zeer gevoelig voor de manier waarop het verhaal wordt verteld. Het gedijt bij de gestructureerde, precieze taal van de geneeskunde, maar wankelt wanneer het geconfronteerd wordt met de rommelige, emotionele en gevarieerde manier waarop mensen werkelijk over hun gezondheid spreken.

De auteurs van de studie merken voorzichtig op dat dit geen definitief oordeel is over de veiligheid of bruikbaarheid van deze hulpmiddelen, maar eerder een waarschuwing over hoe ze momenteel worden gebruikt. Ze wijzen erop dat hun test een best-case scenario was. De patiënten die zij interviewden kenden hun diagnose en herinnerden zich hun symptomen mogelijk duidelijker dan zij aan het begin van hun ziekte zouden doen. Als de computer zo slecht presteert met heldere, retrospectieve verslagen, dan zal het waarschijnlijk nog slechter presteren bij verwarde patiënten die nog vóór de diagnose staan en niet zeker weten wat er aan de hand is. Bovendien testte de studie niet hoe vaak de computer valse alarmen zou geven bij gezonde mensen, wat een grote zorg is. Als het hulpmiddel te veel gezonde mensen als zijnde immuunproblematiek markeert, zou dit artsen kunnen overbelasten en de zorg voor degenen die het echt nodig hebben kunnen vertragen.

Uiteindelijk onderstreept dit onderzoek een groeiende uitdaging in de moderne geneeskunde. Nu meer mensen kunstmatige intelligentie gebruiken voor gezondheidsadvies, wordt de kloof tussen wat de technologie kan en hoe mensen het daadwerkelijk gebruiken een veiligheidskwestie. De computer is niet kapot; hij is simpelweg getraind om de taal van experts te begrijpen, niet de taal van patiënten. Voor de miljoenen mensen die een diagnostische odyssee doorstaan, blijft de belofte van deze hulpmiddelen onvervuld totdien ze werkelijk kunnen luisteren naar de persoon in de kamer, en niet alleen naar het medische dossier. De weg vooruit vereist het bouwen van systemen die deze kloof kunnen overbruggen, om ervoor te zorgen dat wanneer een patiënt zijn lijden in eigen woorden beschrijft, het antwoord dat hij krijgt niet slechts een gok is, maar een betrouwbare gids naar de zorg die hij nodig heeft.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →