Explainable machine learning-assisted differentiation of brucellosis from tuberculosis via routine blood biomarkers
Deze studie heeft een kosteneffectief, drie-variabele random forest-model ontwikkeld en gevalideerd dat gebruikmaakt van beroepshistorie, ALT- en GGT-niveaus om brucellose nauwkeurig te onderscheiden van tuberculose in de eerstelijnszorg, waarbij een robuuste prestatie werd bereikt die vergelijkbaar is met complexere modellen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In veel delen van de wereld, met name in de pastorale regio's van Centraal-Azië, lopen vaak twee verschillende bacteriële infecties die er identiek uitzien via de voordeur van een kliniek naar binnen. De ene is brucellose, een ziekte die wordt opgelopen van dieren zoals schapen en vee, en de andere is tuberculose, een respiratoire infectie die de mensheid al eeuwenlang teistert. Beide kunnen ervoor zorgen dat een patiënt zich onwel voelt met koorts, nachtzweten, gewrichtspijn en gewichtsverlies. Omdat hun symptomen zo sterk overlappen, hebben artsen in de eerstelijnszorg vaak moeite om ze van elkaar te onderscheiden. De standaardmanieren om een diagnose te bevestigen, zoals het kweken van de bacteriën in een laboratorium, kunnen weken of zelfs maanden duren, en de tests zijn niet altijd succesvol. Dit uitstel is gevaarlijk; het behandelen van de verkeerde ziekte kan leiden tot ernstige complicaties, en te lang wachten zorgt ervoor dat de infectie dieper in het lichaam nestelt. In gebieden waar geavanceerde medische apparatuur schaars is, is het vinden van een snelle, goedkope en betrouwbare manier om deze twee ziekten van elkaar te onderscheiden een cruciale behoefte.
Om dit probleem aan te pakken, heeft een team onderzoekers in Xinjiang, China, zich gericht op een veld uit de computerwetenschap dat bekend staat als machine learning. Deze benadering stelt computers in staat om complexe patronen te vinden in grote hoeveelheden gegevens die het menselijk oog misschien mist. De onderzoekers verzamelden medische dossiers van honderden patiënten die waren gediagnosticeerd met ofwel brucellose of tuberculose. Ze concentreerden zich op informatie die al in bijna elk ziekenhuis beschikbaar is: routinematige bloedtesten en een eenvoudige vraag over het beroep van de patiënt. Ze wilden zien of een computer kon leren om de subtiele verschillen in deze alledaagse getallen te herkennen die aangeven welke ziekte een patiënt heeft, zonder dat daarvoor dure of tijdrovende gespecialiseerde tests nodig zijn.
Het team begon met het verzamelen van gegevens van 273 patiënten, waarbij ze ervoor zorgden dat de groep met brucellose en de groep met tuberculose vergelijkbaar waren in leeftijd en geslacht om de vergelijking eerlijk te maken. Ze keken naar vijfendertig verschillende stukken informatie, variërend van het aantal witte bloedcellen van een patiënt tot de niveaus van diverse eiwitten in hun lever. Vervolgens voedden ze deze gegevens aan vier verschillende soorten machine learning-algoritmen, wat in essentie verschillende wiskundige methoden zijn voor het vinden van patronen. Het doel was om te zien welke methode het meest nauwkeurig de patiënten in de juiste ziektecategorie kon sorteren. Na het testen en verfijnen van de modellen ontdekten de onderzoekers dat één specif kind algoritme, bekend als een 'random forest', het beste presteerde. Het maakte met een hoge mate van nauwkeurigheid onderscheid tussen de twee ziekten en presteerde beter dan de andere methoden waarmee het werd getest.
Een computermodel dat goed werkt, is echter niet voldoende als artsen niet kunnen begrijpen waarom het een bepaalde beslissing neemt. Om dit op te lossen, gebruikten de onderzoekers een techniek genaamd SHAP-analyse, die werkt als een spotlight om aan te geven welke specifieke stukken informatie het belangrijkst waren voor de keuze van de computer. Ze ontdekten dat het model zwaar leunde op slechts drie factoren: het beroep van de patiënt en de niveaus van twee specifieke leverenzymen in hun bloed. De eerste factor was of de patiënt een boer of herder was. De andere twee waren metingen van alanine-aminotransferase, vaak ALT genoemd, en gamma-glutamyltransferase, of GGT. De analyse toonde aan dat patiënten die met vee werkten en hogere niveaus van deze twee leverenzymen hadden, veel vaker aan brucellose leden. Daartegenover stonden patiënten met lagere niveaus van deze enzymen en geen geschiedenis van landbouwwerk, die vaker aan tuberculose leden.
De onderzoekers bouwden vervolgens een vereenvoudigde versie van hun model met behulp van alleen deze drie factoren. Ze wilden bewijzen dat ze niet een complexe lijst van vijfendertig variabelen nodig hadden om een goed resultaat te behalen. Toen ze dit gestroomlijnde model testten, behield het meer dan negentig procent van de nauwkeurigheid van de volledige, complexe versie. Dit betekent dat een arts potentieel een zeer geïnformeerde inschatting van de diagnose kan maken door simpelweg te kijken naar een standaard bloedtest voor leverfunctie en te vragen wat de patiënt doet voor zijn werk. Om te verzekeren dat deze bevinding geen toevalstreffer was, testte het team het vereenvoudigde model op een nieuwe groep patiënten uit een andere periode. Het model presteerde net zo goed op deze nieuwe groep, waarbij het de ziekte in het overgrote deel van de gevallen correct identificeerde, wat aantoonde dat het vertrouwd kon worden wanneer het op nieuwe gegevens wordt toegepast.
De biologische reden achter deze bevindingen is logisch wanneer men kijkt naar hoe de twee bacteriën zich in het menselijk lichaam gedragen. Brucella, de bacterie die brucellose veroorzaakt, heeft een sterke neiging om de lever en de immuuncellen daarin binnen te dringen, wat leidt tot ontsteking en schade, waardoor de niveaus van ALT en GGT in het bloed stijgen. Tuberculose heeft daarentegen primair invloed op de longen en veroorzaakt minder directe schade aan de lever, wat resulteert in lagere niveaus van deze specifieke enzymen. De connectie met landbouw en veeteelt is ook duidelijk, aangezien deze beroepen gepaard gaan met nauw contact met de dieren die de bacteriën dragen. Door deze biologische realiteit te combineren met de kracht van machine learning, creëerden de onderzoekers een hulpmiddel dat zowel wetenschappelijk onderbouwd als praktisch bruikbaar is.
Deze studie demonstreert dat een goedkope, gemakkelijk te gebruiken diagnostische hulp mogelijk is voor regio's waar de middelen beperkt zijn. Het hulpmiddel vereist geen nieuwe apparatuur of dure reagentia; het interpreteert simpelweg de routinematige bloedwaarden die toch al worden uitgevoerd. De onderzoekers bevestigden dat hun vereenvoudigde model niet alleen nauwkeurig, maar ook stabiel is, wat betekent dat het consistente resultaten geeft. Hoewel de studie in één enkel ziekenhuis werd uitgevoerd en verdere tests op andere locaties nodig heeft om volledig bewezen te worden, bieden de resultaten een veelbelovend pad voorwaarts. Voor artsen in de eerstelijn kan deze aanpak het verschil betekenen tussen een patiënt die snel de juiste behandeling krijgt of lijdt onder een vertraagde diagnose. Het verandert een complex medisch probleem in een eenvoudige berekening op basis van alledaagse feiten, en biedt een nieuwe manier om de volksgezondheid te beschermen in gebieden waar deze twee ziekten veel voorkomen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.