Clinical trial success prediction from open registry text using classical machine learning
Deze studie toont aan dat klassieke machine learning-modellen, in het bijzonder random forests, effectief het succes van klinische studies kunnen voorspellen met behruik van enkel openbare registerteksten van ClinicalTrials.gov, waarbij een matige tot sterke prestatie wordt bereikt over verschillende fasen en indicaties van de studie, terwijl datalekken worden beperkt door rigoureuze voorbewerking.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Elk jaar pompen farmaceutische bedrijven miljarden dollars en decennia aan inspanningen in de ontwikkeling van nieuwe medicijnen. Het pad van een veelbelovend idee in een laboratorium naar een pil op de plank van een apotheek is lang en vol met mislukkingen. De meeste kandidaat-geneesmiddelen halen het nooit tot goedkeuring, en wanneer ze na jaren van werk falen, is het financiële verlies overweldigend. Belangrijker nog is dat de mensen die zich vrijwillig voor deze studies aanmelden, risico's lopen zonder de gehoopte voordelen te ontvangen. Omdat middelen eindig zijn, is elke dollar en elk uur dat wordt besteed aan een medicijn dat uiteindelijk zal falen, een hulpbron die wordt onttrokken aan een medicijn dat wel zou kunnen slagen. De industrie zoekt al lang naar een manier om deze gedoemde kandidaten vroegtijdig te signaleren, voordat er te veel tijd en geld in wordt geïnvesteerd, zodat onderzoekers de zwakke programma's kunnen stoppen en zich op de sterke kunnen richten.
Om dit te doen, hebben wetenschappers geprobeerd de uitkomst van klinische studies te voorspellen, wat de rigoureuze tests zijn waarbij nieuwe behandelingen aan patiënten worden gegeven. Deze voorspellingen zijn moeilijk omdat ze berusten op het begrijpen van complexe menselijke biologie, het specifieke ontwerp van een studie en het gedrag van een nieuw medicijn. Traditioneel hebben experts hun ervaring gebruikt om te gokken welke studies zullen slagen, maar dit proces is traag, subjectief en duur. In de afgelopen jaren hebben onderzoekers zich tot machine learning gewend, waarbij computers worden gebruikt om patronen in gegevens te vinden die mensen misschien missen. Veel van deze computermodellen vertrouwen echter op private gegevens die alleen grote bedrijven kunnen inzien, of ze vereisen complexe moleculaire informatie die niet altijd beschikbaar is. Dit laat kleinere groepen en academische onderzoekers zonder een duidelijke manier om de kans op succes van een studie in te schatten.
Een nieuwe studie door de onafhankelijke onderzoeker Michael Doane onderzoekt of de openbare registers van deze studies, die voor iedereen online leesbaar zijn, voldoende informatie bevatten om deze voorspellingen te doen. De studie richt zich op een enorme collectie registraties van studies uit een publieke website genaamd ClinicalTrials.gov. Deze website fungeert als een wereldwijd register waar onderzoekers hun studies moeten registreren voordat ze beginnen, waarbij details worden gepost over de ziekte die wordt behandeld, het medicijn dat wordt getest, het aantal betrokken patiënten en de doelen van het onderzoek. Doanes werk stelt een eenvoudige vraag: als je de tekstuele beschrijvingen uit deze openbare registers in een computer voert, kan de computer dan leren het verschil te zien tussen studies die zullen slagen en die welke zullen falen?
Om dit te beantwoorden, gebruikte de onderzoeker een dataset genaamd de Clinical Trial Outcome Dataset, die een label biedt voor ongeveer 125.000 eerdere studies, waarbij ze als succesvol of onsuccesvol worden gemarkeerd op basis van hun uiteindelijke resultaten. De uitdaging was om een model te bouwen dat deze uitkomsten kon voorspellen met behulp van alleen de tekst die op het moment van registratie van de studie beschikbaar was op het openbare register, zonder de uiteindelijke resultaten te bekijken of gebruik te maken van private bedrijfsgegevens. De onderzoeker moest uiterst voorzichtig zijn om een veelvoorkomende fout te vermijden, genaamd "data leakage" (gegevenslekkage), waarbij een computermodel per ongeluk het antwoord leert door een deel van de tekst te lezen dat na afloop van de studie is bijgewerkt. Bijvoorbeeld, een samenvatting van een studie kan jaren later opnieuw worden geschreven om de definitieve resultaten op te nemen, en als de computer die bijgewerkte tekst leest, voorspelt hij niet echt de toekomst; hij leest dan simpelweg het verleden.
Om dit te voorkomen, heeft de onderzoeker de gegevens zorgvuldig schoongemaakt door alle records te verwijderen waar de tekst mogelijk na bekend worden van de uitkomst is gewijzigd. Ze sloten ook specifieke velden uit die direct de resultaten beschrijven. Zodra de gegevens veilig waren, trainde de onderzoeker drie verschillende soorten computermodellen om patronen in de resterende tekst te zoeken. Deze modellen werden getest op studies uit verschillende ontwikkelingsfasen, ook wel fasen genoemd. Fase 1-studies zijn de eerste keer dat een medicijn bij mensen wordt getest om de veiligheid te controleren; Fase 2-studies kijken of het medicijn daadwerkelijk werkt; en Fase 3-studies zijn grote studies die de effectiviteit en veiligheid van het medicijn bevestigen voordat het kan worden goedgekeurd.
De resultaten toonden aan dat de computermodellen inderdaad nuttige signalen konden vinden in de publieke tekst. Het best presterende model, dat gebruikmaakte van een methode genaamd random forest, kon succesvolle en mislukte studies beter onderscheiden dan door toeval alleen. In de vroegste fase van testen, Fase 1, presteerde het model erg goed en rangschikte de uitkomsten correct in ongeveer 74 procent van de gevallen. Dit betekent dat als je een groep Fase 1-studies zou nemen, het model de studies die grotere kans van slagen hebben, met een hoge mate van nauwkeurigheid zou kunnen identificeren. De prestaties waren lager voor Fase 2-studies, die berucht moeilijk te voorspellen zijn omdat ze sterk afhangen van de vraag of het medicijn het juiste biologische doelwit bereikt, een detail dat vaak ontbreekt in publieke samenvattingen. Toch presteerde het model in deze fase ook beter dan door toeval alleen.
Een van de meest interessante bevindingen was dat het trainen van het model op een grote verscheidenheid aan ziekten hielp bij het voorspellen van de uitkomsten voor een specifieke groep ziekten, bekend als neurowetenschappen. Neurowetenschappelijke studies, die gaan over aandoeningen zoals de ziekte van Alzheimer en depressie, hebben historisch gezien zeer hoge uitvalpercentages. De onderzoeker ontdekte dat wanneer de computer werd getraind op studies uit alle medische velden, en niet alleen op neurowetenschappen, de computer beter werd in het voorspellen van het succes van neurowetenschappelijke studies. Dit suggereert dat de algemene regels voor hoe een klinische studie wordt ontworpen en uitgevoerd, vergelijkbaar zijn over verschillende soorten ziekten heen, en dat het leren van een breed scala aan voorbeelden de computer helpt de specifieke uitdagingen van het zenuwstelsel te begrijpen.
De studie testte het model ook tegen een set van 7.260 moeilijke gevallen die handmatig door menselijke experts waren beoordeeld om te garanderen dat ze niet gemakkelijk te raden waren. Zelfs tegen deze uitdagende voorbeelden behield het model zijn vermogen om onderscheid te maken tussen succes en falen, wat bewees dat het niet alleen eenvoudige regels aan het onthouden was, maar daadwerkelijk iets leerde over de aard van klinische studies. De onderzoeker controleerde ook of het model vertrouwde op de namen van de bedrijven die de studies sponsorden of de locaties waar ze werden gehouden. Toen deze details werden verwijderd, daalde de prestatie van het model slechts licht, wat aangeeft dat de tekst die de wetenschap en het ontwerp van de studie beschreef, het grootste voorspellende gewicht droeg.
Dit werk laat zien dat publieke informatie, die al jaren beschikbaar is maar op deze manier grotendeels onbenut is gebleven, aanzienlijke waarde heeft voor de farmaceutische industrie. De gebruikte modellen zijn relatief eenvoudig en vereisen geen krachtige supercomputers of geheime gegevens; ze kunnen op een standaard laptop draaien. Dit maakt de aanpak toegankelijk voor academische onderzoekers, non-profitorganisaties en kleinere bedrijven die geen toegang hebben tot propriëtaire databases. Door een manier te bieden om de waarschijnlijkheid van succes in te schatten met behulp van alleen openbare gegevens, biedt deze methode een nieuw hulpmiddel voor het screenen van kandidaat-geneesmiddelen. Het vervangt niet de noodzaak voor deskundige oordeelsvorming of het complexe werk van medicijnontwikkeling, maar het biedt een betrouwbaar, objectief startpunt. Het kan teams helpen beslissen welke programma's meer aandacht verdienen en welke mogelijk vroegtijdig gestopt moeten worden, wat potentieel tijd, geld en het welzijn van de patiënten die vrijwilliger zijn voor deze cruciale studies kan besparen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.