Extending Deep Cox Survival Models with Case-Cohort risk set Sampling
Dit artikel introduceert en evalueert de eerste integratie van case-cohort risk-set sampling in deep Cox proportional hazards neurale netwerken, waarbij wordt aangetoond dat hoewel nested case-control sampling consistent de prestaties van de volledige risk-set benadert, mini-batch training case-cohort sampling in staat stelt om vergelijkbare nauwkeurigheid te bereiken met aanzienlijke computationele besparingen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de wereld van medisch onderzoek en engineering is het voorspellen wanneer iets zal gebeuren vaak waardevoller dan weten precies wanneer het zal gebeuren. Of het nu gaat om het falen van een machineonderdeel of het overleven van een patiënt door een ziekte, wetenschappers gebruiken een methode genaand overlevingsanalyse om de tijd tot een gebeurtenis te bestuderen. Een grote uitdaging in dit veld is dat studies vaak eindigen voordat elke proefpersoon de gebeurtenis heeft ervaren; sommige mensen zijn nog in leven wanneer de studie sluit, of een machine werkt nog steeds. Dit staat bekend als rechts-gecensureerde data, en dit vereist speciale statistische instrumenten om de onvolledige informatie te verwerken zonder de waardevolle data die wel bestaat weg te gooien. Decennialang is het standaardinstrument hiervoor een model dat het risico berekent op basis van een groep mensen die op elk gegeven moment nog in aanmerking komen voor risico, ook wel de risicogroep genoemd.
Nu de hoeveelheid data is geëxplodeerd, met moderne studies die duizenden patiënten en miljoenen datapunten volgen, zijn deze traditionele berekeningen een flessenhals geworden. Om de data te verwerken, moet een computer naar elke persoon die nog in de studie zit te kijken telkens wanneer er een gebeurtenis plaatsvindt, een proces dat enorme rekenkracht en geheugen vereist. Dit creëert een barrière voor het gebruik van moderne, krachtige kunstmatige intelligentie-technieken, die gedijen bij grote datasets maar worstelen wanneer ze worden gedwongen deze zware, repetitieve berekeningen uit te voeren. Onderzoekers vragen zich nu af hoe ze de nauwkeurigheid van deze geavanceerde modellen kunnen behouden terwijl ze ze snel genoeg maken om te draaien op de enorme datasets van de eenentwintigste eeuw.
Een team van onderzoekers van universiteiten in Zuid-Afrika, Duitsland en het Verenigd Koninkrijk heeft dit probleem aangepakt door een nieuwe manier te testen om diepe neurale netwerken te trainen, een type kunstmatige intelligentie dat ontworpen is om complexe patronen in data te vinden. Hun doel was om te zien of ze het trainingsproces konden versnellen door niet naar elke persoon in de studie tegelijk te kijken, maar in plaats daarvan naar een zorgvuldig gekozen steekproef. Ze vergeleken twee verschillende steekproefstrategieën: één die telkens bij elke gebeurtenis een paar nieuwe mensen kiest om tegenover elkaar te plaatsen, en een andere die een vaste groep mensen kiert aan het begin van de studie en bij hen blijft. Ze testten deze methoden op zowel computergegenereerde data, waarbij het juiste antwoord bekend is, als op een real-world dataset van borstkankerpatiënten, waarbij ze maten hoe goed de modellen overleving voorspelden en hoeveel computergeheugen en tijd ze vereisten.
De onderzoekers ontdekten dat de methode die een nieuwe groep mensen kiest voor elke gebeurtenis, bekend als nested case-control sampling, bijna perfect werkt. Of ze nu de volledige dataset gebruikten of slechts een kleine steekproef, deze aanpak produceerde voorspellingen die bijna identiek waren aan de trage, zware methode die naar iedereen kijkt. Het model leerde de juiste patronen, en de voorspellingen waren net zo accuraat als de standaardbenadering, maar deed dit zonder de enorme computationele kosten. Dit suggereert dat onderzoekers voor veel grootschalige problemen veilig deze steekproeftruc kunnen gebruiken om hun modellen veel sneller te laten draaien zonder verlies van voorspellende kracht.
De tweede methode, case-cohort sampling genoemd, gedroeg zich anders en onthulde een complexer verhaal. Wanneer de onderzoekers een zeer kleine vaste groep mensen gebruikten om de hele studie te vertegenwoordigen, had het model aanzienlijke problemen. In tests met een kleine groep daalde het vermogen van het model om tussen hoog-risico en laag-risico patiënten te onderscheiden scherp, en werden de voorspellingen onbetrouwbaar. De onderzoekers ontdekten echter dat de manier waarop de computer de data verwerkt alles verandert. Wanneer ze overschakelden van het verwerken van de hele dataset tegelijkertijd naar het verwerken van de data in kleine, snelle batches, verbeterde de prestatie van de kleine vaste groep drastisch. Met deze snellere verwerkingsstijl kon zelfs een kleine groep de computer helpen effectief te leren, waarbij het grootste deel van de nauwkeurigheid werd hersteld terwijl er nog steeds een groot deel aan rekenbronnen werd bespaard.
De studie keek ook naar hoe deze methoden de computer zelf beïnvloeden. De traditionele manier van het tegelijkertijd verwerken van alle data vereist een enorme hoeveelheid geheugen, die vaak zes gigabyte of meer bereikt, wat standaardcomputers kan laten crashen. Door over te schakelen naar de batch-aanpak, daalde het geheugengebruik naar minder dan een halve gigabyte, waardoor deze geavanceerde modellen toegankelijk werden op veel kleinere machines. De onderzoekers observeerden dat terwijl de methode met de kleine vaste groep instabiel was wanneer de computer alles tegelijk bekijkt, de batch-aanpak de fouten gladstreek, waardoor het model gestaag kon leren. Deze afweging tussen de omvang van de steekproef en de manier waarop de data wordt verwerkt biedt wetenschappers een nieuw instrumentarium: ze kunnen kiezen om een methode te gebruiken die altijd robuust is, of ze kunnen een kleinere, snellere methode gebruiken als ze bereid zijn aan te passen hoe de computer de data afhandelt.
Uiteindelijk overbrugt dit werk de kloof tussen klassieke statistiek en moderne kunstmatige intelligentie. Het laat zien dat het zware werk dat nodig is om overlevingsdata te analyseren, niet gedaan hoeft te worden door naar elke persoon in de studie op elk enkel moment te kijken. Door slimme steekproeftechnieken te gebruiken, met name wanneer deze gecombineerd worden met moderne trainingsmethoden, kunnen onderzoekers krachtige modellen bouwen die zowel accuraat als efficiënt zijn. De bevindingen suggereren dat voor de toekomst van de overlevingsanalyse de sleutel niet alleen het hebben van meer data is, maar weten hoe je ernaar kijkt op een manier die de limieten van onze computers respecteert terwijl de waarheid verborgen in de cijfers behouden blijft.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.