Label-Free Threshold Selection for Out-of-Distribution Detection in Liver CT Segmentation
Dit artikel stelt een label-vrij raamwerk voor het kalibreren van out-of-distribution detectiedrempels in lever CT-segmentatie door een log-t-distributie aan te passen aan paarwijze oppervlakte DSC-scores, wat statistisch gefundeerde categorisering van faalrisico's mogelijk maakt zonder dat daarvoor door experts gelabelde faalgegevens nodig zijn.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer
In moderne ziekenhuizen wordt steeds vaker van computers gevraagd om de delicate taak uit te voeren van het tekenen van nauwkeurige contouren rond organen binnen het menselijk lichaam. Wanneer een patiënt een computertomografie-scan ondergaat, genereert een machine duizenden dwarsdoorsneden, en moet software de lever identificeren door deze te scheiden van het omliggende weefsel, zodat artsen behandelingen kunnen plannen of tumoren kunnen meten. Hoewel deze geautomatiseerde systemen uitstekend werken op typische scans, kunnen ze struikelen wanneer ze worden geconfronteerd met ongewone anatomie of zeldzame beeldkwaliteiten die verschillen van de gegevens waarop ze oorspronkelijk zijn getraind. Als een computer een grens onjuist tekent en niemand het merkt op, kan een arts een behandelbeslissing nemen op basis van foutieve informatie. Om dit te voorkomen, hebben onderzoekers methoden ontwikkend om deze momenten van onzekerheid te signaleren, wat de computer in feite een manier geeft om te zeggen: "Ik weet het hier niet zeker over." De uitdaging is geweest om precies te bepalen wanneer het alarm moet afgaan zonder dat eerst een menselijke expert duizenden afbeeldingen hoeft te beoordelen, een proces dat traag, duur en vaak onmogelijk is wanneer fouten zeldzaam zijn.
Een team van onderzoekers van The University of Texas MD Anderson Cancer Center heeft een nieuwe manier voorgesteld om deze veiligheidsalarmen in te stellen zonder afhankelijk te zijn van menselijke labels om het systeem te leren hoe een fout eruitziet. In hun studie richtten zij zich op leverscans en vroegen zij zich af of een computer kon leren zijn eigen fouten te herkennen door simpelweg naar de patronen van zijn eigen succesvolle werk te kijken. In plaats van het systeem duizenden voorbeelden van slechte scans te tonen om te leren wat het moet vermijden, lieten ze het systeem de scores bestuderen die het gaf aan een grote groep normale, succesvolle scans. Ze ontdekten dat de scores voor goede scans een voorspelbare wiskundige vorm volgden, vergelijkbaar met hoe de lengtes van mensen in een grote menigte de neiging hebben om rond een gemiddelde te clusteren. Door deze vorm van succes in kaart te brengen, konden ze elke nieuwe scan identificeren die ver buiten het verwachte patroon viel.
De onderzoekers testten dit idee op een collectie van vijfhonderd leverscannen, inclusief beelden van hun eigen ziekenhuis en van meer dan zeventig verschillende medische locaties in zeven landen. Ze gebruikten een methode die de contour van de computer op meerdere manieren met zichzelf vergelijkt om een enkele score te genereren die vertegenwoordigt hoe zelfverzekerd het systeem is. Toen ze hun nieuwe aanpak toepasten, merkten ze dat ze deze scans konden sorteren in drie groepen: laag risico, medium risico en hoog risico. De groep met een laag risico bevatte scans die erg leken op de succesvolle scans die het systeem had bestudeerd. De groep met een hoog risico bevatte scans die er zeer vreemd uitzagen. Cruciaal was dat de groep met een medium risico zo was ontworpen dat deze alles zou vangen wat een probleem zou kunnen vormen. Toen ze de resultaten controleerden, bleek dat elke scan die een menselijke expert later als een fout identificeerde, werd opgevangen door ofwel de medium- of de hoog-risicocategorie. Sterker nog, het systeem ving alle fouten met 100% sensitiviteit, wat betekent dat het er geen enkele heeft gemist, terwijl het tegelijkertijd bijna 80% van de goede scans correct als veilig identificeerde.
Deze aanpak biedt een aanzienlijk voordeel ten opzichte van eerdere methoden, die doorgaans vereisten dat experts handmatig honderden afbeeldingen beoordeelden om te beslissen waar de lijn tussen een veilige scan en een gevaarlijke scan getrokken moest worden. Dat handmatige proces is een zware last, vooral omdat slechte scans zeldzaam zijn; het vinden van genoeg voorbeelden om het systeem te onderwijzen kost meestal veel tijd. De nieuwe methode omzeilt deze behoefte volledig. Door een curve aan te passen aan de scores van de succesvolle scans, creëerden de onderzoekers een referentiepunt dat fungeert als een standaard voor normaliteit. Elke nieuwe scan die een score produceert die ver afwijkt van deze standaard, wordt gemarkeerd voor beoordeling. De studie toonde aan dat deze methode effectief bleef, zelfs wanneer de groep scans die werd gebruikt om de standaard op te bouwen een klein aantal slechte voorbeelden bevatte, wat suggereert dat het systeem robuust genoeg is voor gebruik in de echte wereld waar perfecte gegevens moeilijk te verkrijgen zijn.
De onderzoekers verkenden ook hoe ze verschillende soorten scoresystemen konden afhandelen. Terwijl het ene type score perfect paste in de wiskundige vorm die ze verwachtten, paste een ander type dat niet. Voor het type dat niet paste, gebruikten ze een andere techniek om de gegevens te herschikken zodat ze aan het patroon voldeden, waarmee ze bewezen dat hun raamwerk flexibel genoeg is om met diverse manieren van vertrouwensmeting om te gaan. Ze ontdekten dat ze door twee verschillende drempelwaarden te gebruiken, het systeem naar verschillende behoeften konden afstemmen. De ene drempelwaarde werd ingesteld om zeer gevoelig te zijn, waarbij elke mogelijke fout werd gevangen, zelfs als dat betekende dat een paar goede scans als verdacht werden gemarkeerd. De andere drempelwaarde was strikter en identificeerde een kleinere groep scans die vrijwel zeker slecht waren, wat artsen helpt om hun aandacht te prioriteren wanneer zij beperkte tijd hebben.
Uiteindelijk toont dit werk aan dat computers hun eigen grenzen kunnen leren herkennen zonder expliciet te worden onderwezen in wat een fout is. Het systeem vervangt de arts niet; het biedt eerder een duidelijk, op data gebaseerd signaal over welke scans een nadere blik verdienen. Door complexe getallen om te zetten in eenvoudige risicocategorieën, hebben de onderzoekers een hulpmiddel gecreëerd dat ziekenhuizen kan helpen om geautomatiseerde beeldvormingsinstrumenten veiliger en efficiënter in te zetten. De bevindingen suggereren dat naarmate kunstmatige intelligentie gebruikelijker wordt in de geneeskunde, we kunnen vertrouwen op de patronen van haar eigen succes om ons te beschermen tegen haar zeldzame fouten, zodat de technologie een betrouwbare partner blijft in de patiëntenzorg.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.