← Nieuwste papers
💻 computer science

Identical runs disagree more than different models: reproducibility limits in deep learning for brain-tumour MRI classification

Deze studie toont aan dat ongecontroleerde stochastische variaties in nominaal identieke deep learning-runs voor de classificatie van hersentumor-MRI de prestatieverschillen tussen verschillende modelarchitecturen kunnen overtreffen, hetgeen de betrouwbaarheid van standaard ablatiestudies ondermijnt en striktere protocollen voor reproduceerbaarheid noodzakelijk maakt.

Oorspronkelijke auteurs: Md Mostafizur Rahman

Gepubliceerd 2026-09-22
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Md Mostafizur Rahman

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de hooggestoken wereld van medische beeldvorming wordt steeds vaker van computers gevraagd om naar foto's van de menselijke hersenen te kijken en tumoren op te sporen. Deze afbeeldingen, genaamd MRI-scans, zijn complex en gedetailleerd, en de software die wordt gebruikt voor de analyse ervan, vertrouwt op een type kunstmatige intelligentie dat bekend staat als deep learning. Om deze systemen te trainen, voeden onderzoekers ze met duizenden afbeeldingen en laten ze de computer patronen zelfstandig leren, waarbij de interne instellingen miljoenen keren worden aangepast totdat de computer beter wordt in het identificeren van ziekten. Het doel is om een hulpmiddel te creëren waar artsen op kunnen vertrouwen om aandoeningen zoals hersentumoren te diagnosticeren. Echter, voor deze technologie om veilig en nuttig te zijn, moeten de resultaten consistent zijn. Als een computer dezelfde gegevens twee keer te zien krijgt, zou hij idealiter hetzelfde antwoord moeten geven. Wanneer wetenschappers twee verschillende computermodellen vergelijken om te zien welke beter is, kijken ze vaak naar zeer kleine verschillen in nauwkeurigheid, soms slechts een fractie van een procent, om te beslissen welk model door mag naar de praktijktesten.

Een onderzoeker aan de San Francisco Bay University zette zich af om een specifieke idee te testen: of het toevoegen van een specifiek type redenering aan een standaard hersenbeeldvormingscomputermodel het beter zou maken in het opsporen van tumoren. Het standaardmodel kijkt direct naar de afbeelding, terwijl de nieuwe versie probeerde de relaties tussen verschillende delen van de afbeelding te begrijpen, vergelijkbaar met hoe een mens verbanden kan leggen tussen kenmerken. De onderzoeker bouwde een rigoureus experiment om dit te testen, waarbij hij de computermodellen herhaaldelijk liet draaien om te zien of de nieuwe aanpak werkelijk een voordeel bood. Wat hij echter vond, was geen doorbraak in tumordetectie, maar een schokkende ontdekking over de betrouwbaarheid van het testproces zelf. Hij ontdekte dat het eigen trainingsproces van de computer zo onstabiel was dat twee identieke runs van exact hetzelfde model verschillende resultaten konden produceren die groter waren dan de minuscule verschillen die hij probeerde te meten tussen de twee verschillende modellen.

De studie begon met een grote collectie MRI-slices van honderden patiënten, zorgvuldig verdeeld zodat de gegevens van een enkele patiënt niet zowel in de trainingsgroep als in de testgroep voorkwamen. Dit was cruciaal, want als de computer de tumor van dezelfde patiënt in beide groepen zou zien, zou hij simpelweg die specifieke persoon memoriseren in plaats van de ziekte algemeen te leren herkennen. De onderzoeker trainde een standaardmodel en een complexere versie die een extra redeneerlaag bevatte. Hij draaide elk model meerdere keren, waarbij hij een willekeurig startgetal veranderde, een zogenaamde 'seed', om te zien hoe de resultaten varieerden. In de wereld van de informatica is deze seed bedoeld om ervoor te zorgen dat als je met hetzelfde getal begint, de computer elke keer precies hetzelfde doet. De verwachting was dat het complexe model ofwel iets beter of iets slechter zou zijn dan het eenvoudige model, en dat het drie keer draaien van de test een duidelijk gemiddelde zou geven.

In plaats daarvan toonden de resultaten een chaotisch patroon. Wanneer de onderzoeker exact hetzelfde modelconfiguratie twee keer draaide met hetzelfde startgetal, verschilden de nauwkeurigheidsscores gemiddeld met meer dan twee procentpunten. Deze variatie was zo groot dat het de kleine verschillen tussen de twee verschillende modellen die hij vergeleek, volledig overstemde. Sterker nog, het verschil tussen de twee identieke runs was meer dan twee keer zo groot als het verschil tussen het eenvoudige model en het complexe model. Dit betekende dat het experiment in essentie ruis mat in plaats van een signaal. De onderzoeker realiseerde zich dat de computer niet als een betrouwbaar instrument functioneerde; het was also van een weegschaal die gebruikt wordt om gouden munten te wegen, die elke keer een andere waarde aangeeft, zelfs als je op exact dezelfde plek staat.

Door dieper te graven, vond de onderzoeker twee hoofdoorzaken voor deze onbetrouwbaarheid. Ten eerste werd de computer onjuist ingesteld. Het willekeurige startgetal werd toegepast nadat het model al was gebouwd, wat betekende dat de initiële instellingen van het model nog steeds willekeurig en ongecontroleerd waren. Zelfs nadat hij deze fout corrigeerde en het startgetal toepaste voordat het model werd gebouwd, waren de resultaten nog steeds niet perfect identiek. Het tweede probleem zat diep verborgen in de wiskundige motor van de computer. Hoewel de software beweerde in een perfect deterministische modus te draaien, produceerde een specifiek onderdeel van de berekening die werd gebruikt om het model te onderwijzen telkens weer licht afwijkende resultaten. Deze verborgen fout was onzichtbaar voor de standaardcontroles die onderzoekers gebruiken om te waarborgen dat hun experimenten reproduceerbaar zijn.

De studie onthulde ook dat de manier waarop de data wordt gesplitst, de uitkomst drastisch kan veranderen. Wanneer de onderzoeker de data splitste per individuele MRI-slice in plaats van per patiënt, sprong de nauwkeurigheid van de computer met bijna vijf procentpunten omhoog. Dit gebeurde omdat de computer in feite patronen van dezelfde patiënt in zowel de trainingsset als de testset herkende, waardoor hij de patiënt kon herkennen in plaats van de tumor. Dit opgeblazen cijfer was een illusie die de werkelijke bekwaamheid van het model maskeerde. Bovendien, toen de onderzoeker testte hoe goed de modellen omgingen met vervormde of ruizige afbeeldingen, suggereerde één testronde dat het ene model robuuster was, maar toen de test werd herhaald, sloeg het resultaat om en bleek het andere model beter te zijn. Deze omkering bewees dat een enkele experiment niet voldoende is om een conclusie te trekken.

De uiteindelijke conclusie van het werk was dat de extra redeneerlaag de capaciteit om hersentumoren te detecteren niet verbeterde. Het complexe model was niet beter en, op sommige punten, was het minder betrouwbaar en trager. Belangrijker nog, de studie benadrukte een kritiek gebrek in de manier waarop veel medische AI-studies worden uitgevoerd. De verschillen die onderzoekers vaak claimen te vinden, zijn kleiner dan de natuurlijke variatie in het testproces zelf. De onderzoeker betoogde dat voordat wetenschappers een nieuw model kunnen vertrouwen, ze eerst moeten verifiëren of hun testopstelling stabiel genoeg is om kleine veranderingen te detecteren. Dit houdt in dat men controleert of de willekeurige startgetallen correct worden toegepast en dat men dezelfde test twee keer uitvoert om de natuurlijke variatie te meten. Deze controles kosten zeer weinig tijd en inspanning, maar ze worden vaak overgeslagen. Zonder deze controles loopt het vakgebied het risico medische instrumenten te bouwen op fundamenten die te wankel zijn om het gewicht van klinische beslissingen te dragen. Het artikel dient als een herinnering dat, in de zoektocht naar betere medische technologie, het waarborgen dat het meetinstrument accuraat is even belangrijk is als het instrument zelf.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →