Identical runs disagree more than different models: reproducibility limits in deep learning for brain-tumour MRI classification
Diese Studie zeigt auf, dass unkontrollierte stochastische Variationen in nominell identischen Deep-Learning-Durchläufen zur Klassifizierung von Hirntumor-MRT-Aufnahmen die Leistungsunterschiede zwischen unterschiedlichen Modellarchitekturen übersteigen können, wodurch die Zuverlässigkeit standardmäßiger Ablationsstudien untergraben wird und strengere Protokolle zur Reproduzierbarkeit erforderlich werden.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
In der hochriskanten Welt der medizinischen Bildgebung wird immer häufiger von Computern verlangt, Bilder des menschlichen Gehirns zu betrachten und Tumore zu entdecken. Diese Bilder, genannt MRT-Aufnahmen, sind komplex und detailliert, und die Software, die zur Analyse dieser Bilder verwendet wird, stützt sich auf eine Art künstlicher Intelligenz, die als Deep Learning bekannt ist. Um diese Systeme zu trainieren, füttern Forscher sie mit Tausenden von Bildern und lassen den Computer Muster selbstständig erlernen, indem er seine internen Einstellungen Millionen von Malen anpasst, bis er besser darin wird, Krankheiten zu identifizieren. Das Ziel ist es, ein Werkzeug zu schaffen, dem Ärzte vertrauen können, um Erkrankungen wie Hirntumore zu diagnostizieren. Damit diese Technologie jedoch sicher und nützlich ist, müssen die Ergebnisse konsistent sein. Wenn einem Computer dieselben Daten zweimal gezeigt werden, sollte er idealerweise die gleiche Antwort geben. Wenn Wissenschaftler zwei verschiedene Computermodelle vergleichen, um zu sehen, welches besser ist, suchen sie oft nach sehr kleinen Unterschieden in der Genauigkeit, manchmal nur einem Bruchteil eines Prozents, um zu entscheiden, welches Modell den Weg in die reale Testphase antreten darf.
Ein Forscher an der San Francisco Bay University setzte sich zum Ziel, eine spezifische Idee zu testen: ob das Hinzufügen einer speziellen Art von logischem Schlussfolgern zu einem Standardmodell für die Gehirnbildung das Erkennen von Tumoren verbessern würde. Das Standardmodell betrachtet das Bild direkt, während die neue Version versuchte, die Beziehungen zwischen verschiedenen Teilen des Bildes zu verstehen, ähnlich wie ein Mensch die Punkte zwischen Merkmalen verbinden könnte. Der Forscher baute ein strenges Experiment auf, um dies zu testen, indem er die Computermodelle immer und immer wieder laufen ließ, um zu sehen, ob der neue Ansatz tatsächlich einen Vorteil bot. Was er jedoch fand, war kein Durchbruch in der Tumordetektion, sondern eine erschütternde Entdeckung über die Zuverlässigkeit des Testprozesses selbst. Er entdeckte, dass der Trainingsprozess des Computers so instabil war, dass zwei identische Durchläufe desselben Modells unterschiedliche Ergebnisse liefern konnten, die größer waren als die winzigen Unterschiede, die er zwischen den beiden verschiedenen Modellen messen wollte.
Die Studie begann mit einer großen Sammlung von MRT-Schichten von Hunderten von Patienten, die sorgfältig aufgeteilt wurden, sodass die Daten eines einzelnen Patienten nicht sowohl in der Trainings- als das in der Testgruppe auftauchten. Dies war entscheidend, denn wenn der Computer den Tumor desselben Patienten in beiden Gruppen gesehen hätte, hätte er einfach diesen spezifischen Menschen auswendig gelernt, anstatt die Krankheit allgemein zu erkennen. Der Forscher trainierte ein Standardmodell und eine komplexere Version, die die zusätzliche Ebene des logischen Schließens enthielt. Er führte jede Version mehrmals aus und änderte dabei eine Zufallszahl, den sogenannten „Seed“, um zu sehen, wie die Ergebnisse variierten. In der Welt der Informatik soll dieser Seed sicherstellen, dass der Computer bei gleicher Startzahl jedes Mal exakt dasselbe tut. Die Erwartung war, dass das komplexe Modell entweder etwas besser oder etwas schlechter als das einfache wäre und dass das dreimalige Durchführen des Tests einen klaren Durchschnitt ergeben würde.
Stattdessen zeigten die Ergebnisse ein chaotisches Muster. Wenn der Forscher exakt dieselbe Modellkonfiguration zweimal mit derselben Startzahl ausführte, unterschieden sich die Genauigkeitswerte im Durchschnitt um mehr als zwei Prozentpunkte. Diese Variation war so groß, dass sie die kleinen Unterschiede zwischen den beiden verschiedenen Modellen, die er verglich, völlig überlagerte. Tatsächlich war der Unterschied zwischen den beiden identischen Durchläufen mehr als doppelt so groß wie der Unterschied zwischen dem einfachen und dem komplexen Modell. Dies bedeutete, dass das Experiment im Wesentlichen Rauschen statt eines Signals maß. Der Forscher erkannte, dass der Computer sich nicht wie ein zuverlässiges Instrument verhielt; es war, als ob eine Waage, die Goldmünzen wiegt, bei jedem Wiegen ein anderes Ergebnis lieferte, selbst wenn man exakt an derselben Stelle stand.
Bei tieferer Untersuchung fand der Forscher zwei Hauptgründe für diese Unzuverlässigkeit. Erstens wurde der Computer falsch konfiguriert. Die Zufallszahl wurde angewendet, nachdem das Modell bereits aufgebaut worden war, was bedeutete, dass die Anfangseinstellungen des Modells noch zufällig und unkontrolliert waren. Selbst nachdem er diesen Fehler behoben und die Startzahl vor dem Aufbau des Modells angewendet hatte, waren die Ergebnisse immer noch nicht perfekt identisch. Das zweite Problem lag tief in der mathematischen Engine des Computers verborgen. Obwohl die Software vorgab, in einem perfekt deterministischen Modus zu laufen, lieferte ein spezifischer Teil der Berechnung, der das Modell lehrte, jedes Mal leicht unterschiedliche Ergebnisse. Dieser verborgene Fehler war unsichtbar für die Standardprüfungen, die Forscher verwenden, um sicherzustellen, dass ihre Experimente reproduzierbar sind.
Die Studie zeigte auch, dass die Art und Weise der Datentrennung das Ergebnis drastisch verändern kann. Als der Forscher die Daten nach einzelnen MRT-Schichten statt nach Patienten aufteilte, sprang die Genauigkeit des Computers um fast fünf Prozentpunkte nach oben. Dies geschah, weil der Computer im Wesentlichen Muster desselben Patienten sowohl im Trainings- als auch im Testdatensatz wiedererkannte, was es ihm ermöglichte, den Patienten statt des Tumors zu erkennen. Dieser aufgeblähte Wert war eine Illusion, die die wahre Fähigkeit des Modells maskierte. Darüber hinaus, als der Forscher testete, wie gut die Modelle mit verzerrten oder verrauschten Bildern umgingen, deutete ein einzelner Testlauf darauf hin, dass ein Modell robuster sei, doch als der Test wiederholt wurde, kehrte sich das Ergebnis um und zeigte, dass das andere Modell besser war. Diese Umkehrung bewies, dass ein einzelnes Experiment nicht ausreicht, um eine Schlussfolgerung zu ziehen.
Die abschließende Schlussfolgerung der Arbeit war, dass die zusätzliche Ebene des logischen Schließens die Fähigkeit zur Erkennung von Hirntumoren nicht verbesserte. Das komplexe Modell war nicht besser und war in gewisser Weise langsamer und weniger zuverlässig. Viel wichtiger war jedoch, dass die Studie einen kritischen Fehler in der Art und Weise aufzeigte, wie viele medizinische KI-Studien durchgeführt werden. Die Unterschiede, die Forscher oft behaupten zu finden, sind kleiner als die natürliche Variation im Testprozess selbst. Der Forscher argumentierte, dass Wissenschaftler, bevor sie ein neues Modell vertrauen können, zuerst verifizieren müssen, dass ihr Testaufbau stabil genug ist, um kleine Änderungen zu erkennen. Dies beinhaltet die Prüfung, ob die Zufallszahlen korrekt angewendet werden, und das zweimalige Durchführen desselben Tests, um die natürliche Variation zu messen. Diese Prüfungen kosten sehr wenig Zeit und Mühe, werden aber oft übersprungen. Ohne sie läuft das Feld Gefahr, medizinische Werkzeuge auf Fundamenten zu bauen, die zu wackelig sind, um das Gewicht klinischer Entscheidungen zu tragen. Das Paper dient als Erinnerung daran, dass es bei dem Streben nach besserer Medizintechnik ebenso wichtig ist, die Genauigkeit des Messwerkzeugs sicherzustellen, wie das Werkzeug selbst.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.