Deep neural networks with Fisher vector encoding for medical image classification
Dieser Beitrag schlägt vor, Fisher-Vector-Codierung mit hybriden CNN-ViT-Architekturen zu integrieren, um die Klassifizierung medizinischer Bilder über unterschiedliche Datensatzgrößen hinweg zu verbessern, indem rechnerische Einschränkungen durch eine skalierbare GMM-Schätzmethode adressiert werden, während gleichzeitig state-of-the-art- oder wettbewerbsfähige Ergebnisse auf mehreren Benchmarks erzielt werden.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie versuchen, einem Roboter beizubringen, verschiedene Arten von medizinischen Bildern zu erkennen, wie Röntgenaufnahmen oder Hautscans. Der Roboter muss lernen, was eine „gesunde" Lunge von einer „kranken" unterscheidet oder wie man einen Muttermal erkennt, der möglicherweise gefährlich ist.
Dieser Artikel stellt eine neue Methode vor, um diesen Roboter zu unterrichten, die speziell dafür entwickelt wurde, sowohl mit einem winzigen Haufen Fotos als auch mit einer riesigen Bibliothek davon gut zu funktionieren. Hier ist die Geschichte, wie sie es mit einigen einfachen Analogien geschafft haben.
Das Problem: Zwei verschiedene Werkzeuge, ein großes Durcheinander
Die Forscher starteten mit zwei leistungsstarken Werkzeugen, die in der Welt der KI beliebt sind:
- CNNs (Faltende Neuronale Netze): Stellen Sie sich diese als einen Roboter mit sehr scharfen, lokalen Augen vor. Er ist hervorragend darin, kleine Details zu erkennen (wie eine spezifische Textur in einer Zelle), übersieht aber manchmal das „große Ganze", weil er sich zu sehr auf die unmittelbare Nachbarschaft konzentriert.
- ViTs (Vision Transformer): Stellen Sie sich diese als einen Roboter mit superweiter Sicht vor. Er kann sehen, wie verschiedene Teile des Bildes global miteinander zusammenhängen. Allerdings ist er etwas „gefräßig" – er braucht eine massive Menge an Nahrung (Daten), um zu lernen, und wird sehr verwirrt, wenn die Bilder riesig sind (wie hochauflösende medizinische Scans).
Die Forscher wollten diese beiden zu einem Hybrid-Roboter kombinieren, der sowohl scharfe lokale Augen als auch weite Sicht besitzt. Aber es gab einen Haken: Wenn man sie mischt, braucht man immer noch eine Möglichkeit, alle Informationen, die der Roboter sieht, in einen einzigen „Zeugnisbogen" zusammenzufassen, damit er eine endgültige Entscheidung treffen kann.
Die Lösung: Der „Fisher-Vector"-Zeugnisbogen
Normalerweise verwenden KI-Modelle eine einfache Methode, um ein Bild zusammenzufassen, wie das Bilden eines Durchschnitts aller Werte (Global Average Pooling). Die Autoren entschieden sich für etwas viel Sophistizierteres, sogenannte Fisher-Vektoren.
Die Analogie: Das Musikfestival vs. die Playlist
- Standardmethode (Durchschnittspooling): Stellen Sie sich vor, Sie sind auf einem Musikfestival. Die Standardmethode fragt: „Was war die durchschnittliche Lautstärke?" Sie liefert Ihnen eine einzelne Zahl. Es ist schnell, verliert aber alle Nuancen. Hat die Menge gejubelt? Gab es ein Solo? Das wissen Sie nicht.
- Fisher-Vector-Methode: Diese Methode ist wie das Erstellen einer detaillierten Playlist und eines Stimmungsberichts der Menge. Anstatt nur einen Durchschnitt zu nehmen, betrachtet sie jeden einzelnen gespielten Song und jeden gehörten Jubel. Sie vergleicht sie mit einem „Standard"-Modell dessen, wie ein typisches Festival klingt. Sie notiert: „Dieser Song war lauter als üblich" oder „Dieser Jubel war häufiger als normal".
Indem der Roboter dies tut, erstellt er eine viel reichhaltigere, detailliertere Beschreibung des Bildes. Dies ist besonders hilfreich, wenn Sie nicht Tausende von Beispielen haben, aus denen Sie lernen können (ein häufiges Problem in der Medizin, wo das Erhalten von gelabelten Daten schwierig und teuer ist).
Die Hürde: Das „Bibliothek"-Problem
Es gab ein großes Problem bei der Verwendung dieser detaillierten „Fisher-Vector"-Methode auf großen Datensätzen. Um diesen detaillierten Bericht zu erstellen, muss die KI eine komplexe statistische Karte (eine sogenannte Gaußsche Mischverteilung oder GMM) aller Daten erstellen, die sie gesehen hat.
Die Analogie: Der überforderte Bibliothekar
Stellen Sie sich vor, Sie sind ein Bibliothekar, der versucht, eine Bibliothek zu organisieren.
- Wenn Sie 100 Bücher haben, können Sie jedes einzelne lesen und einen perfekten Katalog erstellen.
- Wenn Sie 10 Millionen Bücher haben, dauert es ewig, jedes einzelne zu lesen, um den Katalog zu erstellen, und es lässt Ihr Gehirn brechen (Rechenkosten).
In der Vergangenheit versuchten die Leute, dieses Problem zu lösen, indem sie die meisten Bücher wegwarfen und nur einige wenige lasen. Aber die Autoren waren besorgt, dass dies den Katalog ungenau machen könnte.
Die Innovation: Die „intelligente Stichprobe"
Die Autoren kamen auf einen klugen Trick, um das Problem des „überforderten Bibliothekars" zu lösen, ohne wichtige Informationen zu verlieren.
- Der Entropie-Filter: Anstatt Bücher zufällig auszuwählen, betrachteten sie das „Chaos" oder die „Informationsdichte" jedes Bildes (genannt Entropie). Sie wählten die interessantesten, komplexesten Bilder aus, um ihren Katalog zu erstellen, und ignorierten die langweiligen, einfachen.
- Das Ergebnis: Sie stellten fest, dass sie durch die Verwendung nur eines kleinen, intelligent ausgewählten Ausschnitts der Daten (wie 2 % des Gesamtvolumens) einen Katalog erstellen konnten, der fast identisch mit einem war, der aus der gesamten Bibliothek erstellt wurde. Dies sparte massive Mengen an Rechenleistung.
Das „verlustfreie" Zusammenfügen
Ein weiteres Problem entstand, weil der Hybrid-Roboter das Bild in verschiedenen „Zoomstufen" (Stufen) betrachtet. Einige Ansichten sind hochauflösend (viele winzige Details), andere sind niedrigauflösend (breite Formen).
- Alter Weg: Um sie zu vergleichen, würden die Leute hochauflösende Details verkleinern, um sie in die niedrigauflösende Ansicht zu passen, wodurch effektiv die feinen Details verworfen wurden.
- Neuer Weg: Die Autoren erfanden eine verlustfreie Zusammenfügemethode. Stellen Sie sich vor, Sie haben ein großes Puzzle und ein kleines Puzzle. Anstatt das große zu quetschen, brachen sie die großen Puzzleteile in kleinere, kompatible Teile auf, die perfekt in das kleine Puzzle passen, ohne dass ein Bild verloren geht. Dies ermöglichte es ihnen, alle verschiedenen „Ansichten" des Roboters zu einem superleistungsstarken Bericht zu kombinieren.
Die Ergebnisse: Das medizinische Spiel gewinnen
Das Team testete ihren neuen „Hybrid-Roboter mit intelligenten Zeugnisbögen" an mehreren medizinischen Bilddatensätzen:
- MedMNIST: Eine Sammlung kleiner, standardisierter medizinischer Bilder (wie 28x28 Pixel große Röntgenaufnahmen und CT-Scans).
- Real-World-Tests: Größere, realistischer Bilder von Hautläsionen (ISIC2018) und COVID-19-Lungenscans (Clean-CC-CCII).
Das Ergebnis:
- Auf den kleinen Datensätzen schlug ihr Modell alle vorherigen Rekorde (Benchmark). Es bewies, dass der „Fisher-Vector"-Ansatz eine Superkraft ist, wenn Daten knapp sind.
- Auf den größeren, realen Datensätzen performte es genauso gut oder besser als die fortschrittlichsten Modelle, die derzeit in der Literatur zu finden sind, trotz geringerer Rechenressourcen.
Zusammenfassung
Kurz gesagt bauten die Autoren einen medizinischen Bildklassifizierer, der:
- Das Beste aus zwei KI-Welten kombiniert (CNNs und Transformer).
- Einen sophistizierten „detaillierten Zeugnisbogen" (Fisher-Vektoren) verwendet, um Bilder tiefgehend zu verstehen.
- Das Problem „zu viele Daten" löst, indem er nur die interessantesten Bilder intelligent auswählt, um seine statistische Karte zu erstellen.
- Beweist, dass man keinen massiven Supercomputer braucht, um erstklassige medizinische KI-Ergebnisse zu erzielen; man braucht nur eine intelligentere Art, die vorhandenen Daten zu organisieren.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.