← Neueste Arbeiten
💻 computer science

Beyond Accuracy: A Comprehensive Evaluation of ResNet50 and Vision Transformer for Trustworthy Pneumonia Detection from Chest X-Ray Images

Diese Studie präsentiert eine umfassende Evaluierung von ResNet50 und Vision Transformer (ViT-B16) zur Erkennung von Pneumonie in Thorax-Röntgenaufnahmen, wobei sich zeigt, dass ResNet50 zwar eine überlegene Genauigkeit, Kalibrierung und Effizienz bietet, ViT-B16 jedoch eine größere Robustheit gegenüber Bilddegradationen aufweist, wodurch die Notwendigkeit einer multidimensionalen Bewertung für vertrauenswürdige Diagnosesysteme hervorgehoben wird.

Ursprüngliche Autoren: VISHAL MANTA

Veröffentlicht 2026-07-16
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: VISHAL MANTA

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie sind ein Detektiv, der versucht, ein Rätsel zu lösen, aber anstatt nach Fingerabdrücken zu suchen, sucht er nach unsichtbaren Hinweisen im Inneren eines Menschenkörpers. Dies ist die Welt der medizinischen Bildgebung, in der Ärzte spezielle Kameras verwenden, um Bilder von Lungen zu machen, um zu sehen, ob sie krank sind. Lange Zeit waren die besten Detektive menschliche Ärzte, aber sie werden müde, und manchmal sind die Hinweise so winzig oder verschwommen, dass selbst die schärfsten Augen sie übersehen. Um zu helfen, haben Wissenschaftler „digitale Detektive“ gebaut, die auf einem Zweig der Informatik namens Deep Learning basieren. Betrachten Sie diese digitalen Detektive als superintelligente Roboter, die lernen, indem sie tausende von Bildern betrachten, bis sie in der Lage sind, ein Problem aus eigener Kraft zu erkennen.

Es gibt zwei Haupttypen dieser Roboter-Detektive. Der erste Typ ist wie ein sorgfältiger Künstler, der ein Bild Pinselstrich für Pinselstrich betrachtet und darauf achtet, wie Kanten und Texturen miteinander verbunden sind. Dies wird als Convolutional Neural Network (CNN) bezeichnet. Der zweite Typ ist wie ein Vogel, der hoch über einem Wald fliegt; er betrachtet nicht jedes einzelne Blatt, sondern sieht stattdin, wie der gesamte Wald aus der Ferne zusammenhängt und interagiert. Dies wird als Vision Transformer (ViT) bezeichnet. Beide sind unglaublich leistungsstark, aber Ärzte müssen wissen, welcher von ihnen tatsächlich besser darin ist, Leben zu retten, bevor sie ihnen in einem Krankenhaus vertrauen. Es reicht nicht aus, nur schnell zu sein oder meistens die richtige Antwort zu geben; der Roboter muss auch ehrlich über seine Sicherheit sein, robust genug sein, um mit schlechten Fotos umzugehen, und für einen menschlichen Arzt leicht erklärbar sein.


In dieser Studie entschied ein Forscher namens Vishal Manta vom Indian Institute of Technology Guwahati, zwei dieser digitalen Detektive in einem fairen Kampf gegeneinander antreten zu lassen, um zu sehen, welcher am vertrauenswürdigsten ist, wenn es darum geht, Pneumonie (eine schwere Lungeninfektion) zu entdecken. Die beiden Kontender waren ResNet50, der sorgfältige Künstler (CNN), und ViT-B16, der hochfliegende Vogel (Vision Transformer). Sie fragten nicht nur: „Wer hat die meisten Antworten richtig bekommen?“ Stattdessen errichteten sie einen massiven Hindernisparcours, um alles zu testen: wie genau sie waren, wie ehrlich sie in Bezug auf ihr Vertrauen waren, wie schnell sie waren und wie gut sie mit einem verschwommenen oder verrauschten Bild umgehen konnten.

Die Ergebnisse dieses Rennens waren recht eindeutig. Wenn es um die Hauptaufgabe des Erkennens von Pneumonie ging, war ResNet50 der Champion. Er identifizierte Pneumonie-Fälle zu 84,56 % der Zeit korrekt, während der Vision Transformer 81,14 % erreichte. Der Forscher verwendete einen speziellen statistischen Test namens McNemar-Test, um sicherzustellen, dass dies nicht nur ein glücklicher Zufall war, und die Mathematik bestätigte, dass ResNet50 in der Tat signifikant besser war. Aber die Geschichte endete dort nicht. Die Studie fand heraus, dass ResNet50 auch der ehrlichere Detektiv war. Wenn er sagte, er sei sich zu „90 % sicher“, lag er meistens richtig. Der Vision Transformer hingegen neigte dazu, übermäßig selbstbewusst zu sein, und behauptete oft, er sei sicher, obwohl er es eigentlich nicht war. In der Welt der Medizin ist Überheblichkeit gefährlich, weil ein Arzt einer falschen Antwort zu sehr vertrauen könnte.

Der Vision Transformer war jedoch kein totaler Verlierer; er besaß eine Superkraft. Als die Forscher die Testfotos absichtlich durch das Hinzufügen von statischem Rauschen (Noise), das Verschwimmen oder das Ändern der Helligkeit manipulierten, hielt der Vision Transformer seine Position besser als ResNet50. Obwohl beide Modelle bei schlechten Fotos schlechter wurden, sank die Genauigkeit des Vision Transformers weniger stark. Es scheint, dass der „Vogel“, weil er das ganze Bild auf einmal betrachtet, immer noch Dinge erkennen kann, selbst wenn Teile des Bildes unscharf sind. Aber diese Superkraft hatte einen hohen Preis. Der Vision Transformer war ein Riese, der 85,80 Millionen einstellbare Parameter benötigte, um zu funktionieren, im Vergleich zu den 23,51 Millionen von ResNet50. Er brauchte auch viel länger zum „Nachdenken“ und benötigte 55,60 Sekunden, um einen Stapel von Bildern zu verarbeiten, gegenüber den 38,57 Sekunden von ResNet50, und er verlangte viel mehr Computerleistung für den Betrieb.

Um sicherzustellen, dass die Roboter tatsächlich auf die Lungen schauen und nicht nur raten, verwendete der Forscher ein Werkzeug namens Grad-CAM, das wie eine Heatmap fungiert und zeigt, worauf der Roboter schaut. Der sorgfältige Künstler (ResNet50) konzentrierte seine Aufmerksamkeit eng auf die kranken Teile der Lunge, was genau das ist, was ein Arzt sehen möchte. Der hochfliegende Vogel (ViT) war in seiner Aufmerksamkeit etwas zerstreuter. Wenn die Roboter Fehler machten, übersah sie meistens die Pneumonie-Fälle und deklarierten sie selbstbewusst als „Normal“, obwohl die Lungen tatsächlich krank waren. Dies deutet darauf darauf hin, dass diese Roboter zwar besser werden, aber immer noch Schwierigkeiten mit den hinterhältigsten, subtilsten Fällen der Krankheit haben.

Letztendlich legt diese Studie nahe, dass, wenn Sie einen zuverlässigen, schnellen und ehrlichen Assistenten für ein Krankenhaus benötigen, das vielleicht keinen Supercomputer besitzt, der sorgfältige Künstler ResNet50 derzeit die bessere Wahl ist. Er ist genauer, ehrlicher in Bezug auf sein Vertrauen und kostengünstiger im Betrieb. Der Vision Transformer ist ein harter Konkurrent, der mit schlechten Fotos gut umgehen kann, aber er ist für viele reale Kliniken derzeit zu schwerfällig und zu teuer. Die wichtigste Erkenntnis ist, dass der Bau einer vertrauenswürdigen medizinischen KI nicht nur daraus besteht, wer die höchste Punktzahl in einem Test erreicht; es geht darum, das richtige Gleichgewicht zwischen Intelligenz, Ehrlichkeit, Geschwindigkeit und der Widerstandsfähigkeit für die reale Welt zu finden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →