Hidden Universal Collapse Behind Apparent Robustness: Dual-Metric Cross-Site Audit of a Laparoscopic Surgical AI Detector
Diese Studie zeigt auf, dass Einzelmetrik-Evaluierungen den universellen Zusammenbruch chirurgischer KI-Modelle über verschiedene Standorte hinweg maskieren können, indem sie eine scheinbare Robustheit in spezifischen Klassen hervorheben, während Dualmetrik-Audits weit verbreitetes Versagen und die Tatsache offenlegen, dass der Austausch des Backbones in den getesteten Konfigurationen die Lücke nicht schließen konnte, sowohl bei maßgeschneiderten Detektoren als auch bei vortrainierten Foundation-Modellen.