Hidden Universal Collapse Behind Apparent Robustness: Dual-Metric Cross-Site Audit of a Laparoscopic Surgical AI Detector
Questo studio dimostra che le valutazioni basate su una singola metrica possono mascherare il collasso universale dei modelli di IA chirurgica tra i diversi siti, evidenziando un'apparente robustezza in classi specifiche, mentre gli audit a doppia metrica rivelano fallimenti diffusi e che la sostituzione del backbone, nelle configurazioni testate, non ha colmato il divario né nei rilevatori personalizzati né nei modelli fondativi pre-addestrati.