Hidden Universal Collapse Behind Apparent Robustness: Dual-Metric Cross-Site Audit of a Laparoscopic Surgical AI Detector
Deze studie toont aan dat evaluaties met één enkele metriek de universele instorting van chirurgische AI-modellen over verschillende locaties kunnen maskeren door een schijnbare robuustheid in specifieke klassen te benadrukken, terwijl audits met twee metrieken wijdverspreide uitval en het feit onthullen dat de vervanging van de backbone, in de door ons geteste configuraties, het gat niet wist in zowel aangepaste detectoren als voorgetrainde fundamentmodellen.