Hidden Universal Collapse Behind Apparent Robustness: Dual-Metric Cross-Site Audit of a Laparoscopic Surgical AI Detector
Cette étude démontre que les évaluations à métrique unique peuvent masquer l'effondrement universel des modèles d'IA chirurgicale à travers différents sites en mettant en évidence une apparente robustesse dans des classes spécifiques, alors que des audits à double métrique révèlent des défaillations généralisées et que, dans les configurations testées, la substitution du backbone n'a pas permis de combler l'écart, que ce soit pour les détecteurs personnalisés ou les modèles de fondation pré-entraînés.