Hidden Universal Collapse Behind Apparent Robustness: Dual-Metric Cross-Site Audit of a Laparoscopic Surgical AI Detector
Este estudio demuestra que las evaluaciones de métrica única pueden enmascarar el colapso universal de los modelos de IA quirúrgica entre los sitios al resaltar una robustez aparente en clases específicas, mientras que las auditorías de métrica dual revelan fallos generalizados y que la sustitución del backbone, en las configuraciones que probamos, no logró cerrar la brecha tanto en detectores personalizados como en modelos fundacionales preentrenados.