Hidden Universal Collapse Behind Apparent Robustness: Dual-Metric Cross-Site Audit of a Laparoscopic Surgical AI Detector
本研究は、単一指標による評価が、特定のクラスにおける見かけ上の堅牢性を強調することで、サイトを横断した外科用AIモデルの普遍的な崩壊を隠蔽し得る一方で、二重指標による監査は、カスタム検出器と学習済み基盤モデルの両方における広範な失敗を明らかにし、我々が検証した構成においては、バックボーンの置換によってもその格差は解消されないことを示している。