Hidden Universal Collapse Behind Apparent Robustness: Dual-Metric Cross-Site Audit of a Laparoscopic Surgical AI Detector
본 연구는 단일 지표 평가가 특정 클래스에서의 외견상 강건함을 강조함으로써 여러 사이트에 걸친 수술용 AI 모델의 보편적 붕괴를 은폐할 수 있는 반면, 이중 지표 감사는 커스텀 탐지기와 사전 학습된 파운데이션 모델 모두에서 광범위한 실패를 드러내며, 우리가 테스트한 구성에서는 백본 교체가 그 격차를 해소하지 못했다는 점을 입증한다.