Identical runs disagree more than different models: reproducibility limits in deep learning for brain-tumour MRI classification
본 연구는 뇌종양 MRI 분류를 위한 명목상 동일한 딥러닝 실행 과정에서 발생하는 통제되지 않은 확률적 변동이 서로 다른 모델 아키텍처 간의 성능 차이를 상회할 수 있음을 입증하며, 이는 표준적인 어블레이션 연구(ablation studies)의 신뢰성을 저해하고 더욱 엄격한 재현성 프로토콜을 필요로 함을 보여준다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
고도의 정밀함이 요구되는 의료 영상 분야에서, 컴퓨터는 점점 더 인간의 뇌 사진을 보고 종양을 찾아내라는 요청을 받고 있습니다. 이러한 사진들은 MRI 스캔이라고 불리며, 매우 복잡하고 상세합니다. 이 영상을 분석하는 데 사용되는 소프트웨어는 딥러닝이라 알려진 인공지능의 한 종류에 의존합니다. 이러한 시스템을 훈련시키기 위해 연구자들은 수천 장의 이미지를 컴퓨터에 입력하고, 컴퓨터가 스스로 패턴을 학습하도록 하며, 질병을 식히는 능력이 향나질 때까지 내부 설정을 수백만 번 조정하게 합니다. 목표는 의사들이 뇌종양과 같은 질환을 진단할 때 신뢰할 수 있는 도구를 만드는 것입니다. 그러나 이 기술이 안전하고 유용하기 위해서는 그 결과가 일관되어야 합니다. 만약 컴퓨터에 동일한 데이터를 두 번 보여준다면, 이상적으로는 동일한 답을 내놓아야 합니다. 과학자들이 두 가지 서로 다른 컴퓨터 모델을 비교하여 어떤 것이 더 나은지 판단할 때, 그들은 종종 모델이 실제 현장 테스트로 넘어가기 위한 결정을 내리기 위해 때로는 단 1% 미만의 아주 작은 정확도 차이를 살피기도 합니다.
샌프란시스코 베이 대학교(San Francisco Bay University)의 한 연구자는 특정한 아이디어를 테스트하기 위해 연구에 착수했습니다. 그것은 표준적인 뇌 영상 컴퓨터 모델에 특수한 형태의 추론 능력을 추가하는 것이 종양을 발견하는 데 더 효과적일 것인가 하는 점이었습니다. 표준 모델은 이미지를 직접 바라보는 반면, 새로운 버전은 마치 인간이 특징들 사이의 점들을 연결하듯 이미지의 서로 다른 부분들 사이의 관계를 이해하려고 시도했습니다. 연구자는 이를 테스트하기 위해 엄격한 실험을 설계했으며, 새로운 접근 방식이 정말로 이점을 제공하는지 확인하기 위해 컴퓨터 모델을 반복해서 실행했습니다. 그러나 그가 발견한 것은 종양 탐지에서의 획기적인 돌파구가 아니라, 테스트 과정 자체의 신뢰성에 대한 놀라운 발견이었습니다. 그는 컴퓨터 자체의 훈련 과정이 너무 불안정해서, 완전히 동일한 모델을 똑같이 두 번 실행하더라도 두 모델 간에 측정하려 했던 미세한 차이보다 더 큰 차이가 발생할 수 있다는 것을 발견했습니다.
연구는 수백 명의 환자로부터 얻은 방대한 양의 MRI 단면 데이터로 시작되었으며, 특정 환자의 데이터가 훈련 그룹과 테스트 그룹 모두에 나타나지 않도록 세심하게 나누었습니다. 이는 매우 중요했는데, 만약 컴퓨터가 두 그룹 모두에서 동일한 환자의 종양을 보게 된다면, 질병을 일반적으로 인식하는 것이 아니라 특정 개인을 단순히 암기해 버릴 것이기 때문입니다. 연구자는 표준 모델과 추가적인 추론 계층이 포함된 더 복로직한 버전의 모델을 훈련시켰습니다. 그는 결과가 어떻게 변하는지 보기 위해 무작위 시작 숫자, 즉 '시드(seed)'를 변경하며 각 버전을 여러 번 실행했습니다. 컴퓨터 과학의 세계에서 이 시드는 만약 동일한 숫자로 시작한다면 컴퓨터가 매번 정확히 똑같은 동작을 수행하도록 보장해야 하는 값입니다. 기대치는 복잡한 모델이 단순한 모델보다 약간 더 낫거나 혹은 약간 더 나쁠 것이며, 테스트를 세 번 실행하면 명확한 평균치를 얻을 수 있을 것이라는 점이었습니다.
대신, 결과는 혼란스러운 패턴을 보여주었습니다. 연구자가 동일한 시작 숫자를 사용하여 정확히 같은 모델 구성을 두 번 실행했을 때, 평균적으로 정확도 점수가 2% 포인트 이상 차이가 났습니다. 이 변동성은 그가 비교하려 했던 두 모델 간의 미세한 차이를 완전히 덮어버릴 정도로 컸습니다. 실제로 두 동일한 실행 간의 차이는 단순한 모델과 복잡한 모델 사이의 차이보다 두 배 이상 컸습니다. 이는 실험이 신호(signal)가 아닌 노이즈(noise)를 측정하고 있었음을 의미했습니다. 연구자는 컴퓨터가 신뢰할 수 있는 도구로서 작동하지 않고 있다는 사실을 깨달았습니다. 이는 마치 금화를 무게를 재는 저울이, 심지어 똑같은 자리에 서 있더라도 매번 다른 수치를 보여주는 것과 같았습니다.
더 깊이 파고든 결과, 연구자는 이 불신뢰성의 두 가지 주요 원인을 찾아냈습니다. 첫째, 컴퓨터가 잘못 설정되어 있었습니다. 무작위 시작 숫자가 모델이 이미 구축된 후에 적용되었기 때문에, 모델의 초기 설정은 여전히 무작위이고 통제되지 않은 상태였습니다. 이 실수를 바로잡고 모델을 구축하기 전에 시작 숫자를 적용했음에도 불구하고, 결과는 여전히 완벽하게 동일하지 않았습니다. 두 번째 문제는 컴퓨터의 수학적 엔진 깊숙한 곳에 숨겨져 있었습니다. 소프트웨어가 완벽하게 결정론적인(deterministic) 모드로 실행되고 있다고 주장했음에도 불구하고, 모델을 가르치는 데 사용되는 특정 계산 부분이 매번 미세하게 다른 결과를 만들어내고 있었습니다. 이 숨겨진 결함은 연구자들이 실험의 재현성을 보장하기 위해 사용하는 표준적인 점검 방식으로는 포착할 수 없는 것이었습니다.
또한 이 연구는 데이터를 나누는 방식이 결과에 극적인 변화를 줄 수 있음을 드러냈습니다. 연구자가 데이터를 환자 단위가 아닌 개별 MRI 단면 단위로 나누었을 때, 컴퓨터의 정확도는 거의 5% 포인트 급증했습니다. 이는 컴퓨터가 훈련 세트와 테스트 세트 모두에서 동일한 환자의 패턴을 인식함으로써 발생한 현상으로, 컴퓨터가 종양이 아닌 환자를 인식하게 만든 것입니다. 이 부풀려진 점수는 모델의 실제 능력을 가리는 환상에 불과했습니다. 더욱이, 왜곡되거나 노이즈가 섞인 이미지를 처리하는 능력을 테스트했을 때, 한 번의 테스트 실행에서는 한 모델이 더 견고하다는 결과가 나왔으나, 테스트를 반복하자 결과가 뒤집혀 다른 모델이 더 낫다는 것이 나타났습니다. 이 역전 현상은 단 한 번의 실험만으로는 결론을 내리기에 부족하다는 것을 증proof했습니다.
이 연구의 최종 결론은 추가적인 추론 계층가 뇌종양 탐지 능력을 향상시키지 못했다는 것이었습니다. 복잡한 모델은 더 낫지 않았으며, 어떤 면에서는 더 느리고 덜 신뢰할 수 있었습니다. 더 중요한 것은, 이 연구가 많은 의료 AI 연구가 수행되는 방식의 치명적인 결함을 강조했다는 점입니다. 연구자들이 흔히 발견한다고 주장하는 차이점들은 테스트 과정 자체의 자연스러운 변동성보다 작습니다. 연구자는 과학자들이 새로운 모델을 신뢰하기 전에, 먼저 자신의 테스트 설정이 미세한 변화를 감지할 수 있을 만큼 안정적인지 검증해야 한다고 주장했습니다. 여기에는 무작위 시작 숫자가 올바르게 적용되었는지 확인하고, 동일한 테스트를 두 번 실행하여 자연적인 변동을 측정하는 과정이 포함됩니다. 이러한 점검은 시간과 노력이 거의 들지 않지만, 자주 생략되곤 합니다. 이러한 점검 없이는, 의료 기술 분야가 임상적 결정을 뒷받 Kard한 기초가 되기에는 너무나도 취약한 토대 위에 도구를 쌓아 올릴 위험이 있습니다. 이 논문은 더 나은 의료 기술을 추구하는 과정에서, 측정 도구 자체가 정확한지 확인하는 것이 도구 자체만큼이나 중요하다는 사실을 상기시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.