Deep Learning for Retinal Degeneration Assessment: A Comprehensive Analysis of the MARIO Challenge
이 논문은 35개 팀이 망막 퇴행 평가에서 AI 성능을 벤치마킹하기 위해 다중 모달 OCT 및 임상 데이터를 어떻게 활용했는지 상세히 기술하며 MICCAI 2024의 MARIO 챌린지에 대한 종합적인 분석을 제시하는데, 이는 AI가 AMD 진행을 감지하는 데 있어서는 의사의 정확도와 일치하지만 현재로서는 미래의 질병 진화 과정을 예측하는 데에는 미치지 못한다는 점을 밝히고 있다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아주 작고 정교한 도시인 사람의 눈 내부에서 일어나는 미스터리를 풀려는 탐정이라고 상상해 보십시오. 당신은 망막이라고 불리는, 빛을 감지하는 스크린 뒷부분을 조사하고 있습니다. 때때로 이 도시는 '신생혈관성 황반변성(nAMD)'이라는 교활하고 누수가 발생하는 성장물에 의해 침입을 당하곤 합니다. 이것은 마치 원치 않는 작은 파이프들이 돋아나 액체를 흘려보내 시야의 중심을 흐릿하게 만드는 배관 사고와 같습니다. 이를 고치기 위해 의사들은 이 파이프를 막는 강력한 접착제 역할을 하는 특수한 "항누출" 주사(anti-VEGF)를 사용합니다. 하지만 까다로운 점은 이 누수 상태가 매일 변한다는 것입니다. 때로는 파이프가 조용하다가도, 어떤 때는 쏟아져 나오고, 또 어떤 때는 아주 조금 축축하기만 합니다. 의사들은 눈이 잘 치료되고 있는지 확인하기 위해 몇 주마다 고해解상도 3D 사진(OCT 스캔)을 찍어야 합니다. 만약 예측을 틀린다면, 주사가 필요 없는 환자에게 주사를 놓거나, 더 심각해지고 있는 환자를 너무 오래 기다리게 하는 최악의 상황이 발생할 수 있습니다.
오랫동안 컴퓨터는 단 한 장의 사진을 보고 "이봐, 이 눈에 누수가 있어!"라고 말하는 데 매우 능숙해졌습니다. 하지만 진짜 도전 과제는 정지 사진이 아니라 영화를 보는 것과 같습니다. 컴퓨터는 몇 주 간격으로 찍힌 두 장의 사진을 보고 "누수가 개선되었는가, 그대로인가, 아니면 악화되었는가?"를 결정해야 합니다. 더 어려운 것은, 컴퓨터가 오늘 찍은 단 한 장의 사진만 보고 3개월 후에 어떤 일이 일으로 일어날지 예측할 수 있느냐는 것입니다. 이것이 바로 과학자 그룹이 세계 최고의 AI 탐정들에게 던진 질문이며, MARIO 챌린지라는 글로벌 대회였습니다. 그들은 인공지능이 의사들의 신뢰할 수 있는 조력자가 되어, 환자에게 정확히 언제 주사를 놓아야 할지, 그리고 언제 휴식을 취하게 해야 할지를 결정하는 데 도움을 줄 수 있는지 알고 싶어 했습니다.
위대한 눈 탐정 대회
2024년, 연구팀은 MARIO 챌린지(MARIO: Monitoring Age-Related macular degeneration with Intelligent Ophthalmology)라는 거대한 게임을 조직했습니다. 그들은 학생, 대학 연구원, 기술 기업을 포함하여 전 세계에서 모인 35개의 AI 전문가 팀을 모았습니다. 목표는 광학 단층 촬영(OCT) 스캔—망막의 매우 상세한 3D 단면도—을 분석하여 질병을 추적할 수 있는 컴퓨터 프로그램을 구축하는 것이었습니다.
이 챌린지는 쉬운 모드와 어려운 모드가 있는 비디오 게임처럼 두 단계로 나뉘어 있었습니다.
레벨 1: "변화 포착하기" 게임
이 레벨에서 AI에게는 서로 다른 시점에 찍힌 동일한 눈의 사진 두 장(예를 들어, 방문 A와 방문 B)이 주어집니다. 컴퓨터는 두 사진을 모두 살펴보고 질병이 감소(호전), 안정(유지), 또는 악화(나빠짐)되었는지 결정해야 합니다.
결과는 놀라울 정도로 흥eric적이었습니다. 최고 팀인 MIPLAB은 약 86%의 정확도로 정답을 맞히는 모델을 만들었습니다. 이를 설명하자면, 이는 두 명의 안과 의사가 서로 의견을 일치시키는 수준과 거의 비슷합니다! AI는 두 스캔 사이의 미묘한 체액 수치 차이를 성공적으로 학습했습니다. 마치 컴퓨터에게 길거리의 웅덩이가 두 장의 사진만 보고도 줄어들었는지 혹은 커졌는지를 알아차히도록 가르치는 것과 같았습니다. 이는 현재 치료가 효과가 있는지 확인하는 데 있어 AI가 유능한 조수로서 준비되어 있음을 시사합니다.
레벨 2: "수정구슬" 게임
이 레벨은 훨씬, 훨씬 더 어려웠습니다. AI에게는 단 한 장의 사진(방문 A)만 주어지며, 향후 3개월 동안 어떤 일이 일어날지 예측해야 했습니다. 눈이 좋아질 것인가, 그대로일 것인가, 아니면 나빠질 것인가?
결과는 현실을 직시하게 해주었습니다. 최고의 AI 모델조차 약 0.30의 점수를 기록했는데, 이는 대부분의 눈이 '안정적'이기 때문에 그냥 계속 "안정"이라고 답하는 것보다 겨우 나은 수준이었습니다. 팀들의 예측은 서로 너무 달라서, 서로의 의견이 우연에 의한 일치보다 나은 수준이 아니었습니다. 그것은 마치 AI가 오늘 찍은 하늘 사진 한 장만을 가지고 3개월 뒤의 날씨를 예측하려는 것과 같았습니다. 그 한 장의 사진에는 앞으로 일어날 일을 알 수 있는 정보가 충분하지 않았던 것입니다. 논문은 단 한 번의 방문 데이터로 미래를 예측하는 것은 아직 AI가 해결하지 못한 문제라고 결론지었습니다.
"외국어" 문제
이야기에는 연구자들이 매우 중요한 교훈을 얻게 된 또 하나의 반전이 있었습니다. 주요 환자 그룹은 프랑스 브레스트 출신이었습니다. 하지만 AI가 정말 똑똑한 것인지, 아니면 단순히 프랑스 데이터를 암기한 것인지를 테스트하기 위해, 조직 위원들은 툴센(Tlemcen) 출신의 아주 작은 비밀 테스트 세트를 투입했습니다. 이 환자들은 배경이 달랐고, 그들의 눈 스캔은 약간 다른 장비 설정으로 촬영되었습니다.
프랑스 데이터에서 우승한 AI가 알제리 문제를 풀려고 했을 때, 그 AI는 크게 휘청거렸습니다. 프랑스에서 1위를 했던 팀은 알제리 데이터에서는 5위로 떨어졌습니다. 어떤 팀들의 점수는 너무 급락하여 무작위 추측보다 나은 수준조차 되지 못했습니다. 그것은 마치 어떤 학생이 한 교실에서는 수학 시험에서 만점을 받았지만, 선생님이 약간 다른 기호를 사용하는 다른 교과서로 수업을 바꾸자 완전히 낙제한 것과 같았습니다. 이는 AI 모델들이 출처에 너무 민감하다는 것을 보여주었습니다. 그들은 눈의 보편적인 규칙을 배운 것이 아니라, 프랑스 스캔의 특정 "억양"을 배운 것이었습니다.
이것이 의미하는 바는 무엇인가?
MARIO 챌린지는 우리가 현재 어디에 서 있는지에 대한 명확한 지도를 제공했습니다.
- 단기 모니터링은 가능합니다: 의사가 지난달 스캔과 비교하여 눈이 좋아졌는지 나빠졌는지를 알고 싶다면, AI는 아주 잘 해낼 수 있습니다. AI는 의사들의 시간을 절약하고 불필요한 주사를 줄이는 데 도움을 줄 준비가 거의 되어 있습니다.
- 장기 예측은 준비되지 않았습니다: 만약 의사가 단 한 번의 스캔을 보고 3개월 후에 어떤 일이 일어날지 알고 싶다면, 현재의 AI는 쓸모가 없습니다. 신호가 너무 약하며, 모델들은 그저 추측하고 있을 뿐입니다.
- 모두에게 적용되는 정답은 없습니다: 한 집단에게 완벽하게 작동하는 AI가 다른 집단에게는 처참하게 실패할 수 있습니다. 우리가 이 도구들을 전 세계 병원에서 신뢰하기 전에, 우리가 사는 곳이 어디든, 어떤 기계로 눈을 스캔했든 상관없이 모두에게 제대로 작동하는지 확인해야 합니다.
이 논문은 AMD의 미스터리를 해결했다고 주장하는 것이 아니라, AI가 현재 무엇을 할 수 있고 무엇을 할 수 없는지에 대한 미스터리를 해결했습니다. 그것은 우리가 매우 좋은 "포착자(spotter)"를 만들었지만, 아직 미래를 내다보는 훨씬 더 똑똑한 "예언자(prophet)"를 발명해야 한다는 것을 알려줍니다. 그리고 우리가 그 예언자를 갖기 전까지는, 디지털 탐정들이 새로운 동네에 왔을 때 그들을 너무 믿지 않도록 주의해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.