← 최신 논문
💻 computer science

Predicting Visual Acuity from Fundus Photographs Using a Domain-Pretrained Vision Transformer: Anatomical Alignment of Attention Patterns

본 연구는 21,000장 이상의 안저 사진으로 미세 조정된 도메인 사전 학습 비전 트랜스포머(RETFound)가 4단계 시력 예측에서 상당한 일치도를 달성하는 동시에, 저시력 안구에서는 망막 혈관에서 정상 시력 안구의 황반으로 이동하며 분류 정확도와 상관관계를 갖고 불확실한 예측에 대한 해석력을 제공하는 해부학적으로 조직화된 어텐션 패턴을 발달시킨다는 것을 입증한다.

원저자: Jin Hyun Kim, Yong Seop Han, Kuk Jin Jang, Seoung Jin Lee, Hyonyoung choi, Insup Lee

게시일 2026-07-17
📖 5 분 읽기🧠 심층 분석

원저자: Jin Hyun Kim, Yong Seop Han, Kuk Jin Jang, Seoung Jin Lee, Hyonyoung choi, Insup Lee

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

단 한 장의 화려한 안저 사진만 보고 그 사람의 시력이 얼마나 좋은지 추측할 수 있다고 상상해 보세요. 이것이 바로 **안과용 AI(ophthalmic AI)**의 세계입니다. 컴퓨터가 망막 사진을 읽어 학습하여 시력(visual acuity), 즉 사람의 시야가 얼마나 선명한지를 예측하는 것이죠. 보통 시력을 확인하려면 의사의 진료실에 앉아 차트를 보며 글자를 읽고 소리 내어 말해야 합니다. 하지만 만약 컴퓨터가 당신의 눈 사진을 보고도 당신이 입을 떼기도 전에 "아, 시력이 완벽하시군요" 또는 "안경이 필요할 것 같습니다"라고 말할 수 있다면 어떨까요?

이를 위해 과학자들은 **비전 트랜스포머(Vision Transformers)**를 사용합니다. 이것을 '슈퍼 스마트 디지털 탐정'이라고 생각해 보세요. 단순히 카메라가 스냅샷을 찍듯 이미지를 스캔하는 기존의 모델과 달리, 비전 트랜스포머는 사진을 아주 작은 퍼즐 조각으로 나눈 뒤 "이 조각이 저 조각과 어떻게 연관되어 있는가?"라고 질문합니다. 마치 탐정이 지문이나 진흙 묻은 신발 자국에 집중하듯, 특정 세부 사항에 주의를 기울이는 법을 배우는 것입니다. 이 논문이 다루는 핵심 질문은 이것입니다: 컴퓨터가 이러한 눈 지도를 보고 시력의 질을 예측하는 법을 배울 수 있는가? 그리고 더 중요한 것은, 우리가 컴퓨터가 어디를 보고 있는지를 신뢰할 수 있는가 하는 점입니다. 만약 컴퓨터가 시력이 나쁘다고 판단했다면, 실제로 눈의 손상된 부분을 보고 있는 것일까요, 아니면 그저 무작위적인 노이즈를 바탕으로 추측하고 있는 것일까요?


탐정의 새로운 안경

이 연구에서 연구진은 자신들의 디지털 탐정에게 RETFound라고 불리는 특별한 "안경"을 씌워주기로 했습니다. 당신이 수백만 장의 범죄 현장 사진을 오랫동안 연구해 온 탐정이라고 상상해 보세요. 그들은 지문이 어떻게 생겼는지, 혈흔이 어떻게 튀는지, 그리고 단서들이 주로 어디에 숨어 있는지를 정확히 알고 있습니다. RETFound가 바로 그런 존재입니다. 160만 장의 라벨링 되지 않은 눈 사진을 이미 "읽은" 거대한 AI 모델입니다. 이 모델은 시력이라는 구체적인 퍼즐을 풀기 전부터 이미 망막의 미세한 혈관과 질감을 포착하는 데 전문가가 되어 있습니다.

연구진은 이 전문가 탐정을 데려와 네 가지 시력 범주로 분류하는 구체적인 미션을 수행하도록 미세 조정(fine-tuning)했습니다.

  • C0: 완전 실명 또는 기능적 실명.
  • C1: 심한 저하 (매우 흐릿함).
  • C2: 중등도 및 경도 저하.
  • C3: 정상적이고 선명한 시력.

연구진은 3,654명의 환자로부터 얻은 21,602장의 사진을 대상으로 테스트를 진행했습니다. 탐정이 정답을 암기하여 속임수를 쓰지 못하도록 매우 엄격한 기준을 적용했습니다. 데이터를 나눌 때 사진 단위가 아닌 환자 단위로 나누었습니다. 즉, 한 환자의 사진이 5장이라면 그 5장은 모두 훈련 그룹에 들어가거나 모두 테스트 그룹에 들어가야 하며, 두 그룹에 섞여 들어갈 수 없습니다. 이는 학생이 시험을 볼 때 같은 문제를 다른 형태로 다시 접하지 않도록 보장하는 것과 같습니다.

결과: "상당한" 성공

결과는 유망했습니다. RETFound 탐정은 **55.6%**의 확률로 정답을 맞혔습니다. 완벽한 점수처럼 들리지 않을 수도 있지만, 의료 AI 분야에서는 큰 성과입니다. 더 중요한 점은, 틀렸을 때조차 대개 작은 실수였다는 것입니다. 오류의 **89.6%**는 정답에서 단 한 단계 차이(예를 들어 정답이 '중등도'인데 '심한 저하'라고 답한 경우)였습니다. 이 모델은 정상적인 눈을 실명이라고 부르는 것과 같은 터무ng한 추측은 거의 하지 않았습니다.

또한 이 논문은 RETFound를 두 가지 다른 탐정, 즉 일반 목적의 AI인 DINOv2(눈 사진을 전문적으로 공부하지 않은 모델) 및 구형 컴퓨터 비전 방식인 EfficientNet과 비교했습니다. RETFound는 두 모델을 모두 상당한 차이로 앞질렀습니다. 연구진은 예측이 실제 순서와 얼마나 잘 일치하는지를 측정하는 Quadratic Weighted Kappa 점수를 계산했습니다. RETFound는 0.612를 기록했는데, 전문가들은 이를 "상당한 일치(substantial agreement)"라고 부릅니다.

"어디를 보고 있나요?"라는 미스터리

이 논문에서 가장 흥고한 부분은 컴퓨터가 정답을 맞혔다는 사실 자체가 아니라, 정답을 찾기 위해 눈의 어디를 보았는가 하는 점입니다. 연구진은 **어텐션 롤아웃(Attention Rollout)**이라는 기술을 사용했습니다. 컴퓨터가 눈 사진 위에 비추는 '스포트라이트'라고 상상해 보세요. 이 기술을 통해 연구진은 스포트라이트가 정확히 어디에 집중되어 있는지 확인할 수 있습니다.

그들은 인간 의사들이 수십 년 동안 알고 있었던 아름다운 패턴을 발견했습니다.

  • 시력이 매우 나쁜 눈 (C0): 컴퓨터의 스포트라이트는 눈 가장자리 주변의 혈관에 강하게 집중되었습니다. 이는 심각한 시력 상실이 종종 손상되거나 누출되는 혈관에 의해 발생한다는 점을 고려하면 타당합니다. 컴퓨터는 지도의 "지저분한" 부분을 보는 법을 배웠습니다.
  • 시력이 완벽한 눈 (C3): 스포트라이트는 눈의 아주 중심부(황반)로 이동했습니다. 이곳은 선명하고 중심적인 시력을 담당하는 부분입니다. 컴퓨터는 가장자리를 무시하고 중심에 집중하는 법을 배웠습니다.

이는 마치 집이 불타고 있다면 연기와 불꽃(혈관)을 봐야 하고, 집이 깨끗하다면 문과 창문(황반)을 보고 모든 것이 괜찮은지 확인해야 한다는 것을 아는 탐정과 같습니다.

"나를 믿으세요" 테스트

여기에는 영리한 반전이 있습니다. 연구진은 이 "스포트라이트" 행동이 그저 운 좋은 우연인지, 아니면 실제로 컴퓨터가 올바르게 생각하고 있다는 뜻인지 알고 싶었습니다. 그들은 컴퓨터가 맞힌 사진과 틀린 사진을 비교했습니다.

  • 컴퓨터가 맞혔을 때: 스포트라이트는 완벽하게 작동했습니다. "실명"이라고 예측했을 때는 빛이 혈관에 가 있었습니다. "정상"이라고 예측했을 때는 빛이 중심부에 가 있었습니다. 스포트라이트와 정답 사이의 연결 고리는 매우 강력했습니다.
  • 컴퓨가 틀렸을 때: 스포트라이트는 혼란스러워했습니다. 빛은 무작위한 곳을 비추며 사방으로 흩어져 있었습니다. 스포트라이트가 머문 곳과 예측값 사이의 연결 고리는 약했습니다.

이는 컴퓨터의 "주의(attention)"가 신뢰할 수 있는 단서임을 시사합니다. 만약 컴퓨터가 올바른 곳을 보고 있다면, 아마도 맞을 확률이 높습니다. 하지만 만약 컴퓨터가 사방을 두리번거리고 있다면, 의구심을 가져야 합니다.

"흐릿한 중간 지점" 문제

연구 또한 까다로운 지점을 발견했습니다. 컴퓨터는 C1 범주(심한 저하이지만 완전 실명은 아닌 상태)에서 가장 어려움을 겪었습니다. C1의 눈을 '중등도' 범주와 자주 혼동했습니다. 연구진은 이것이 컴퓨터가 멍청해서가 아니라, 이 특정 시력 수준의 눈 사진 자체가 본질적으로 모호하기 때문이라고 설명합니다. 이는 약간 안개가 낀 날과 매우 흐린 날의 차이를 구별하려고 애쓰는 것과 같습니다. 때로는 사진 자체에 100% 확신을 줄 만큼 명확한 단서가 부족할 수 있습니다 있습니다.

이것이 의미하는 바

이 논문은 시력 상실 문제를 해결했거나 의사를 대체한다고 주장하는 것이 아닙니다. 대신, 우리는 단순히 추측하는 것이 아니라 인간 의사처럼 눈을 실제로 "보는" AI를 구축할 수 있음을 보여줍니다. 이 AI는 나쁜 눈을 위해서는 혈관에 집중하고, 좋은 눈을 위해서는 중심에 집중하는 법을 배웁니다.

저자들은 향로, 이 "스포트라이트" 행동을 경고 시스템으로 사용할 수 있다고 제안합니다. 만약 AI가 예측을 내놓았는데 스포트라이트가 사방으로 흩어져 있다면, 의사는 해당 사례를 인간이 재검토하도록 표시할 수 있습니다. 이는 AI를 블랙박스로 두는 대신, 단순히 무엇을 생각하는지가 아니라 그렇게 생각하는지, 그리고 그 예측을 얼마나 신뢰해야 하는지까지 알려주는 파트너로 변화시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →