← 최신 논문
💻 computer science

RetiBridge: Bridging Quantitative Retinal Biomarkers and Qualitative Diagnosis with a Knowledge-Guided Multimodal Large Language Model

RetiBridge는 CFP 및 OCT 영상으로부터의 정량적 망막 바이오마커와 정성적 임상 진단을 효과적으로 연결하는 지식 가이드형 멀티모달 대규모 언어 모델로, 15,000개 이상의 쌍을 이룬 샘플로 구성된 새로운 벤치마크에서 기존의 오픈 소스 및 독점 모델들을 능가합니다.

원저자: Zhuangzhi Gao, Hongyi Qin, He Zhao, Qinkai Yu, Feixiang Zhou, Fu Wang, Jinru Ding, Eduard Shantsila, Uazman Alam, Alena Shantsila, Wahbi El-Bouri, Gregory Y. H. Lip, Yalin Zheng

게시일 2026-07-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhuangzhi Gao, Hongyi Qin, He Zhao, Qinkai Yu, Feixiang Zhou, Fu Wang, Jinru Ding, Eduard Shantsila, Uazman Alam, Alena Shantsila, Wahbi El-Bouri, Gregory Y. H. Lip, Yalin Zheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 눈이 당신의 몸 전체를 위한 첨단 보안 카메라 시스템이라고 상상해 보세요. 보안 카메라가 깨진 창문이나 이상한 그림자를 포착할 수 있는 것처럼, 눈 뒤쪽에 있는 망막은 당뇨병, 고혈압, 심지어 심장 질환과 같은 질병에 대한 단서를 드러낼 수 있습니다. 의사들은 이 보안 피드를 보기 위해 두 가지 주요 "렌즈"를 사용합니다. 하나는 표면의 평면적이고 다채로운 사진을 찍는 것이고(표준 스냅샷처럼), 다른 하나는 층을 관통하는 깊은 3D 단면을 찍는 것입니다(케이크의 단면처럼). 오랫동안 컴퓨터는 이 사진 속의 숫자들(층의 두께나 혈관의 너비 등)을 측정하는 데는 뛰어났지만, 그 숫자들이 실제로 무엇을 의미하는지 평이한 영어로 설명하는 데는 매우 서툴렀습니다. 그것은 마치 자동차의 속도가 시속 60마일이라고 말할 수는 있지만, 그 차가 과속 중인지 아니면 그냥 고속도로를 달리고 있는 것인지는 말하지 못하는 로봇을 가진 것과 같았습니다.

여기서 새로운 연구가 등장합니다. 과학자들은 "멀티모달 거대 언어 모델(MLLM)"—기본적으로 이미지와 텍am을 동시에 보고 읽을 수 있는 초스마트 AI 두뇌—을 구축하기 위해 노력해 왔습니다. 목표는 단순히 "비정상"이라고 말하는 것이 아니라, 어려운 숫자들을 실제 진단과 연결하여 그런지를 설명할 수 있는 디지털 의사 보조 시스템을 만드는 것입니다. 하지만 기존의 대부분 AI 모델은 교과서는 암기했지만 실제 시험에는 적용하지 못하는 학생들과 같습니다. 그들은 질병을 맞출 수는 있어도, 자신의 풀이 과정을 보여주거나 그 측정값이 어떻게 결론에 도달했는지 설명할 수는 없습니다. 이 논문은 RetiBridge라는 새로운 AI를 소개하며, 이 AI는 컴퓨터가 꼼꼼한 탐정처럼 행동하도록 강제함으로써, 발견한 모든 숫자를 특정 의학적 단서와 연결하여 최종 판결을 내리도록 함으로써 이 문제를 해결하고자 합니다.

연구진은 RetiBridge를 "지식 가이드형" 탐정이 되도록 설계했습니다. AI에게 단순히 추측하게 하는 대신, 다음과 같은 특정한 사고 방식을 가르쳤습니다: 첫째, 증거를 측정하고(숫자); 둘째, 그 숫자들을 의학적 이야기로 번역하며(단서); 셋째, 사건을 해결하는 것(진단)입니다. 연구진은 이 AI를 15,611쌍의 영국 바이오뱅크(UK Biobank) 안구 이미지를 사용하여 훈련시켰는데, 이는 실제 환자 데이터가 담긴 방대한 데이터베이스입니다. 각 환자에 대해 AI는 3D 스캔에서 추출한 31개의 서로 다른 측정값과 평면 사진에서 추출한 6개의 측정값에 접근할 수 있었습니다. AI가 올바른 방식으로 생각하는 법을 배우게 하기 위해, 연구진은 강력한 AI 도구(OpenAI-o3)를 사용하여 이 15,000개 이상의 사례에 대한 "모델 답변"을 작성했습니다. 이 모델 답변들은 단순히 진단만 내리는 것이 아니라, "240 마이크로미터의 두께"와 같은 측정값이 어떻게 "여기에는 부종이 없음"으로 번역되어 최종 결론으로 이어지는지, 즉 전체적인 추론 과정을 상세히 기술했습니다.

RetiBridge를 테스트했을 때, 이 모델은 인상적인 능력을 보여주었습니다. 상대적으로 작은 "두뇌"(70억 개의 파라미터를 가진 모델)를 기반으로 구축되었음에도 불구하고, 320억 개의 파라미터를 가진 모델들과 심지어 OpenAI의 매우 진보된 독점 모델보다도 더 뛰어난 성능을 보였습니다. 성공의 핵심은 AI가 3D 안구 이미지를 그것이 나타내는 특정 숫자와 직접 정렬하도록 학습하는 특별한 훈련 단계였습니다. 이는 마치 학생에게 "케이크"라는 단어를 단순히 암기하게 하는 것이 아니라, 케이크의 단면 사진을 자(ruler)와 직접 매칭하도록 가르치는 것과 같습니다.

결과는 RetiBridge가 "풀이 과정을 보여주는" 구체적인 작업에 더 뛰어나다는 것을 시사합니다. RetiBridge는 숫자를 정확하게 맞추는 데 있어 현저히 높은 정확도(78.23%의 정확도, 다른 모델들의 훨씬 낮은 점수와 비교됨)를 보였으며, 자신의 진단이 실제로 증거에 의해 뒷받s되는지 입증하는 데 더 뛰어났습니다. 다른 모델들이 최종 진단은 맞혔을지언정 세부 사항을 놓치거나 이유를 지어냈던 반면, RetiBridge는 일관되게 실제 측정값과 자신의 결론을 연결했습니다. 예를 들어, 당뇨망막병증과 관련된 테스트 케이스에서 RetiBridge는 특정 지점과 두께를 정확히 식별하고, 이것이 어떻게 다른 질병들을 배제하는지를 설명함으로써 사진으로부터 정답까지의 명확하고 논리적인 경로를 만들어냈습니다.

하지만 이 논문은 이것이 아직 만능 치료제는 아니라는 점을 주의 깊게 언급합니다. RetiBridge가 점들을 연결하는 데는 더 뛰어나지만, 매우 뛰어난 인간 수준의 모델들과 비교했을 때 여전히 복잡한 추론 작업에서는 어려움을 겪고 있으며, 모든 종류의 안구 질환에 대해 테스트되지 않았습니다. 저자들은 AI에게 숫자에 근거하여 답을 내리도록 강제하는 이 접근 방식이 유망한 길이지만, 실제 병원에서 사용할 수 있을 만큼 견고하게 만들기 위해서는 더 많은 작업이 필요하다고 제안합니다. 또한 향-후 더 상세한 3D 스캔과 다양한 유형의 안구 이미지를 사용하여 테스트할 계획입니다. 현재로서는 RetiBridge가 AI에게 의학 뒤에 숨겨진 수학을 존중하도록 가르친다면, 우리 건강을 이해하는 데 있어 훨씬 더 신뢰할 수 있는 파트너가 될 수 있다는 강력한 개념 증명(proof-of-concept)으로서 자리 잡고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →