← 최신 논문
💻 computer science

Contrastive Joint-Embedding Prediction for Representation Learning in Structural MRI

이 논문은 대조 학습 손실(contrastive loss)과 결합 임베딩 예측 아키텍처(joint-embedding predictive architecture)를 결합하여 라벨이 없는 데이터 없이도 쌍둥이 검색, 연령 회귀 및 종양 분할에서 최첨단 성능을 달로 달성하며 강건한 3D 뇌 MRI 표현을 학습하는 자기 지도 학습 프레임워크인 COJEPA를 소개한다.

원저자: Fabian Mager, Lars Kai Hansen

게시일 2026-07-15
📖 5 분 읽기🧠 심층 분석

원저자: Fabian Mager, Lars Kai Hansen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 거대한 3D 인간 뇌 퍼즐이 있다고 상상해 보세요. 하지만 당신은 상자 위에 그려진 그림을 본 적이 없습니다. 어떤 조각이 어디에 들어가야 하는지 알려줄 선생님도 없고, "이것은 25세의 뇌이다"라거나 "이것은 종양이다"라고 적힌 라벨도 없습니다. 이것이 의사들이 MRI 스캔을 마주할 때 겪는 도전 과제입니다. 수백만 개의 스캔이 있지만, 컴퓨터가 이를 이해하도록 가르치는 데 필요한 비싸고 시간이 많이 드는 라벨이 붙은 데이터는 매우 적기 때문입니다.

여기에, 가공되지 않은 퍼즐 조각들을 관찰하는 것만으로 뇌의 비밀을 스스로 배우려고 노력하는 새로운 "독학형" AI 모델인 COJEPA가 등장했습니다.

두 머리를 가진 괴물

라벨이 없는 이미지로부터 학습하려는 대부분의 AI 모델은 보통 두 가지 전략 중 하나를 선택합니다.

  1. "빈칸 채우기" 화가 (JEPA): 이 모델은 뇌의 한 부분을 보고, 그 일부를 가린 뒤 주변 맥락을 바탕으로 그 아래에 무엇이 있을지 추측합니다. 이 방식은 뇌의 주름진 질감이 다음 주름과 어떻게 연결되는지와 같은 국소적인 세부 사항을 이해하는 데 탁고 뛰어납니다.
  2. "닮은꼴 찾기" 탐정 (대조 학습/Contrastive Learning): 이 모델은 동일한 사람의 뇌를 찍은 약간 다른 두 장의 사진을 가져와서, 기억 속에서 두 사진이 동일하게 보이도록 만드는 동시에, 다른 사람의 뇌와는 완전히 다르게 보이도록 만듭니다. 이 방식은 "이 사람은 누구인가?"를 파악하는 데 탁월합니다.

논문은 3D 뇌 스캔의 경우 이 중 하나만 수행하는 것으로는 충분하지 않다고 주장합니다. "빈칸 채우기" 화가는 쌍둥이를 구별하기에는 너무 모호하며, "닮은꼴 찾기" 탐정은 전체적인 큰 그림에 너무 집중한 나머지 뇌 구조의 미세하고 국소적인 세부 사항을 이해하지 못합니다.

핵심 발견: 저자들은 이 두 전략을 하나의 모델인 COJEPA로 결합했습니다. 그들은 이 하이브리드 접근 방식이 최적의 지점(sweet spot)임을 발견했습니다. 이 모델은 국소적인 뇌의 세부 사항을 예측하는 동시에, 그 사람의 고유한 정체성을 인식하는 법을 배웁니다.

어떻게 가르쳤나

연구팀은 이 모델을 두 그룹(청년층 2237세, 노년층 3690세 이상)에서 추출한 2,286개의 건강한 뇌 스캔 데이터를 사용하여 훈련시켰습니다. 그들은 라벨을 사용하지 않았습니다. 대신 영리한 트릭을 사용했습니다:

  • 그들은 무작위로 3D 블록을 가렸지만(masking), 뇌 주변의 빈 공간은 무시하고 오직 "전경"(실제 뇌 조직)만을 가리도록 주의를 기울였습니다.
  • 그리고 모델에게 숨겨진 뇌 부위를 예측하도록 요청했습니다.
  • 동시에, 모델에게 동일한 뇌의 서로 다른 두 가지 뷰를 보여주며 "이것들은 같은 사람이다!"라는 것을 깨닫도록 강제했습니다.

결과: 무엇을 배웠는가?

연구팀은 이 새로운 뇌 학습 모델이 얼마나 똑똑한지 확인하기 위해 세 가지 서로 다른 작업으로 테스트를 진행했습니다.

1. 쌍둥이 테스트 (제로샷 검색/Zero-Shot Retrieval)
이것은 결정적인 테스트였습니다. 모델은 한 번도 본 적 없는 뇌를 보고 데이터베이스 내의 다른 뇌들 중에서 그 쌍둥이를 찾아내야 했습니다.

  • "빈칸 채우기" 전용 모델은 일란성 쌍둥이(Monozygotic twins)를 찾는 데 처참하게 실패했습니다. 가장 높은 순위에서 일치하는 대상을 찾은 확률은 **26%**에 불랬습니다. 사람들을 구분할 만큼 충분히 변별력을 갖추지 못한 것입니다.
  • "닮은꼴 찾기" 전용 모델은 훨씬 더 나은 성적을 보였으며, **78%**의 확률로 일치하는 대상을 찾았습니다.
  • **COJEPA (하이브리드 모델)**는 챔피언이었습니다. 가장 높은 순위에서 일치하는 쌍둥이를 **84%**의 확률로 찾아냈습니다.
  • 주의점: 모델은 이란성 쌍둥이(Dizygotic twins)를 찾는 데는 놀라울 정도로 서툴렀으며, 일치 확률이 **17%**에 불과했습니다. 이는 모델이 뇌의 고유한 "지문"을 포착하는 법은 배웠지만, 이란성 쌍둥이 사이의 더 미묘한 유전적 유사성을 파악하는 데는 여전히 어려움을 겪고 있음을 시사합니다.

2. 종양 찾기 (세그멘테이션/Segmentation)
그들은 모델에게 한 번도 본 적 없는 데이터셋(BraTS 2024)에서 뇌종양을 찾아내라고 요청했습니다.

  • 모델이 단순히 "얼어 있는(frozen)" 상태(새로운 것을 배우지 않고 기존 지식만 사용하는 상태)일 때, 하이브리드 모델과 "닮은꼴 찾기" 모델은 매우 적은 학습 데이터만으로도 종양의 약 **52%**를 정확히 찾아내며 비슷한 성능을 보였습니다.
  • 그러나 모델에게 약간의 미세 조정(fine-tuning, 특정 종양 데이터로부터 학습하도록 허용하는 것)을 제공하자, 세 모델 모두 성능이 크게 향고하여 약 **71%**의 정확도에 도달했습니다.
  • 교훈: 하이브리드 모델은 국소적인 세부 사항을 놓치지 않았습니다. 종양을 찾는 데 있어 다른 모델들과 대등한 성능을 보였으며, 이는 모델이 "탐정"이 되는 과정에서 "화가"로서의 기술을 잃지 않았음을 증명합니다.

3. 연령 추측 (회귀 분석/Regression)
그들은 뇌 스캔만 보고 그 사람의 나이를 맞히는 실험을 했습니다.

  • 하이브리드 모델이 가장 효율적이었습니다. 단 **5%**의 라벨링된 데이터만 사용했을 때, 이 모델은 오차 4.22년으로 나이를 예측하여 다른 모델들보다 우수한 성적을 거두었습니다.
  • 완전히 미세 조정을 거친 후에는 가장 좋은 결과인 2.55년의 오차를 달eric했습니다.
  • 흥미롭게도, 저자들은 모델이 나이를 추측할 때 가장 집중했던 뇌 부위가 소뇌(뇌의 뒷부분)라는 점을 발견했습니다. 저자들은 이것이 "발현된 특성(emergent property)"이라고 제안합니다. 즉, 아무도 그곳을 보라고 가르쳐주지 않았음에도 불구하고, 모델이 스스로 이 영역이 나이에 따라 변화한다는 사실을 알아냈다는 것입니다.

이 논문이 부정하는 것들

저자들은 자신들의 새로운 방법이 효과적이지 않다고 판단되는 것들에 대해 매우 명확하게 밝히고 있습니다:

  • 그들은 단지 **결측 부분을 예측하는 것(JEPA)**만으로는 서로 다른 사람들을 구별할 수 있는 모델을 만들기에 충분하지 않다는 아이디어를 명시적으로 부정했습니다. 데이터에 따르면 JEPA는 쌍둥이 검색에서 실패했습니다.
  • 또한, 단지 **유사성을 찾는 것(대조 학습)**만으로는 종양 세그멘테이션과 같은 의료 작업에 필수적인 미세하고 국적인 구조적 세부 사항을 놓칠 수 있다고 제안했습니다. 다만 하이브리드 모델은 이러한 기술을 잘 유지했습니다.

얼마나 확신하는가?

저자들은 수치에 대해서는 확신하지만, 더 큰 그림에 대해서는 신중한 태도를 보입니다.

  • 그들은 쌍둥이 검색과 연령 예측 결과를 테스트 세트에서 직접 측정했으므로, 실험에서 나온 수치들(예: **84%**의 쌍둥이 일치율, 2.55년의 오차)은 검증된 사실입니다.
  • 그러나 모델의 성공이 "예측 가능성"(미래를 예측함)과 "특이성"(정체성을 인지함) 사이의 균형에서 온다고 제안할 뿐입니다. 이것이 모든 의료 AI를 위한 최종적이고 완벽한 해결책이라고 주장하는 것은 아닙니다.
  • 또한, 훈련에 사용된 2,286명이라는 규모가 현대 AI 기준으로는 상당히 작다는 점을 인정했습니다. 만약 더 크고 다양한 집단의 데이터를 훈련에 사용할 수 있었다면, 모델이 훨씬 더 발전했을 것이라고 추측합니다.
  • 마지막으로, 모델이 특정 구형 기기(1.5T 스캐너)의 스캔 데이터에서 더 어려움을 겪었다는 점을 언급하며, 아직 모든 병원의 스캐너에서 완벽하게 작동하지는 않을 수 있다는 한계를 밝혔습니다.

요약하자면, COJEPA는 모든 스캔마다 선생님이 필요하지 않은 방식으로 컴퓨터가 뇌를 이해하도록 가르치는 유망한 새로운 방법입니다. 이 모델은 국소적인 세부 사항을 잘 추측하는 '화가'이자, 정체성을 날카롭게 파악하는 '탐정'이 되는 법을 배웠지만, 세상의 모든 뇌 스캔을 다룰 수 있을 만큼 성장하기 위해서는 아직 갈 길이 남아 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →