← 최신 논문
💻 computer science

Primus: Enforcing Attention Usage for 3D Medical Image Segmentation

본 논문은 하이브리드 모델의 한계를 어텐션 활용을 극대화함으로써 극복하고, 9 개의 공개 데이터셋에서 기존 CNN 기반 방법론을 능가하거나 이에 필적하는 최첨단 성능을 달성하는 3D 의료 영상 분할을 위한 최초의 경쟁력 있는 트랜스포머 중심 아키텍처인 Primus 와 PrimusV2 를 소개합니다.

원저자: Tassilo Wald, Saikat Roy, Fabian Isensee, Constantin Ulrich, Sebastian Ziegler, Dasha Trofimova, Raphael Stock, Michael Baumgartner, Gregor Köhler, Klaus Maier-Hein

게시일 2026-05-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tassilo Wald, Saikat Roy, Fabian Isensee, Constantin Ulrich, Sebastian Ziegler, Dasha Trofimova, Raphael Stock, Michael Baumgartner, Gregor Köhler, Klaus Maier-Hein

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"Primus: 3D 의료 영상 분할을 위한 어텐션 사용 강제"라는 논문에 대한 설명을 창의적인 비유를 곁들여 쉬운 언어로 번역한 것입니다.

큰 문제: "가짜" 트랜스포머

3D 의료 스캔 (예: 신장의 CT 스캔) 을 보고 종양 주위에 완벽한 윤곽선을 그릴 수 있는 로봇을 만들려고 상상해 보세요.

오랫동안 이 일을 수행하는 데 가장 뛰어난 로봇은 CNN(합성곱 신경망)이었습니다. CNN 을 매우 유능한 지역 탐정으로 생각하세요. 이 탐정은 작은 이웃 구역의 픽셀들을 살펴보고 단서를 모은 다음 다음 구역으로 이동합니다. 국소적인 세부 사항을 파악하는 데는 뛰어나지만, 때로는 장기 전체의 '큰 그림'을 놓치기도 합니다.

그런 다음 트랜스포머가 등장했습니다. 이들은 전체 이미지를 한 번에 바라보고 신장의 윗부분이 아랫부분과 어떻게 관련되는지 이해할 수 있는 '초과관찰자'와 같습니다. 이들은 언어 처리 (예: 챗봇) 와 자연 사진 분야에서 유명해졌습니다. 사람들은 "트랜스포머가 책 전체를 읽거나 풍경 전체를 볼 수 있다면, 의료 스캔에도 완벽할 것이다!"라고 생각했습니다.

하지만 함정이 있었습니다: 연구자들이 3D 의료 스캔에 트랜스포머를 적용해 보았을 때, 그 성능은 그다지 좋지 않았습니다. 그들은 종종 구식 CNN 탐정보다 느리고 정확도도 낮았습니다.

수사: 누가 일을 하고 있는가?

이 논문의 저자들은 왜 이러한 트랜스포머들이 실패하는지 조사하기로 결정했습니다. 그들은 CNN 과 트랜스포머를 모두 사용하려는 9 개의 인기 있는 '하이브리드' 모델들을 살펴보았습니다.

그들은 충격적인 비밀을 발견했습니다: 트랜스포머는 대부분 잠들어 있었습니다.

  • 비유: 유명한 고가의 건축가 (트랜스포머) 를 고용해 집을 설계하게 하고, 동시에 100 명의 일반 벽돌공 (CNN) 을 고용했다고 상상해 보세요. 집이 완성되었을 때, 저자들은 건축가가 실제로 설계도를 그리지 않았음을 깨달았습니다. 벽돌공들이 집 전체를 직접 지었고, 건축가는 그저 고개만 끄덕이며 서 있었을 뿐입니다.
  • 증거: 연구자들이 이러한 모델에서 '건축가' (트랜스포머 블록) 를 제거했을 때, 모델의 성능은 거의 동일하게 유지되었습니다. 어떤 경우에는 트랜스포머를 제거함으로써 모델이 쓸모없는 구성 요소에 에너지를 낭비하지 않게 되어 오히려 더 빨라지고 약간 더 좋아지기도 했습니다.

이 논문은 이를"UNet 지수"라고 부릅니다. 대부분의 기존 모델들은 높은 지수를 보였는데, 이는 실제로는 무거운 쓸모없는 트랜스포머 배낭을 멘 CNN 일 뿐이라는 뜻입니다.

해결책: Primus 와 PrimusV2

저자들은 질문했습니다: "트랜스포머가 반드시 일을 하도록 만든다면 어떨까?" 그들은 Primus(라틴어로 '첫 번째')와 PrimusV2라는 두 가지 새로운 아키텍처를 개발했습니다.

그들이 어떻게 트랜스포머를 깨워 일을 하게 했는지 살펴보겠습니다:

1. 세부 사항을 누르지 않기 (토크나이저)

일반적인 트랜스포머는 3D 이미지를 데이터 토큰으로 변환하기 위해 거대한 덩어리 (거대한 두꺼운 케이크 조각을 자르는 것처럼) 로 잘라내곤 합니다. 이는 작은 종양이나 얇은 혈관과 같은 작지만 중요한 세부 사항을 버리게 만듭니다.

  • 해결책: Primus 는 '고해상도 토크나이저'를 사용합니다. 거대한 조각 대신 8x8x8 보크셀 (voxel) 크기의 더 작고 정교한 조각을 사용합니다.
  • 비유: 모든 거리가 흐릿한 선으로만 표시된 도시 지도를 보는 대신, Primus 는 개별 주택까지 볼 수 있는 지도를 봅니다. 이는 트랜스포머가 작업할 수 있는 더 많은 세부 정보를 제공합니다.

2. '반복적' 접근법 (PrimusV2)

조각을 더 작게 잘랐음에도 불구하고, 트랜스포머는 때로 복잡한 장기들의 3D 형태를 바로 이해하는 데 어려움을 겪었습니다.

  • 해결책: PrimusV2 는 '반복적 패치 임베딩 (Iterative Patch Embedding)'을 사용합니다. 한 번에 전체 덩어리를 이해하려 시도하는 대신, 양파를 껍질 벗기거나 스케치를 다듬는 것처럼 이미지를 단계별로 처리합니다. 트랜스포머가 데이터를 보기 전에 몇 가지 작고 스마트한 합성곱 단계를 사용하여 데이터를 준비합니다.
  • 비유: 복잡한 퍼즐을 풀려고 한다고 상상해 보세요. Primus 는 모든 조각을 그냥 테이블 위에 쏟아붓지 않습니다. 먼저 색과 가장자리 조각으로 분류 (반복적 단계) 한 다음, '초과관찰자' (트랜스포머) 가 최종 그림을 훨씬 쉽게 볼 수 있도록 합니다.

3. GPS 제공 (3D RoPE)

트랜스포머는 본질적으로 공간에 대해 '맹목'입니다. '왼쪽'과 '오른쪽'이 다르다는 것을 알려주지 않으면 알지 못합니다.

  • 해결책: 저자들은 특별한 3D '회전 위치 임베딩 (Rotary Position Embedding, RoPE)'을 추가했습니다.
  • 비유: 이는 트랜스포머에 깊이, 너비, 높이를 동시에 이해하는 GPS 시스템을 부여하는 것과 같습니다. 이는 종양이 장기 나머지 부분에 비해 3D 공간에서 정확히 어디에 위치하는지 알고 있습니다.

결과: 트랜스포머가 마침내 승리하다

이러한 변경 사항 이후, 결과는 인상적이었습니다:

  • Primus는 표준 '골드 스탠다드'인 CNN(nnU-Net) 과 경쟁할 수 있는 최초의 트랜스포머 기반 모델이 되었습니다.
  • PrimusV2는 단순히 경쟁하는 것을 넘어, 대부분의 테스트에서 표준 CNN 을 능가했으며 오늘날 이용 가능한 가장 복잡하고 최상급의 CNN 들과도 대등한 성능을 보였습니다.

핵심 요약:
이 논문은 트랜스포머가 3D 의료 영상 처리를 위한 최고의 도구가 될 수 있음을 증명합니다. 단, CNN 의 조수처럼 대우하지 않아야 합니다. 트랜스포머가 주인공이 되도록 시스템을 설계하고, 고해상도 데이터를 공급하며 3D 공간을 이해할 수 있는 적절한 도구를 제공해야 합니다.

한 문장으로 요약한 내용

저자들은 Primus라는 새로운 AI 모델을 개발하여 마침내 '초과관찰자'인 트랜스포머가 의료 영상 처리에서 중추적인 역할을 하도록 강제함으로써, 올바르게 설계될 경우 트랜스포머가 전통적인 '지역 탐정'인 CNN 들을 능가할 수 있음을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →