Generative AI and Foundation Models in Medical Image
이 논문은 확산 모델과 거대 언어 모델을 포함한 생성형 AI와 파운데이션 모델의 개요를 제공하며, 이들의 구축, 의료 영상 처리 및 지원 분야에서의 응용, 그리고 국가적 데이터와 컴퓨팅 자원을 활용하여 고성능 헬스케어 AI를 개발하기 위한 전략에 대해 논의한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터 과학의 세계를 거대하고 북적이는 주방이라고 상상해 보십시오. 오랫동안 요리사들(컴퓨터)은 식재료를 분류하기 위해 엄격한 레시피를 따르는 데 탁월했습니다. "이것은 토마토인가, 아니가 감자인가?" 혹은 "이 양파 더미에서 정확히 어디에 양파가 있는가?"와 같은 질문들이었죠. 이것이 바로 '판별형 AI(Discriminative AI)'의 시대였습니다. 기계의 역할은 사진을 보고 단순한 선택을 내리는 것이었습니다. 하지만 최근 이 주방에 새로운 종류의 요리사가 등장했습니다. 바로 '생성형 AI(Generative AI)'입니다. 이 새로운 요리사는 단순히 분류하는 것을 넘어, "수프를 만들어라"라는 짧은 메모를 보고 실제로 허공에서 김이 모락모락 나는 맛있는 수프 한 그릇을 만들어낼 수 있습니다. 이 요리사는 이야기를 쓰고, 그림을 그리며, 심지어 새로운 레시피를 발명할 수도 있습니다. 이러한 변화는 '파운데이션 모델(Foundation Models)' 덕분에 일어나고 있습니다. 파운데이션 모델은 마치 수백만 가지의 요리를 맛보고 요리의 일반적인 규칙을 배운, 거대하고 매우 똑똑한 요리 학교와 같습니다. 단순히 하나의 특정 레시피만을 암기하는 것이 아니라 말이죠. 이것이 왜 중요할까요? 의학 분야에서 이 새로운 요리사들은 가짜 의료 영상을 만들어 연습용으로 제공하거나, 보고서를 더 빠르게 작성하거나, 의사가 놓쳤을지도 모를 질병을 포착함으로써 의사들을 도울 수 있고, 결과적으로 생명을 구하고 의료 서비스를 모두를 위해 더 낫게 만들 수 있기 때문입니다.
오다 마사히로(Masahiro Oda)가 작성한 이 논문은 이 새로운 '생성형 AI' 요리사들이 의료 주방에서 일하도록 어떻게 훈련되는지에 대해 깊이 있게 다루며, 특히 엑스레이나 MRI와 같은 의료 영상에 초점을 맞춥니다. 저자는 기존 방식의 AI가 무언가를 찾아내는 데는 뛰어났지만, 새로운 '생성형 AI'는 실제로 새로운 이미지와 텍후를 생성할 수 있다고 설명합니다. 이 논문은 두 가지 주요 유형의 요리사에 집중합니다. 이미지를 만드는 요리사(소위 '확산 모델(Diffusion Models)'이라 불리는 것 사용)와 텍스트를 쓰는 요리사(거대 언어 모델 또는 'LLM' 사용)입니다.
이 논문은 이러한 새로운 도구들이 판도를 바꾸고 있다고 제안합니다. 이미지 생성의 경우, 저자는 조각가가 노이즈와 정전기가 가득한 대리석 덩어리에서 시작하여 노이즈를 조금씩 깎아내어 선명하고 완벽한 조각상을 드러내는 과정과 유사한 과정을 설명합니다. 이것이 확산 모델이 작동하는 방식입니다. 이들은 순수한 혼돈에서 시작하여 점진적으로 그것을 현실적인 의료 영상으로 정교하게 다듬어 나갑니다. 논문은 우리가 이 AI가 만든 이미지를 실제 환자를 진단하는 데 직접 사용할 수는 없지만(실제 사람이 아니기 때문), '데이터 증강(data augmentation)'에는 매우 유용하다고 지적합니다. 이것은 마치 비디오 게임 개발자가 실제 전투 전에 플레이어의 반사 신경을 훈련시키기 위해 수천 명의 가짜 적을 만들어내는 것과 같습니다. 연구자들은 이 AI 생성 이미지를 사용하여 다른 AI 시스템을 훈련시킴으로써, 특히 실제 환자 데이터를 찾기 어렵거나 특정 위치에 질병이 나타나도록 보여줘야 할 때 더 똑똑한 진단 도구를 구축할 수 있습니다.
텍스트의 경우, 논문은 ChatGPT를 구동하는 것과 같은 거대 언어 모델(LLM)을 강조합니다. 이 모델들은 거대한 도서관에 있는 모든 책을 읽은 것처럼 방대한 양의 텍스트를 '먹으며' 언어가 어떻게 작동하는지 배웠습니다. 논문은 일반적인 모델들이 똑똑하긴 하지만, 의학 전문 용어를 이해하기 위해서는 특별한 훈련이 필요하다고 언급합니다. 연구자들은 의학 서적과 학술지를 바탕으로 훈련된 특화된 버전들을 만들어냈으며, 이들은 이제 의사들을 도와 방사선 보고서를 자동으로 초안 작성하거나 환자 기록을 요약할 수 있습니다.
이 논문에서 가장 흥피로운 부분은 '파운데이션 모델'이라는 개념입니다. 매번 새로운 작은 로봇을 처음부터 만드는 대신(예를 들어 폐의 종양을 찾는 로봇 하나, 심장을 찾는 로봇 하나, 뇌를 찾는 로봇 하나를 각각 만드는 것), 우리는 먼저 하나의 거대하고 매우 똑똑한 '파운데이션 모델'을 구축해야 한다고 논문은 주장합니다. 이 거대한 모델은 방대한 데이터셋으로부터 일반적인 패턴을 학습합니다. 그런 다음, 약간의 추가 훈련('미세 조정(fine-tuning)'이라 불림)이나 몇 가지 예시('퓨샷 러닝(few-shot learning)'이라 불림)만 있으면, 이 하나의 모델을 다양한 의료 작업에 적응시킬 수 있습니다. 논문은 이것이 AI를 구축하는 훨씬 더 효율적인 방법이며, 특히 새로운 모델을 처음부터 훈련시킬 데이터가 부족한 희귀 질환 분야에서 그러하다고 제안합니다.
하지만 논문은 또한 주의와 현실적인 경고의 목소리도 냅니다. 이러한 거대 모델을 구축하려면 세 가지 거대한 재료가 필요하다고 지적합니다. 바로 방대한 양의 데이터, 엄청난 컴퓨터 연산 능력(수천 개의 그래픽 카드), 그리고 시간입니다. 저자는 빅테크 기업들은 이러한 자원을 가지고 있지만, 의료 연구자들이 이를 확보하기는 더 어렵다고 언급합니다. 논문은 특정 인구 집단(예를 들어 일본인 환자)에게 잘 작동하는 AI를 만들기 위해서는 단순히 다른 나라의 데이터로 훈련된 모델에 의존하는 것이 아니라, 국가적 데이터를 사용하고 국가적 슈퍼컴퓨터를 사용해야 한다고 명시적으로 주장합니다. 논문은 이러한 문제들이 아직 해결되었다고 주장하는 것이 아닙니다. 대신, 우리가 국가적 자원을 모으고(수백만 개의 의료 영상을 수집하고 대학 슈퍼컴퓨터를 사용하는 방식)서, 현지에 최적화된 강력한 의료 AI 시스템을 구축할 수 있다면 이는 실현 가능한 길이라고 제안합니다. 저자는 우리가 데이터를 효과적으로 조직하고 컴퓨팅 파워를 결집할 수 있다면, 이 접근 방식이 단지 꿈이 아니라 현실적인 경로라고 결론짓습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.