← 최신 논문
⚡ electrical engineering

Integrating Implicit and Explicit Relational Biases through Graph-Based Multiple Instance Learning: A Case Study in Skin Lesion Diagnosis

본 논문은 마스크드 오토인코더를 통한 암시적 패치 간 학습과 명시적 그래프 기반 모델링을 결합한 이중 수준 관계 프레임워크를 제안하며, 이를 통해 ISIC-2018 데이터셋에서 79.27%의 균형 정확도를 달 Achieving 달성함으로써 ISIC 벤치마크 상의 피부 병변 진단 성능을 유의미하게 향상시킨다.

원저자: Rafał Buler (Gdańsk University of Technology), Jakub Buler (Gdańsk University of Technology), Maciej Bobowicz (Medical University of Gdańsk), Michał Grochowski (Gdańsk University of Technology)

게시일 2026-08-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Rafał Buler (Gdańsk University of Technology), Jakub Buler (Gdańsk University of Technology), Maciej Bobowicz (Medical University of Gdańsk), Michał Grochowski (Gdańsk University of Technology)

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 컴퓨터에게 사진 한 장만 보고 특정 유형의 물체, 예를 들어 희귀한 새나 옷에 묻은 까다로운 얼룩을 인식하도록 가르치려 한다고 상상해 보세요. 인공지능의 세계에서 이것은 이미지 분류(image classification)라고 불립니다. 오랫동안 컴퓨터는 색상의 아주 작은 점(픽셀)들을 보고 그것들이 어떻게 모여 형태를 이루는지 학습함으로써 이 분야에서 매우 뛰어난 능력을 보여왔습니다. 하지만 함정이 하나 있습니다. 현실 세계의 물체, 특히 피부 병변과 같은 의료 분야의 대상은 단순히 무작위로 쌓인 픽셀 덩어리가 아닙니다. 그것들은 구조를 가지고 있습니다. 점의 가장자리는 중심부와 관계를 맺는 것처럼, 점의 각 부분은 서로 소통합니다.

컴퓨터가 이러한 관계를 이해하도록 돕기 위해, 과학자들은 "귀납적 편향(inductive bias)"이라는 것을 사용합니다. 이것은 세상이 어떻게 돌아가는지에 대해 우리가 컴퓨터에게 주는 일종의 규칙이나 힌트라고 생각하면 됩니다. 한 가지 방법은 "암시적(implicit)" 학습으로, 컴퓨터가 수백만 장의 사진을 보며 스스로 연결 고리를 찾아내는 방식입니다. 마치 당신이 어떤 특징이 중요한지 구체적으로 듣지 않고도 친구의 얼굴을 인식하는 법을 배우는 것과 비슷합니다. 또 다른 방법은 "명시적(explicit)" 학습으로, 우리는 이미지의 어느 부분이 이웃하며 서로 비교되어야 하는지를 컴퓨터에게 직접 지도로 그려서 보여줍니다. 이 논문은 이 두 가지 접근 방식을 결합했을 때 어떤 일이 일어나는지 탐구합니다. 즉, 컴퓨터가 스스로 기초적인 것을 배우게 하고, 그 후에 점들을 더 잘 연결할 수 있도록 구체적인 지도를 제공하는 것입니다. 목표가 무엇일까요? 의료 진단의 정확도를 높이는 것입니다. 이는 의사들이 질병을 조기에 발견하기 위해 가능한 모든 이점을 가져야 한다는 점에서 매우 중요한 일입니다.


논문의 이야기: 컴퓨터가 스스로 "대화"하도록 가르치기

이 논문은 연구진이 두 가지 서로 다른 사고방식을 섞어서 컴퓨터가 피부 병변(암일 수도 있는 피부의 점)을 진단하는 데 더 똑똑해질 수 있는지 확인하고자 한 내용에 관한 것입니다. 그들은 컴퓨터가 먼저 이미지의 "분위기"를 스스로 이해하게 한 다음, 이미지의 서로 다른 부분들과 명시적으로 대화하도록 강제함으로써 업무 수행 능력을 높일 수 있는지 확인하기 위해 작은 실험을 설계했습니다.

먼저, 그들은 컴퓨터에게 "자기 지도 학습(self-supervised)" 세션을 주었습니다. 여러분이 퍼즐을 가지고 있는데, 누군가 퍼즐 조각의 절반을 가려놓고 남은 조각들을 바탕으로 가려진 부분에 무엇이 있을지 추측해 보라고 하는 상황을 상상해 보세요. 컴퓨터도 이와 유사한 작업을 수행했습니다. 피부 병변 이미지를 보고, 이미지의 일부를 숨긴 뒤, 남은 부분을 재구성하려고 시도했습니다. 이것이 암시적 부분입니다. 즉, 게임의 규칙을 직접 플레이하며 배우는 것입니다.

그다음, 그들은 학습된 "분위기(임베딩)"를 가져와 피부 점을 분류하려고 시했습니다. 그들은 컴퓨터가 모든 패치(조각)를 살펴보고 무엇이 진단인지 투표하는 표준적인 방법으로 시작했습니다. 이것이 그들의 베이스라인(기준점)이었으며, ISIC-2018 테스트 세트에서 **76.17%**의 "균형 정확도(balanced accuracy)"를 기록하며 꽤 잘 작동했습니다. 하지만 연구진은 여기서 멈추지 않았습니다. 그들은 명시적인 부분, 즉 "지도"를 추가하여 더 나은 결과를 낼 수 있는지 알고 싶었습니다.

그들은 패치들을 다양한 "그래프(graph)"로 조직했는데, 그래프란 점(패치)들이 선(관계)으로 연결된 화려한 네트워크를 말합니다. 그들은 세 가지 유형의 지도를 시도했습니다:

  1. 무작위(Random): 패치들을 무작위 이웃에게 연결하는 것으로, 마치 혼란스러운 단체 채팅방와 같습니다.
  2. 그리드(Grid): 패치를 오직 바로 옆의 이웃에게만 연결하는 것으로, 옆집하고만 대화하는 도시의 블록과 같습니다.
  3. k-최근접 이웃(kNN): 위치에 상관없이 서로 가장 닮은 패치들과 연결하는 것으로, 취미가 같은 사람들끼리만 어울리는 동호회와 같습니다.

그런 다음, 그들은 그래프 신경망(Graph Neural Network)이라는 특수한 유형을 사용하여, 이 패치들이 최종 결정을 내리기 전에 지도의 선을 따라 서로 "메시지를 전달"할 수 있도록 했습니다.

연구 결과

결과는 꽤 명확했습니다. 단순히 패치를 보고 투표했던 컴퓨터(베이스라인)는 **76.17%**의 정확도를 보였습니다. 여기에 "암시적" 학습(자기 지도 재구성)을 추가하자 정확도는 **77.12%**로 뛰었습니다. 하지만 진짜 마법은 명시적 지도를 추가했을 때 일어났습니다.

가장 뛰어난 성과를 낸 것은 특정 유형의 메시지 전달 네트워크인 그래프 어텐션 네트워크(GAT)와 그리드 그래프를 결합한 모델이었습니다. 피부 병변의 물리적 배치를 존중하도록 강제한 이 설정은 정확도를 **79.27%**까지 끌어올렸습니다. 이는 상당한 개선입니다! 두 번째의 더 큰 데이터셋(ISIC-2019)에서도 암시적 학습과 kNN 그래프(유사한 패치들을 연결)를 혼합한 동일한 전략이 정확도를 **60.67%**로 높였으며, 이는 암시적 학습만 사용했을 때의 **59.84%**를 능가했습니다.

연구진은 "만약"의 시나리오도 테스트했습니다. 만약 컴퓨터가 메시지로부터 배울 수 없고 고정된 사전 설정 지도만을 사용한다면 어떻게 될까요? 그래프 네트워크의 학습 부분을 "동결(freeze)"했을 때, 성능은 **34.28%**로 폭락했습니다. 이는 컴퓨터가 패치 간의 관계를 능동적으로 학습해야 한다는 것을 시사합니다. 단순히 지도를 가지고 있는 것만으로는 충분하지 않습니다. 학습 과정 자체가 차이를 만드는 핵심입니다.

이것이 왜 중요한가

이 논문은 비결이 단순히 더 많은 데이터나 더 큰 컴퓨터를 갖는 것이 아니라, 점들을 어떻게 연결하느냐에 있다는 점을 시사합니다. 컴퓨터가 스스로 패턴을 학습하는 능력(암시적)과 이미지의 서로 다른 부분을 비교하는 구조적인 방식(명시적)을 결합함으로써, 그들은 이전의 많은 방법보다 더 정확한 시스템을 만들었습니다. 실제로 그들의 단일 모델은 최대 90개의 복잡한 모델을 결합한 거대한 "앙상블(ensemble)" 방식의 예측과 거의 맞먹는 성능을 보여주었습니다.

저자들은 이 접근 방식이 각 부분 사이의 관계가 결정적인 역할을 하는 의료 영상 처리에 있어 유망한 방법이라고 결론지었습니다. 그들은 암시적 학습이 훌륭한 기초를 제공한다면, 명시적 관계 모델링을 추가하는 것은 그 기초 위에 튼튼한 지붕을 얹는 것과 같다는 것을 발견했습니다. 이는 AI의 세계에서, 때로는 컴퓨터에게 무엇을 볼 것인가뿐만 아니라, 보이는 것들 사이의 연결 고리를 어떻게 생각해야 하는지도 가르쳐야 한다는 점을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →