← 최신 논문
💻 computer science

Foundation Model-Enabled Efficient Data Sampling (FEEDS): A label-efficient training strategy for pan-cancer, multi-tracer PET/CT datasets

이 논문은 파운데이션 모델의 임베딩을 활용하여 주석(annotation)을 위한 가장 정보력이 높은 미라벨링 PET/CT 사례를 선택함으로써, 다양한 암 유형과 트레이서에 대해 70% 적은 주석 노력만으로도 전체 라벨링 수준의 성능을 달성하는 레이블 및 연산 효율적인 학습 전략인 FEEDS를 소개한다.

원저자: Biratal Raj Wagle, Bashirul Azam Biswas, Grant Chau, Matthew E. Maeder, Muhammad Azeem Arshad, Michael S. Leapman, James B. Yu, Indrani Bhattacharya

게시일 2026-08-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Biratal Raj Wagle, Bashirul Azam Biswas, Grant Chau, Matthew E. Maeder, Muhammad Azeem Arshad, Michael S. Leapman, James B. Yu, Indrani Bhattacharya

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 거대하고 혼란스러운 다락방에서 숨겨진 보물을 찾는 법을 가르치려 한다고 상상해 보세요. 이것은 단순한 다락방이 아닙니다. 수천 개의 인간 신체 3D 스캔으로 가득 찬 의료용 다락방입니다. "보물"은 암 병변이며, 이는 아주 작은 점처럼 보일 수도 있고 거대한 덩어리처럼 보일 수도 있으며, 어떤 장기에 있느냐와 어떤 종류의 스캔을 사용했느냐에 따라 서로 다른 모습을 보입니다. 로봇을 가르치기 위해서는 이 보물들의 예시를 보여주어야 합니다. 하지만 여기 함정이 있습니다. 인간 전문가가 모든 스캔 속의 모든 보물 주위에 완벽한 윤곽선을 그려야 한다는 것입니다. 이것은 마치 숙련된 화가에게 해변의 모든 모래알 하나하나에 대해 상세한 지도를 그리라고 요청하는 것과 같습니다. 시간이 엄청나게 오래 걸리고, 비용도 막대하며, 그 일을 할 전문 화가도 턱없이 부족합니다.

오랫동안 과학자들은 두 가지 방법으로 이 문제를 해결하려 했습니다. 로봇에게 모든 사진을 보여주거나(전문가가 지도를 그리는 데 드는 시간 때문에 불가능함), 혹은 아직 보지 못한 사진들에 대해 로봇이 스스로 추측하게 한 뒤 실수를 통해 배우기를 기대하는 것이었습니다(하지만 이는 종다 로봇을 혼란스럽게 만들어 가짜 보물을 만들어내게 하는 결과를 초래합니다). 이 과학 분야의 핵심 질문은 이것입니다: 어떻게 하면 인간 전문가가 수백만 개의 지도를 그리게 하지 않으면서도, 로봇이 숙련된 보물 사냥꾼이 되도록 가르칠 수 있을까? 우리는 로봇이 가장 적은 양의 작업으로 가장 많이 배울 수 있도록, 가장 좋은 몇 장의 사진을 골라내는 방법을 찾아야 합니다.

여기서 FEEDS(Foundation Model-Enabled Efficient Data Sampling)라고 불리는 새로운 전략이 등장합니다. FEEDS를 특정 보물 지도는 아직 보지 못했지만 세상의 모든 책을 읽은 아주 똑똑한 사서라고 생각해 보세요. 사서에게 모든 책을 다 읽고 나서 최고의 책을 골라내라고 요청하는 대신, FEEDS는 "바이브 체크(vibe check)" 도구(파운데이션 모델)를 사용하여 표시되지 않은 스캔들을 살펴봅니다. 이 도구는 특정 스캔이 다른 스캔과 얼마나 다른지를 즉각적으로 알려줄 수 있습니다. 마치 어떤 사진은 "햇살 가득한 해변"이고 다른 사진은 "폭풍우 치는 숲"이라는 것을 알아차리는 것과 같습니다.

이 논문은 FEEDS가 세 가지 간단한 단계로 작동한다고 설명합니다. 첫째, 표시되지 않은 모든 스캔을 가져와 시각적 특징을 바탕으로 "바이브 점수"를 부여합니다. 둘째, 인간 전문가가 이미 표시해 둔 적은 양의 스캔 뭉치(기존의 "레이블이 지정된 데이터")를 보고, "표시되지 않은 스캔 중 우리가 이미 알고 있는 것과 가장 다른 것은 무엇인가?"라고 묻습니다. 구체적으로 로봇이 이전에 본 적 없는 기이하고, 희귀하며, 특이한 사례들을 찾아냅니다. 셋째, 인간 전문가에게 바로 그 특정하고 독특한 사례들에 대해서만 지도를 그려달라고 요청합니다. 이렇게 얻은 새로운 지도들은 로봇의 학습용 더미에 추가되며, 로봇은 단 한 번의 훈련을 거칩니다.

연구진은 이 아이디어를 다양한 병원의 방대한 암 스캔 컬렉션을 사용하여 테스트했습니다. 그 결과, FEEDS를 사용하여 가장 다양하고 흥미로운 사례들을 선별함으로써, 데이터베이스의 모든 스캔을 학습한 로봇만큼이나 뛰어난 성능을 가진 로봇을 훈련할 수 있다는 것을 발견했습니다. 이때 인간 전문가는 전체 데이터의 **30%**에 대해서만 지도를 그려야 했습니다. 실제로 FEEDS로 훈련된 로봇은 단순히 무작위로 사진을 골라 훈련된 로봇보다 실제 암 부위를 더 잘 찾아냈고, 실수(예: 건강한 조직을 암이라고 생각하는 것)를 더 적게 범했습니다. 심지어 이 로봇을 한 번도 본 적 없는 다른 병원의 새로운 데이터로 테스트했을 때도 놀라운 성능을 유지했는데, 이는 로봇이 단순히 특정 사진을 암기한 것이 아니라 게임의 "규칙"을 배웠음을 증명합니다.

저자들은 이 방법이 엄청난 시간과 노력을 아껴주기 때문에 게임 체인저가 될 것이라고 제안합니다. 모든 것에 레이블을 붙이는 느리고 비용이 많이 드는 과정이나, 로봇이 스스로 추측하고 수정하며 반복하게 만드는 혼란스러운 과정 대신, FEEDS는 효율적인 단계를 제공합니다. 우리가 어떤 데이터를 레이블링할지 똑똑하게 결정함으로써, 의사들을 과로하게 만들지 않고도 강력한 의료 도구를 구축할 수 있음을 보여줍니다. 이 논문은 이 접근 방식이 다양한 종류의 암과 다양한 스캐닝 기기에 걸쳐 작동함을 보여주며, 의료 영상의 미래를 위한 실질적인 도구임을 입증합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →