← 최신 논문
💻 computer science

In-Context Learning for Wound Classification with Small Multimodal Language Models

본 연구는 소규모 멀티모달 언어 모델이 태스크별 재학습 없이도 쿼리 조건부 지원 예시와 최대 한계 관련성 재순위를 활용함으로써, 검색 기반 인컨텍스트 학습을 통해 공개 데이터셋에서 높은 정확도를 달성하며 학습이 필요 없는 상처 이미지 분류를 효과적으로 수행할 수 있음을 입증한다.

원저자: George Martvel, Oskar Gustafsson, John Pavia, Ernst Ahlberg

게시일 2026-07-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: George Martvel, Oskar Gustafsson, John Pavia, Ernst Ahlberg

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 찰과상, 화상, 또는 깊은 상처와 같은 다양한 유형의 상처를 인식하는 법을 가르치려 한다고 상상해 보세요. 보통 로봇에게 이를 가르치려면 수천 장의 라벨이 붙은 사진을 보여주고 "학습"이라는 과정을 통해 암기하도록 강요해야 합니다. 이는 마치 학생이 단 한 번의 시험을 위해 몇 주 동안 공부하게 만드는 것과 같습니다. 하지만 만로 로봇이 시험 직전에 몇 가지 예시를 보고 즉석에서 문제를 해결할 수 있다면 어떨까요? 이것이 바로 "인컨텍스트 러닝(In-Context Learning, ICL)"의 개념입니다. 학생에게 시험 직전 "화상"과 "절창"에 대한 완벽한 예시 세 개가 담긴 치트 시트를 건네주는 것과 같습니다. 학생은 교과서 전체를 암기할 필요 없이, 그저 예시를 보고 "아, 이 새로운 것은 화상 예시와 비슷하구나"라고 말하기만 하면 됩니다.

이제 이 로봇이 클라우드에 있는 거대한 슈퍼컴퓨터가 아니라, 노트북이나 휴대폰에 들어갈 정도로 작다고 상상해 보세요. 이것들을 "소형 멀티모달 언어 모델(Small Multimodal Language Models, SMLMs)"이라고 부릅니다. 이들은 개인 정보를 보호하는 데 탁층적인데, 당신의 사적인 의료 사진을 거대한 서버로 보낼 필요 없이 로봇이 기기 자체에서 직접 사고할 수 있기 때문입니다. 과학자들이 던진 핵심적인 질문은 이것입니다. 이 작은 로컬 로봇들이 단 몇 개의 예시만으로도 제대로 된 역할을 수행할 수 있을까요, 아니면 여전히 거대한 슈퍼컴퓨터와 방대한 학습 데이터가 필요할까요?

이 논문은 그 아이디어를 테스트합니다. 연구진은 매번 모델을 다시 학습시키지 않고도 이 작은 로컬 AI 모델들을 사용하여 상처 이미지를 분류할 수 있는지 확인하고자 했습니다. 그들은 약 1,469장의 이미지가 포함된 공공 컬렉션 하나와 560장이 포함된 또 다른 컬렉션을 사용하여 실험을 설계했습니다. AI에게 그냥 추측하라고 요청하는 대신(이는 "제로샷(zero-shot)"이라 불리며 종종 터무로한 추측으로 이어집니다), 연구진은 "치트 시트" 형태의 예시를 제공하는 방법을 시도했습니다. 하지만 여기에는 비결이 있습니다. 단순히 무작위 예시를 고른 것이 아니라, 새로운 상처 이미지와 가장 유사해 보이는 예시를 찾기 위해 스마트한 검색 시스템을 사용했다는 점입니다.

결과는 작은 로봇들에게 꽤 흥ende로운 것이었습니다. AI에게 스마트하게 선택된 예시들(특히 kNN이라는 검색 시스템으로 찾아낸 10개의 예시, 그리고 때로는 다양성을 확보하기 위해 MMR이라는 방법으로 정제된 예시들)을 주었을 때, AI는 업무 수행 능력이 훨씬 좋아졌습니다. 더 큰 데이터셋의 경우, 가장 뛰어난 작은 모델인 Qwen 3.5 27B 버전은 0.872의 정확도에 도달했습니다. 이는 진단을 87% 이상의 확률로 정확히 맞혔음을 의미합니다. 더 까다롭고 작은 데이터셋에서도 약 68%의 정확도를 기록했습니다.

또한 연구는 로봇의 크기가 중요하다는 것을 발견했습니다. 더 큰 소형 모델들(27B 및 9B 버전)은 예시를 활용하여 자신의 추측을 유의미하게 개선할 수 있었으며, 종종 가장 가까운 것에 기반해 투표하는 표준 컴퓨터 프로그램보다 더 나은 성능을 보였습니다. 그러나 아주 작은 모델들은 다소 어려움을 겪었는데, 때때로 미묘한 차이를 이해하기보다는 예시를 그대로 복사하는 수준에 그쳤습니다. 연구진은 또한 너무 방대한 치트 시트가 필요하지 않다는 것도 발견했습니다. 8개에서 10개 이상의 예시를 추가하는 것은 큰 도움이 되지 않았으며 오히려 과정만 느리게 만들었습니다.

결정적으로, 이 논문은 이 방식이 매번 새로운 작업에 맞춰 모델을 재학습시킬 필요 없이 작동한다는 것을 보여줍니다. 만약 의사들이 라벨을 바꾸거나 관찰하고자 하는 상처의 종류를 변경하더라도, 프롬프트에 들어가는 예시만 교체하면 모델은 즉각적으로 적응합니다. 성능이 완벽하지 않고 좋은 예시와 적절한 크기의 모델에 크게 의존하기는 하지만, 이 연구는 작은 로컬 AI 모델들이 상처를 분류하는 데 있어 실용적이고 개인 정보 보호에 유리한 방법이 될 수 있음을 시사하며, 데이터 집약적인 과거의 무거운 시스템들에 대한 유연한 대안을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →