← 최신 논문
💻 computer science

Evaluation of Medical Vision Language Models HuluMed and MedGemma, and general purpose chatbots Gemma 3, ChatGPT Plus, and Claude Pro on real previously unseen wound images

이 연구는 실제 상처 이미지를 대상으로 6개의 시각-언어 모델을 평가하였으며, ChatGPT나 Claude와 같은 범용 시스템이 임상적 상처 평가에서 의료 특화 모델보다 유의미하게 뛰어난 성능을 보이지만, 모든 모델이 자율적 신뢰성 측면에서 여전히 상당한 한계에 직면해 있다는 것을 발견했다.

원저자: Yunzhe Xue, Mohammed Saim Ahmed Quadri, Neal Panse, Justin W. Ady, Usman Roshan

게시일 2026-06-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yunzhe Xue, Mohammed Saim Ahmed Quadri, Neal Panse, Justin W. Ady, Usman Roshan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 여섯 명의 서로 다른 '디지털 탐정'들이 있다고 상상해 보세요. 이들의 임무는 20가지 다양한 유형의 개방성 상처(예: 베인 상처, 궤양, 또는 수술 부위) 사진을 보고, "이것이 감염되었는가?", "수술이 필요한가?", 또는 "어떤 종류의 붕대를 사용해야 하는가?"와 같은 12가지 특정 질문에 답하는 것입니다.

연구진은 어떤 탐정이 이 의료 퍼즐을 가장 잘 해결하는지 확인하고 싶었습니다. 그들은 두 종류의 탐정을 맞붙게 했습니다:

  1. 제너럴리스트(Generalists): 의학을 포함하여 모든 것에 대해 조금씩 알고 있는 유명하고 강력한 AI 챗봇들(ChatGPT와 Claude 등).
  2. 스페셜리스트(Specialists): 오직 의학 교과서와 데이터로만 학습된, 의사들을 위해 특별히 만들어진 AI 모델들(HuluMed 및 MedGemma 등).

테스트를 진행했을 때 다음과 같은 결과가 나왔습니다:

경주 결과

제너럴리스트가 압도적인 차이로 승리했습니다.

  • ChatGPT가 약 **73%**의 정답률을 기록하며 1위를 차지했습니다.
  • Claude가 약 **62%**로 2위를 차지했습니다.

스페셜리스트들은 눈에 띄게 고전했습니다.

  • (스페셜리스트 그룹 중 최고 성적을 거둔) HuluMed조차도 정답률이 **40%**에 불과했습니다.
  • 다른 의료용 AI들(MedGemma 및 Gemma 3)은 훨씬 더 낮은 점수를 받았으며, 그중 하나는 정답률이 18% 미만이었습니다.

점수의 "이유"

논문은 몇 가지 핵심 아이디어를 통해 이 놀라운 결과를 설명합니다:

1. "팔방미인" vs "좁은 분야의 전문가"
제너럴리스트 AI를 **맥가이버 칼(Swiss Army Knife)**이라고 생각해 보세요. 이들은 수백만 개의 서로 다른 이미지와 대화를 접해왔습니다. 상처를 볼 때, 이들은 방대한 폭의 넓은 경험을 사용하여 맥락을 파악합니다.
반면 스페셜리스트 AI는 오직 특정 종류의 나사만을 위해 설계된 드라이버와 같습니다. 이들은 의학 용어에 대해서는 많이 알지만, 실제 세상의 복잡한 사진을 보고 무엇을 해야 할지 결정해야 할 때는 혼란을 느끼는 듯합니다. 논문은 방대한 종류의 데이터로 학습되는 것이 의료 데이터로만 학습되는 것보다 '큰 그림'을 이해하는 데 도움이 된다고 제안합니다.

2. 보는 것 vs 결정하는 것
탐정들은 무언가를 보는 것에는 능숙했습니다. 대부분의 모델은 상처가 붉게 보이거나(감염), 괴사 조직(necrosis)이 있는지 등을 정확하게 식별할 수 있었습니다.
하지만 이들은 결정하는 것에는 매우 서툴렀습니다. "이것을 절제해야 하는가?" 또는 "MRI가 필요한가?"라는 질문을 받았을 때, 스페셜리스트 AI들은 종종 모호하고 주저하는 답변을 내놓거나 잘못된 처치를 제안했습니다.

  • 비유: 이는 자동차 엔진을 완벽하게 설명할 수는 있지만, 목적지까지 차를 실제로 운전해서 가는 법은 모르는 학생과 같습니다.

3. "우물쭈물하는(Waffling)" 문제
연구진은 AI에게 엄격한 채점 규칙을 부여했습니다: 반드시 명확한 "예" 또는 "아니오"로 답해야 합니다. 만약 "감염되었을 수도 있지만, 아닐 수도 있습니다"라고 말한다면 0점 처리됩니다.
스페셜리스트 AI들은 "우물쭈물하는" 습성이 있었습니다. 이들은 "임상적 징후에 따라 중재가 필요할 수도 있습니다"와 같이 말하곤 했습니다. 이런 방식은 신중하고 안전해 보일 수 있지만, 명확한 결정을 내리지 못했기 때문에 테스트에서는 오답으로 처리되었습니다. 제너럴리스트 AI들은 더 직접적이고 확신에 찬 답변을 내놓았습니다.

핵심 요약

논문은 현재 상처 사진을 보고 의사가 계획을 세우는 것을 도와야 한다면, 범용 목적의 챗봇이 의료 특화 AI보다 현재 더 낫다고 결론짓습니다.

하지만 이 결과에는 큰 경고 문구가 붙어 있습니다. 논문은 이러한 AI 도구들이 단독으로 작업할 준비가 되지 않았다고 말합니다. 이들은 의사의 생각을 정리하는 데 도움을 줄 수 있는 매우 똑똑한 인턴과 같지만, 여 still 실수를 저지릅니다. 의사는 실제 의료 결정을 내리기 전에 항상 AI의 작업을 재확인해야 합니다.

요약하자면: "일반 지식"을 가진 AI들이 현재 "의과대학" 출신의 AI들보다 상처 퍼즐을 더 잘 풀고 있지만, 두 종류 모두 아직 인간 의사를 대체할 만큼 완벽하지는 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →