Are Multimodal LLMs Ready for Clinical Dermatology? A Real-World Evaluation in Dermatology
본 연구는 다중 모달 대규모 언어 모델이 공개 피부과 벤치마크에서는 유망한 성과를 보이지만 실제 임상 환경에서는 진단 정확도가 현저히 떨어지며, 이는 현재 모델들이 침상 부근 배포에 충분히 신뢰할 수 있는 수준이 아니라는 것을 시사한다고 밝힙니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
새로운 보조 인력을 고용하여 피부과 전문의 (피부 의사) 가 수천 건의 환자 사진과 기록을 분류하도록 돕는 상황을 상상해 보세요. 이 보조 인력이 발진 사진을 보고 의사의 간략한 메모를 읽어 "이것은 X, Y 또는 Z 로 보이며, 이 환자를 즉시 진찰해야 합니다"라고 말할 만큼 똑똑한지 확인하고 싶을 것입니다.
이 논문은 다섯 가지 다른 AI 보조 인력 (멀티모달 대규모 언어 모델, MLLM 이라고 함) 이 이 현실 세계의 직무에 준비되었는지 확인하기 위한 엄격한 "취업 면접"과 같습니다.
다음은 연구자들이 발견한 내용을 간단한 비유로 정리한 것입니다:
1. "모의고사" 대 "실제 업무"
상황 설정:
채용 전에 AI 보조 인력들은 공개 데이터 세트를 사용한 "모의고사"를 치렀습니다. 이러한 데이터 세트는 완벽하게 연출된 사진 촬영과 같습니다. 사진은 고품질이며, 특수 의료용 카메라 (피부경) 로 촬영되었고, 피부의 한 가지 명확한 병변만 보여주며 배경의 잡음은 없습니다. 이러한 완벽한 환경에서 AI 보조 인력들은 꽤 잘 수행했습니다. 가장 우수한 모델 (GPT-4.1) 은 약 42% 의 정답률을 보였으며, 오픈소스 모델들은 약 20~26% 를 기록했습니다.
현실 확인:
그런 다음 연구자들은 이들에게 "실제 업무" 테스트를 주었습니다. 이는 병원의 5,811 건의 실제 환자 사례를 포함했습니다.
- 사진: 이들은 완벽한 스튜디오 샷이 아니었습니다. 일반 의사나 환자가 휴대전화로 촬영한 것이었습니다. 조명은 나빴고, 구도는 어수선했으며, 종종 여러 개의 발진이나 배경 방해 요소 (병원 침대나 전화를 들고 있는 손 등) 가 있었습니다.
- 기록: 의뢰 의사가 작성한 메모는 종종 짧고 모호하거나, 때로는 문제의 본질에 대해 오해를 불러일으키는 내용을 담고 있었습니다.
결과:
AI 보조 인력들의 성능은 추락했습니다.
- 혼란스러운 실제 세계의 사진만 볼 때, 가장 우수한 AI 는 약 42% 의 정확도에서 약 24% 로 떨어졌습니다.
- 오픈소스 모델들은 더 크게 떨어졌는데, 약 26% 에서 불과 **1.5% 에서 13%**까지 하락했습니다.
- 비유: 깨끗하게 인쇄된 숫자로 된 수학 시험에서 'A'를 받은 학생이, 냅킨에 엉망으로 쓰인 같은 문제를 풀라고 할 때 처참하게 낙제하는 것과 같습니다.
2. "메모를 신뢰하는" 함정
연구자들은 사진과 함께 의사의 기록된 메모를 AI 에게 제공했을 때 어떤 일이 발생하는지 테스트했습니다.
- 좋은 소식: 메모가 도움이 될 때 AI 는 더 나아졌습니다. 탐정에게 유용한 단서를 주는 것과 같습니다.
- 나쁜 소식: AI 는 너무 신뢰하는 경향이 있었습니다. 의뢰 의사가 "이것은 거미에 물린 것 같습니다"라고 메모에 적으면, AI 는 사진을 무시하고 메모에 동의하는 경우가 많았습니다. 심지어 사진이 명확히 다른 것을 보여줄 때도 그랬습니다.
- 위험성: 의뢰 의사가 틀린 경우 (현실에서는 자주 발생합니다), AI 는 잘못된 진단을 자신 있게 반복했습니다. 어떤 경우에는 오해의 소지가 있는 메모를 추가하는 것이 사진만 본 것보다 AI 의 성능을 더 떨어뜨렸습니다. 한 모델 (SkinGPT-4) 은 메모가 오해의 소지가 있을 때 84% 의 비율로 혼란을 겪었습니다.
3. "분류 (Triage)" 테스트 (누가 지금 도움이 필요한가?)
AI 가 정확한 질병 이름을 짓는 데 어려움을 겪었으므로, 연구자들은 더 간단한 질문을 던졌습니다. "이 환자의 상태가 심각하고 긴급한가?" (줄 서서 대기하는 순서를 정하는 분류 간호사와 같습니다).
- 결과: AI 는 이 부분에서 나쁘지는 않았지만 훌륭하지는 않았습니다. 메모를 제공받았을 때 심각한 사례의 약 60% 를 찾아냈습니다.
- 단점: 심각한 사례를 많이 놓쳤으며, 이를 찾아내는 능력은 메모의 질에 전적으로 의존했습니다. 메모가 혼란스러우면 AI 는 긴급한 사례를 놓쳤습니다.
4. 어디에서 실패했는가? ("눈" 대 "뇌")
연구자들은 인간 피부과 전문의에게 AI 의 추론 능력을 평가하게 했습니다. 그들은 놀라운 사실을 발견했습니다.
- AI 의 "뇌" (추론) 는 괜찮았습니다. AI 는 의학적 사실을 알고 전문적인 어조로 문장을 작성할 수 있었습니다.
- AI 의 "눈" (시각) 이 문제였습니다. AI 는 발진의 구체적인 시각적 세부 사항을 정확하게 설명하지 못했기 때문에 실패했습니다. 질병을 정의하는 특정 모양이나 질감을 알아차리는 대신 "붉은 반점이 있다"와 같은 일반적인 말만 했습니다.
- 비유: 전체 사전을 외우고 완벽한 에세이를 쓸 수 있는 학생이 고양이 사진을 보여줄 때 수염이나 뾰족한 귀를 알려주지 못하는 상황을 상상해 보세요. 그들은 고양이에 대한 단어는 알지만 고양이를 볼 수는 없습니다.
결론
이 논문은 이러한 AI 모델들은 실제 피부과 진료소에서 혼자 일할 준비가 되지 않았다고 결론 내립니다.
- 벤치마크 성능은 오해의 소지가 있습니다: AI 가 깨끗하고 완벽한 데이터 세트에서 잘한다고 해서 병원의 혼란스러운 현실을 처리할 수 있다는 뜻은 아닙니다.
- 병목 현상은 "생각"이 아닙니다: 문제가 AI 가 추론을 못하기 때문이 아니라, 실제 세계의 사진에서 피부를 정확하게 "볼" 수 없으며 나쁜 메모에 쉽게 혼란을 겪기 때문입니다.
- 안전 경고: AI 가 혼란스러운 사진을 보고 오해의 소지가 있는 메모를 무시하는 데 더 나아질 때까지는, 인간 의사가 옆에서 지켜보지 않는 한 AI 가 결정을 내리는 것을 신뢰할 수 없습니다.
요약하자면: AI 는 필기시험은 통과했지만 실기 운전 시험은 떨어진 똑똑한 학생입니다. 자동차를 운전하기 전에 실제 세계의 "도로 상황"에 대해 더 많은 훈련이 필요합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.