Comparative Performance of General-Purpose Large Language Models and a Specialized Clinical AI Tool on OKAP-Style Ophthalmology Questions
본 연구는 OKAP 스타일의 안과 문제들을 대상으로 다섯 가지 거대 언어 모델을 평가하였으며, 범용 모델, 특히 Gemini-Pro-3가 정확도와 보정 측면에서 특화된 임상 AI 도구인 OpenEvidence보다 우수한 성능을 보였음을 밝히는 동시에, 모든 시스템에서 나타나는 상당한 성능 이질성과 공통된 추론 실패를 강조하였다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
안과 의사들을 위한 고난도 의학 시험인 OKAP이라는 것을 상상해 보세요. 이제, 이 까다로운 안과 질문들에 답하기 위해 다섯 가지 서로 다른 "초스마트" 컴퓨터 프로그램들이 이 시험을 치른다고 상상해 봅시다. 이 연구의 목표는 어떤 컴퓨터 프로그램이 안과 질문에 가장 잘 답하는지, 그리고 무엇보다도 중요한 점은 어떤 프로그램이 자신이 틀렸을 수도 있다는 사실을 스스로 인지하는지를 확인하는 것이었습니다.
다음은 일상적인 비유를 사용한 결과 요약입니다:
참가자들
연구진은 다섯 명의 서로 다른 AI "학생"들을 줄 세웠습니다:
- OpenEvidence: 의학 교과서만을 공부하고 유명한 의학 저널들과 직접 연결된 통로를 가진 특화된 학생입니다. 이것은 마치 의학 도서관의 내용을 모두 암기했지만, 그 외의 일반적인 지식은 부족한 의학 사서와 같습니다.
- Gemini-Pro-3, Claude-Opus-4.6, ChatGPT-5.4-Pro, 그리고 DeepSeek-v3.2: 이들은 "범용" 학생들입니다. 이들은 요리 레시피부터 물리학 논문까지 모든 것을 읽습니다. 이들은 박학다식한 폴리매스(박식가), 즉 많은 분야에 대해 조금씩 다 아는 사람들과 같습니다.
테스트
테스트는 안 건강에 관한 659개의 객관식 질문으로 구성되었습니다. 이 질문들은 쉬운 사실(예: "이 눈 부위의 이름은 무엇인가?")부터 복잡한 추론이 필요한 시나리오(예: "환자가 X 증상과 Y 병력을 가지고 있다면, 최선의 치료법은 무엇인가?")에 이르기까지 다양했습니다.
결과: 누가 승리했는가?
결과는 전문가들에게 놀라움을 안겨주었습니다:
- 챔피언: Gemini-Pro-3 (범용 학생)가 가장 높은 점수를 받았으며, 질문의 **95.8%**를 정확히 맞혔습니다. 이 모델은 다른 모든 모델을 상당한 차이로 제치며 압도적인 성적을 거두었습니다.
- 준우승: Claude-Opus-4.6 (또 다른 범용 학생)가 2위를 차지했습니다.
- 전문가: OpenEvidence (의학 사서)가 3위를 차지했습니다. 이 모델은 매우 우수한 성적(88%)을 냈지만, 범용 학생들을 이기지는 못했습니다. 실제로 범용 학생들의 성적이 전문가 모델보다 더 높았습니다.
- 나머지: ChatGPT와 DeepSeek이 그 뒤를 이었으며, DeepSeek이 73.7%로 가장 낮은 점수를 기록했습니다.
핵심 결론: 의료용으로 특화된 도구를 갖추었다고 해서 반드시 의학 질문에 더 똑똑하게 답한다는 보장은 없었습니다. 오히려 범용 AI가 이 특정 테스트에서 더 뛰어난 성능을 보였습니다.
"확신도" 체크
연구진은 AI에게 다음과 같이 물었습니다: "당신의 답이 맞다고 확신하는 정도는 어느 정도입니까?" (0에서 100 사이의 척도). 이것은 마치 학생에게 손을 들어 100% 확신한다고 말하라고 하는 것과 같습니다.
- 가장 "자기 객관화"가 잘 된 학생: Gemini-Pro-3가 가장 정직했습니다. 이 모델이 확신을 가질 때, 그 확신은 대개 실제 정답과 일치했습니다. 즉, 모델의 확신도가 실제 성능과 완벽하게 일치했습니다.
- "과잉 확신" vs "과소 확신": 다른 모델들은 정답을 구별해내는 능력(변별력)은 좋았으나, 자신의 확신도를 실제 정확도와 일치시키는 능력(교정)은 부족했습니다.
- 경고 신호: 한 모델인 DeepSeek은 이 부분에서 형편없었습니다. 이 모델은 틀렸을 때도 확신이 있다고 말하거나, 맞았을 때도 불확실하다고 말하는 경우가 잦았습니다. 이는 위험한 신호입니다. 만약 의사가 확신에 찬 오답을 믿게 된다면, 이는 의료 사고로 이어질 수 있기 때문입니다.
그들은 모두 어디에서 실패했는가?
연구진은 모든 AI가 공통적으로 틀린 9개의 질문을 살펴보았습니다. 그리고 그 이유를 찾아내려 노력했습니다.
- 성공한 부분: 그들은 단어와 기본적인 주제는 이해하고 있었습니다.
- 무너진 부분: 그들은 복잡한 추론과 출처 확인에서 무너졌습니다.
- 비유: 마치 학생이 질문은 완벽하게 읽었지만, 퍼즐을 풀기 위해 세 가지 서로 다른 사실을 연결해야 할 때 길을 잃는 것과 같습니다. 또는, 규칙집이 자신의 답을 뒷받침하는지 확인하지 않고 그냥 답을 찍는 것과 같습니다.
- AI는 단순히 사실을 기억하는 것이 아니라 "사고 단계"를 거쳐야 하는 질문에서 가장 큰 어려움을 겪었습니다.
제한 사항 (주의 사항)
저자들은 이 연구가 증명하지 않은 부분에 대해서도 주의 깊게 언급했습니다:
- 이미지 없음: 이 테스트는 텍스트로만 진행되었습니다. 실제 안과 진료에서는 눈 사진을 보게 됩니다. 이 연구 동안 이 AI들은 이미지를 보는 테스트를 받지 않았습니다.
- 실제 환자 아님: 이것은 시험 문제일 뿐, 복잡하고 까다로운 병력을 가진 실제 환자의 사례가 아닙니다.
- 일회성 테스트: AI는 테스트를 한 번만 수행했습니다. 만약 다시 질문한다면, 다른 답을 내놓을 수도 있습니다.
요약
간단히 말해, 현재는 범용 목적의 AI가 전문 의료용 AI보다 안과 의사 시험 질문에 더 잘 답하고 있습니다. 하지만 AI는 여전히 가장 어렵고 복잡한 추론 작업에서는 어려움을 겪고 있습니다. 또한, AI가 높은 점수를 받았다고 해서 이를 맹목적으로 신뢰해도 된다는 뜻은 아닙니다. AI가 자신이 불확실할 때 이를 제대로 인지하는지 확인해야 합니다. 이 연구는 우리가 AI가 실제 세상의 복잡성을 어떻게 다루는지 더 많이 알게 될 때까지, 현재로서는 이 도구들을 실제 의료 결정에 사용하는 것에 주의를 기울여야 함을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.