Medmarks: A Comprehensive Open-Source LLM Benchmark Suite for Medical Tasks
본 논문은 30 가지 다양한 의료 과업과 61 개 평가 모델을 포함하는 포괄적인 오픈소스 벤치마크 스위트인 Medmarks 를 소개하며, 이는 최첨단 추론 모델이 정확도와 토큰 효율성 측면에서 다른 모델들을 능가하는 반면, 소형 모델들은 답변 순서 편향에 취약함을 드러냅니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능의 세계를 거대하고 분주한 병원으로 상상해 보세요. 오랫동안 우리는 어떤 AI "의사"들이 실제로 제 역할을 잘 수행하는지 파악하려고 노력해 왔습니다. 하지만 그들을 평가하는 데 사용해 온 테스트들은 마치 고장 난 점수판과 비슷해졌습니다. 너무 쉬워서 모든 AI 가 A+ 를 받거나, 너무 비밀스러워서 아무도 작업을 확인할 수 없거나, AI 가 환자의 문제를 실제로 해결하는지 여부가 아니라 교과서를 암기할 수 있는지만 테스트하는 식이었습니다.
이제 연구팀이 만든 완전히 오픈 소스인 새로운 AI 를 위한 "의과대학"인 MEDMARKS가 등장했습니다. 이는 거대하고 투명한 체육관과 같아서, 소형이고 예산 친화적인 모델부터 초대형 슈퍼컴퓨터 버전까지 61 개의 서로 다른 AI 모델이 30 가지의 신체 및 정신 테스트를 받기 위해 모입니다.
간단히 설명한 이 논문에서 발견한 내용은 다음과 같습니다.
1. 테스트 세트: 다양한 도전 과제
"프랑스의 수도는 어디인가?"와 같은 질문 (AI 에게는 쉽습니다) 을 던지는 대신, MEDMARKS 는 모델들에게 다양한 도전을 던집니다.
- 객관식 퀴즈 (MEDMARKS-V): AI 가 목록에서 정답을 고르는 표준 자격시험과 같습니다. 여기에는 까다로운 수학 문제와 길고 복잡한 환자 사례가 포함됩니다.
- 주관식 인터뷰 (MEDMARKS-OE): 여기서는 AI 가 "환자"와 대화하거나 치료 계획을 작성해야 합니다. 정답이 하나뿐이지 않기 때문에 연구진은 "심판 AI"(똑똑한 심판) 를 사용하여 인간 교사가 에세이를 채점하듯 대화를 평가했습니다.
- "훈련 바퀴" (MEDMARKS-T): 이 테스트의 특수 하위 집합은 AI 를 위한 체육관으로 사용하도록 설계되었습니다. 연구진은 코치가 운동선수를 향상시키기 위해 훈련을 활용하는 것처럼, 실제로 AI 를 더 잘하도록 "훈련"하는 데 이를 사용할 수 있습니다.
2. 결과: 누가 메달을 탔나요?
연구진은 누가 최상위에 올랐는지 확인하기 위해 서로 다른 설정으로 71 번 테스트를 실행했습니다.
- ** heavyweight 들의 승리 (대부분):** OpenAI(GPT-5.1/5.2) 와 Google(Gemini 3) 과 같은 회사의 가장 크고 강력한 AI 모델들이 일반적으로 가장 높은 점수를 받았습니다. 이들은 AI 의 올림픽 선수들과 같습니다.
- "전문가" 대 "일반인": 일부 AI 모델은 의학 서적과 노트를 기반으로 특별히 훈련되었습니다. 이러한 "전문가" 모델들은 종종 모든 것을 조금씩 아는 더 큰 "일반인" 모델들을 능가합니다. 이는 일 년에 한 번 방문하는 유명한 연예인 의사보다 자신의 지역을 더 잘 아는 지역 의사와 같습니다.
- 효율성 격차: 여기에는 놀라운 반전이 있습니다. 최상위 폐쇄형 소스 AI 모델 (유료 모델) 은 페라리와 같았습니다. 최고의 결과를 얻었지만 연료 (컴퓨팅 파워) 를 매우 적게 사용했습니다. 반면 오픈 소스 모델 (무료 다운로드) 은 트럭과 같았습니다. 때로는 일을 해낼 수 있었지만, 그렇게 하기 위해 막대한 양의 연료를 소모했습니다. 일부 오픈 모델은 유사한 점수를 얻기 위해 5 배 더 많은 컴퓨팅 파워가 필요했습니다.
3. 기이함과 결함
이 논문은 또한 이러한 AI "의사"들의 재미있고 우려스러운 습관들을 발견했습니다.
- "과도한 사고자들": AI 가 문제를 틀렸을 때, 종종 맞았을 때보다 더 많이 이야기했습니다. 이는 정답을 모를 때 긴장하며 중얼거리는 학생이 정답을 우연히 찾아내기를 바라는 것과 같습니다.
- "순서 편향": 객관식 답변의 순서 (A, B, C, D) 를 섞으면 일부 작은 AI 모델들이 혼란을 겪고 내용이 동일함에도 불구하고 답변을 변경했습니다. 이는 정답을 알기 때문이 아니라 중간에 있기 때문에 "C"를 선택하는 학생과 같습니다.
- "도구" 문제: 연구진이 수학 계산을 돕기 위해 AI 에게 계산기 도구를 제공했을 때, 많은 모델들이 실제로 더 나빠졌습니다. 그들은 계산기를 무시하거나, 잘못 사용하거나, 지시사항에 혼란을 느꼈습니다. 이는 요리사에게 새로운 칼을 주었는데, 새로운 도구에 익숙하지 않아 실수로 잘못된 재료를 자른 것과 같습니다.
4. 큰 그림
주요 결론은 AI 가 의료 작업에 매우 능숙해지고 있지만 아직 완벽하지는 않다는 것입니다.
- **최전선 모델 (가장 최신이고 가장 큰 모델들)**이 현재 리더입니다.
- 전문 훈련은 도움이 되지만, 가장 큰 모델을 이길 것을 보장하지는 않습니다.
- 효율성은 큰 문제입니다. 무료 모델들은 컴퓨팅 시간 측면에서 실행하는 데 너무 "비싸기" 때문입니다.
- 신뢰성은 여전히 문제입니다. 모델들은 질문 형식에 의해 쉽게 속이거나 도구를 사용할 때 혼란을 겪을 수 있습니다.
저자들은 MEDMARKS 를 "살아 있는 순위표"로 구축했습니다. 스포츠 리그가 매주 순위를 업데이트하듯, 이 벤치마크는 출시되는 새로운 AI 모델들을 지속적으로 테스트하도록 설계되어 현재 가장 뛰어난 "최고" 의료 AI 가 누구이며, 그들이 여전히 어디에서 어려움을 겪고 있는지 정확히 알 수 있도록 합니다. 그들은 모든 코드와 데이터를 공개하여 누구나 테스트를 실행하고 결과를 확인할 수 있게 함으로써 이 분야에 투명성을 가져왔습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.