← 최신 논문
💻 computer science

Performance evaluation and benchmarking across 16 large language models on a comprehensive real-world emergency department triage data set

본 연구는 실제 응급실 분류 데이터를 바탕으로 16개의 대규모 언어 모델을 벤치마킹하였으며, 구조화된 프롬프팅이 중증도 분류에서 간호사와 상당한 일치도를 달 יכול 수 있음에도 불구하고, 대부분의 모델이 제한적인 정확도, 미흡한 구역 배정, 체계적인 과잉 확신, 그리고 비결정론적 동작을 보인다는 점을 발견하였고, 이는 추가적인 검증과 개선 없이는 이들이 아직 임상 현장에 도입될 준비가 되지 않았음을 나타낸다.

원저자: Leo Benning, Anja Hirsch, Matthias Gröschel, Tobias Röschl, Martin Spott, Felix Patricius Hans, Tim Urban, Hans-Jörg Busch, Alexander Meyer, Julian Gabriel Madrid

게시일 2026-06-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Leo Benning, Anja Hirsch, Matthias Gröschel, Tobias Röschl, Martin Spott, Felix Patricius Hans, Tim Urban, Hans-Jörg Busch, Alexander Meyer, Julian Gabriel Madrid

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

바쁜 병원 응급실을 거대한, 혼란스러운 기차역이라고 상상해 보세요. 매일 수천 명의 사람들이 긁힌 무릎부터 심장마비에 이르기까지 각기 다른 문제를 안고 도착합니다. 이 "역장"(트리아제 간호사)의 업무는 각 사람을 살펴보고, 그들의 문제가 얼마나 시급한지 결정하여 어느 플랫폼으로 갈지 알려주는 것입니다. 즉, 고속 열차(위급한 사례를 위한 응급실)로 갈지, 아니면 로컬 버스 정류장(경미한 문제를 위한 긴급 진료 클리닉)으로 갈지를 결정하는 것이죠.

이 일은 믿기 힘들 정도로 어렵습니다. 매우 빠르게 진행되며, 압박감이 심하고, 잘못된 결정의 결과는 생사와 직결될 수 있습니다.

최근 사람들은 이렇게 묻고 있습니다: "역장을 도울 수 있는 아주 똑똑한 AI 로봇(거대 언어 모델 또는 LLM)을 고용할 수 있을까?" 이 AI 로봇들은 거의 모든 책을 다 읽은 명석한 학생과 같습니다. 하지만 그들이 실제로 기차역을 운영하는 법을 배웠을까요?

이 논문은 독일의 한 병원에서 실제 데이터를 사용하여 테스트한 16개의 서로 다른 AI 로드에 대한 성적표입니다. 연구 결과는 다음과 같이 쉽게 설명되어 있습니다:

1. "시승 주행"

연구진은 16,107개의 실제 환자 기록(익명화 처리되어 이름은 포함되지 않음)을 가져와서 16개의 서로 다른 AI 모델에게 트리아제 간호사 역할을 수행하도록 요청했습니다. AI는 두 가지를 해야 했습니다:

  • 긴급도 등급 매기기: 환자에게 1점(지금 당장 사망 직전)부터 5점(사소한 불편함)까지의 점수를 부여합니다.
  • 목적지 선택하기: 환자를 응급실(ER)로 보낼지, 아니면 긴급 진료 클리닉(Urgent Care Clinic)으로 보낼지 결정합니다.

그들은 AI의 답변을 실제 간호사들이 내린 결정과 비교했습니다.

2. 결과: 대부분의 로봇은 아직 배우는 중입니다

만약 인간 간호사가 "골드 스탠다드(표준)"라면, 대부분의 AI 로봇은 시험을 훌륭하게 통과하지 못했습니다.

  • "평균적인" 학생: 대부분의 AI 모델은 "보통"에서 "적당한" 수준의 성적을 받았습니다. 그들은 간호사와 약 절반 정도의 확률로 의견이 일치했습니다.
  • "자신만만한" 실패: 여기가 무서운 부분입니다. AI는 틀렸을 때조차 자신이 맞다고 확신하며 매우 자신만만했습니다. 이는 마치 수학 문제를 틀려놓고 손을 번쩍 들며 "저는 이게 정답이라고 100% 확신합니다!"라고 외치는 학생과 같습니다. 논문은 AI의 자기 확신도가 실제로 정답을 맞혔는지와 거의 아무런 관련이 없다는 것을 발견했습니다.
  • "신뢰할 수 없는" 로봇: 만약 같은 AI에게 같은 질문을 100번 던진다면, 그 AI는 23%의 확률로 다른 대답을 내놓았습니다. GPS에게 길을 물었는데, 교통 상황은 변하지 않았음에도 오늘은 "좌회전"이라고 했다가 내일은 "우회전"이라고 말하는 것과 같습니다. 이러한 "비결정론적" 행동은 병원에서 매우 위험합니다.

3. 비밀 병기: "단계별" 가이드

한 가지 큰 놀라움이 있었습니다. 연구진은 가장 우수한 AI 모델 중 하나에 특정 기술을 사용해 보았습니다. 단순히 "여기 환자가 있으니 어떻게 생각하느냐?"라고 묻는 대신, AI에게 체크리스트를 제공했습니다.

  • 1단계: 환자가 죽어가고 있는가?
  • 2단계: 고위험 증상이 있는가?
  • 3단계: 활력 징후(vital signs)는 어떠한가?
  • 4단계 얼마나 많은 자원이 필요한가?

AI가 이 단계별 논리(인간 간호사가 하는 방식처럼)를 따르도록 강제했을 때, 성능이 "상당한" 수준으로 뛰어올랐습니다. AI는 거의 인간 간호사만큼 잘하게 되었습니다.
교훈: AI가 얼마나 "크고" "똑똑한가"는 중요하지 않았습니다. 중요한 것은 질문을 어떻게 하느냐였습니다. AI에게 명확하고 구조화된 규칙을 주는 것이 그냥 추측하게 두는 것보다 훨씬 효과적이었습니다.

4. "어디로 갈 것인가"의 문제

AI는 긴급도 점수를 맞히는 데는 (때때로) 괜찮았지만, 환자를 어디로 보낼지(응급실 vs 긴급 진료) 결정하는 데는 형편없었습니다.

  • AI는 종종 경미한 문제를 가진 사람들을 응급실로 보내서(과잉 분류) 시스템을 정체시켰습니다.
  • 혹은 심각한 문제를 가진 사람들을 긴급 진료소로 보내서(과소 분류) 위험한 상황을 초래했습니다.
  • 논문은 이것이 AI가 해당 병원의 "지역 규칙", 예를 들어 새벽 3시에 어느 클리닉이 문을 여는지, 혹은 어떤 건물에 적절한 장비가 있는지와 같은 정보를 모르기 때문이라고 시사합니다.

5. 결론

이 논문은 이러한 AI 로봇들이 인상적이기는 하지만, 혼자서 버스를 운전할 준비는 되어 있지 않다고 결론짓습니다.

  • 그들은 너무 일관성이 없고 (생각을 자주 바꿉니다).
  • 너무 과신하며 (자신이 틀렸다는 것을 모릅니다).
  • 인간 "부조종사"가 그들의 작업을 확인해야 합니다.

현재 이들을 더 잘 작동하게 만드는 유일한 방법은, 그들을 마법 같은 '블랙박스'로 취급하는 것이 아니라 엄격하고 단계적인 지침서가 필요한 '학생'으로 취급하는 것입니다. 우리가 그들의 신뢰성과 확신 문제를 해결할 수 있을 때까지, 그들은 스스로 생사가 걸린 결정을 내려서는 안 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →