Automating the triage of rheumatology outpatient referrals: a comparative evaluation of 23 large language models under simple and advanced prompting
이 연구는 현대의 거대 언어 모델들이, 특히 고급 프롬프팅 기술에 의해 유도될 때, 인간 전문가와 대등하거나 이를 상회하는 정확도로 류마티스 내과 의뢰 분류를 자동화할 수 있음을 입증하며, 결과적으로 비용이 많이 드는 대규모 모델의 필요성을 효과적으로 제거한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매일 관절 통증, 부종 또는 경직을 겪는 수천 명의 사람들이 도움을 요청하며 류마티스 전문의들에게 편지를 보냅니다. '의뢰서'라고 불리는 이 편지들은 전문가들이 분류해야 할 홍수처럼 밀려듭니다. 이 분류 작업인 '트리아지(triage, 환자 분류)'의 목표는 상태가 장기나 생명을 위협할 수 있어 즉시 진료가 필요한 사람과, 몇 주 또는 몇 달을 기다려도 안전한 사람을 결정하는 것입니다. 이 과업은 복잡하고 구조화되지 않은 텍스트를 읽고 판단을 내려야 하는 선임 의사들의 몫입니다. 이는 환자를 보고 질병을 치료하는 데 써야 할 시간을 빼앗는, 고도로 집중력을 요하며 정신적으로 소모적인 일입니다. 시스템이 잘 작동할 때는 가장 아픈 사람들이 빠르게 도움을 받습니다. 시스템이 실패할 때는 급격히 악화되는 자가면역 질환을 가진 환자가 너무 오래 기다리게 되어 영구적인 손상 위험을 초러할 수 있습니다. 그러나 숙련된 인간 의사가 수행하더라도 이 분류 과정은 완벽하지 않습니다. 전문가들 사이에서도 의견이 엇갈리는 경우가 많으며, 긴급한 사례가 누락되거나 지연되기도 합니다.
의뢰 건수가 가용한 전문의 수보다 빠르게 증가함에 따라, 클리닉들은 인공지능을 활용할 방법을 모색하고 있습니다. 구체적으로, 그들은 방대한 양의 텍스트를 학습하여 인간의 언어를 이해하고 생성할 수 있는 컴퓨터 프로그램인 대규모 언어 모델(LLM)을 테스트하고 있습니다. 이러한 모델들은 이미 의료 질문에 답하거나 진단을 보조하는 데 사용되고 있지만, 류마티스 의뢰서를 분류하는 것과 같이 구체적이고 중대한 업무를 신뢰성 있게 수행할 수 있을지는 불분명했습니다. 핵심 질문은 단순히 컴퓨터가 이 일을 할 수 있는지 여부가 아니라, 인간 팀만큼 잘 해낼 수 있는지, 그리고 가장 강력하고 비싼 컴퓨터를 사용하는 비용이 제대로 된 성과를 내기 위해 반드시 필요한가 하는 점이었습니다.
호주 모나쉬 헬스(Monash Health)의 한 연구자는 23개의 서로 다른 대규모 언어 모델을 엄격한 테스트에 투입함으로써 이 질문들에 대한 답을 찾고자 했습니다. 연구진은 실제 사례를 바탕으로 생명을 위협하는 응급 상황부터 일상적인 통증에 이르기까지 전 범위를 포괄하는 23가지의 현실적인 의뢰 시나리오를 만들었습니다. 정답에 대한 '골드 스탠더드(gold standard)'를 설정하기 위해, 네 명의 독립적인 류마티스 전문의가 서로의 결정을 모른 채 모든 사례를 검토하였고, 최종적으로 각 사례에 대한 합의된 긴급도를 결정했습니다. 그 후 연구자는 23개의 컴퓨터 모델 각각에 동일한 20가지 사례를 분류하도록 요청했습니다. 결과가 단순히 운 좋은 추측이 아니라 안정적인지 확인하기 위해, 각 모델은 모든 사례에 대해 세 번씩 결정을 내리도록 요청받았습니다. 실험은 두 번 진행되었습니다. 한 번은 모델에게 의뢰서를 분류하라는 매우 단순한 지침을 준 경우였고, 다른 한 번은 어떻게 생각해야 하는지에 대한 상세한 설명과 각 긴급도가 무엇을 의미하는지에 대한 예시를 제공하고, 통증 수준과 같은 덜 관련 있는 요소는 무시하면서 특정 의학적 징후에 집중하도록 유도하는 훨씬 더 상세한 지침을 제공한 경우였습니다.
결과는 이 기계들이 사고하는 방식에서 명확한 패턴을 드러냈습니다. 단순한 지침만 주어졌을 때, 모델들은 서로 매우 다르게 작동했습니다. 가장 크고 발전되었으며 가장 비싼 모델들이 더 작고 저렴한 모델들보다 현저히 높은 정확도를 보였습니다. 이 단순한 설정에서는 더 큰 모델을 위해 더 많은 비용을 지불하는 것이 더 나은 성능을 보장했습니다. 그러나 연구자가 더욱 발전되고 상세한 지침으로 전환했을 때 이야기는 완전히 바뀌었습니다. 이 더 나은 가이드가 제공되자 모델 간의 성능 격차가 사라졌습니다. 더 작고 저렴한 모델들이 비싼 모델들을 따라잡았으며, 비용과 정확도 사이의 연관성도 사라졌습니다. 상세한 지침은 작은 모델들에게 문제에 대해 추론하는 법을 가르쳐 주었고, 이를 통해 값비싼 거대 모델들과 대등한 성과를 내면서도 높은 비용을 들일 필요가 없게 만들었습니다.
최선의 지침을 사용했음에도 불구하고 컴퓨터는 완벽하지 않았습니다. 모델들은 때때로 환자가 실제보다 더 아프다고 제안하기도 했고, 때로는 덜 아프다고 제안하기도 했습니다. 연구자는 '언더-트리아지(under-triaging, 환자 과소 분류)'—즉, 긴급한 사례를 놓치는 것—의 오류가 가장 위험한 유형의 실수이며, 이는 결정적인 치료를 지연시킬 수 있다고 언급했습니다. 이러한 위험에도 불구하고, 상위 성능을 보이는 모델들은 대부분의 사례에서 인간의 합의와 일치했으며, 세 번의 시도 모두에서 올바른 긴급도를 맞히는 경우가 많았습니다. 이러한 성능 수준은 인간 의사들 사이에서도 약 3분의 1의 사례에서 의견이 엇갈리고 환자를 직접 본 후에 긴급도 등급을 변경하는 일이 빈번하다는 보고된 정확도 범위 내에 있거나 그 이상이었습니다.
이 연구는 이러한 행정적 부담을 자동화할 수 있는 도구가 이미 존재하며, 생각보다 더 저렴할 수 있음을 시사합니다. 핵심적인 발견은 컴퓨터에게 질문을 던지는 방식이 컴퓨터 자체만큼 중요하다는 것입니다. 명확한 규칙과 예시를 포함한 잘 설계된 프롬프트(prompt)를 사용함으로써, 클리닉들은 가장 비싼 시스템에 필적하는 결과를 얻기 위해 더 작고 저렴한 모델을 사용할 수 있습니다. 이를 통해 의료 서비스는 선임 의사들을 분류 작업에서 해방시켜 그들이 환자를 치료하는 데 더 많은 귀중한 시간을 쓸 수 있게 할 수 있습니다. 기술은 유망하지만, 연구자는 실세계에서 사용될 모든 시스템이 긴급한 사례를 놓치지 않도록 면밀히 모니터링되어야 하며, 인간 의사가 가장 중요한 결정을 검토하는 과정에 반드시 포함되어야 한다고 강조합니다. 앞으로의 과제는 이러한 도구들을 실제 살아있는 의뢰서에 적용하여 테스트하고, 안전성을 확보하기 위해 지침을 정교화하는 것이지만, 데이터는 류마티스 분류를 위한 신뢰할 수 있는 자동화 보조 도구가 더 이상 먼 미래의 꿈이 아님을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.