Developing an open-source framework for LLM evaluation of patients using EHR clinical documentation; performance of LLMs relative to medical professionals
본 연구는 현재의 거대 언어 모델들이 이비인후과 전자 건강 기록으로부터 구조화된 임상 정보를 추출할 때 의료 전문가와 대등한 평가자 간 신뢰도를 달성하는 데 실패함을 입증하며, 이는 이 모델들이 자율적인 임상 배치보다는 인간의 검증이 필요한 초기 데이터 추출에 가장 적합함을 시사한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
오늘날 병원들은 방대한 양의 서면 기록을 생성합니다. 모든 환자의 방문, 모든 검사 결과, 그리고 모든 치료 결정은 전자 건강 기록이라 불리는 디지털 노트로 기록됩니다. 이 문서들은 의사들이 증상을 설명하고, 질병을 진단하며, 치료 계획을 세울 때 사용하는 특유의 언어를 포함하고 있어 매우 상세한 내용을 담고 있습니다. 수십 년 동안, 이러한 비정형적인 이야기들을 체계적이고 검색 가능한 데이터로 변환하는 것은 어려운 과제였으며, 종종 사람이 직접 읽고 손으로 다시 작성해야 하는 과정을 필요로 했습니다. 최근에는 거대 언어 모델(large language model)이라 불리는 새로운 유형의 컴퓨터 프로그램이 등장했습니다. 이 시스템들은 방대한 양의 텍스트를 학습하며, 인간의 언어를 놀라울 정도로 유창하게 읽고, 이해하고, 요약할 수 있습니다. 이들은 의료 질문에 답하거나 면허 시험을 통과할 수 있음을 보여주었으며, 이는 많은 이들로 하여금 이 모델들이 환자의 기록을 읽고 그 안에 담긴 핵심적인 사실들을 자동으로 추출할 수 있을지 궁금하게 만들었습니다.
이 문제는 단순히 시간을 절약하는 것에 관한 것이 아닙니다. 그것은 안전과 정확성에 관한 문제입니다. 만약 컴퓨터가 의사의 환자 관리를 돕고자 한다면, 정보를 지어내거나 중요한 세부 사항을 놓치지 않고 올바른 정보를 찾아내야 합니다. 한 새로운 연구는 이러한 능력을 직접 테스트하기 위해 설정되었습니다. 연구진은 이비인후과 클리닉에서 가져온 약 100개의 실제 환자 기록을 모았고, 인간 의사와 7개의 서로 다른 거대 언어 모델에게 이를 읽게 했습니다. 과업은 환자의 나이, 증상, 진단명, 그리고 받은 치료와 같은 구체적인 사실들을 뽑아내는 것이었습니다. 모두가 동일한 언어를 사용하도록 보장하기 위해, 연구진은 모든 정보가 전 세계 병원에서 사용되는 표준화된 코드로 번로되도록 요구했습니다. 이를 통해 기계가 인간에 비해 얼마나 잘 수행했는지 정밀하게 비교할 수 있었습니다.
결과는 인간의 전문 지식과 현재 인공지능 사이의 명확한 격차를 드러냈습니다. 연구에 참여한 14명의 의사가 동일한 기록을 읽었을 때, 추출된 정보에 대해 약 81%의 확률로 서로 일치하는 의견을 보였습니다. 이러한 높은 일치도는 의사들이 기록을 일관되게 해석하고 있음을 보여주었습니다. 그러나 컴퓨터 모델을 의사들과 비교했을-때, 일치도는 약 66%로 크게 떨어졌습니다. 즉, 기계들은 아직 동일한 텍스트에서 동일한 사실을 식별하는 데 있어 인간만큼 신뢰할 수 없었습니다. 연구는 수천억 개의 연결을 가진 거대 시스템부터 로컬 컴퓨터에서 실행될 수 있는 작은 모델에 이르기까지 다양한 크기의 모델을 테스트했습니다. 그 어떤 모델도 의료 전문가들이 보여준 일관성 수준에 도달하지 못했습니다.
성능은 추출되는 정보의 종류에 따라 차이를 보였습니다. 모델들은 명확하고 표준적인 방식으로 작성되는 경우가 많은 치료법과 검사 결과를 찾는 데는 꽤 능숙했습니다. 반면, 임상적 맥락에 대한 깊은 이해가 필요한 징후나 진단명에 대해서는 덜 성공적이었습니다. 흥lı로운 점은, 컴퓨터가 의사들보다 더 많은 정보를 찾아내는 경향이 있었다는 것인데, 특히 위험 요인(risk factors)에 관한 경우였습니다. 의사들은 흔el히 당면한 문제에 집중하는 반면, 모델들은 텍스트에 언급된 가능한 모든 위험 요인을 표시하는 듯했습니다. 이는 기계가 단순히 인간의 행동을 복사하는 것이 아니라 텍스트를 다르게 처리하고 있음을 시사하며, 때로는 인간이 간과할 수 있는 세부 사항을 포착하기도 하지만, 동시에 임상적으로 관련이 없는 것들까지도 표시할 가능성이 있음을 보여줍니다.
이러한 차이점에도 불구하고, 기계들은 올바르게 사용된다면 유용한 도구가 될 수 있음을 보여주었습니다. 연구에 따르면 모델이 특정 정보를 식별했을 때, 그 정보는 대개 정확했으며, 정밀도(precision rate)는 97%에 달했습니다. 이는 모델들이 텍ston에 없는 사실을 거의 지어내지 않는다는 것을 의미합니다. 그러나 약 15%의 경우에는 정보를 놓치기도 했습니다. 이러한 패턴은 이 도구들의 미래에 대한 구체적인 역할을 제시합니다: 이들은 기록을 빠르게 스캔하여 의사가 검토할 만한 후보들을 뽑아내는 '첫 번째 단계(first pass)'로서 가장 적합합니다. 최종 결정과 검증은 여전히 인간의 몫으로 남아야 합니다. 연구진은 이 모델들이 강력하긴 하지만, 아직 임상 현장에서 단독으로 작업할 준비는 되지 않았다고 결론지었습니다. 이들은 의료 데이터의 홍수를 정리하는 데 도움을 줄 수 있는 조수로서 보는 것이 가장 적절하며, 단, 항상 인간 전문가가 그들의 작업을 확인해야 한다는 전제가 필요합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.