Automated Identification of Complex Percutaneous Coronary Intervention from Cardiac Catheterization Reports Using Large Language Models
본 연구는 고성능 오픈 소스 대규모 언어 모델, 특히 Llama 3.3 70B가 자유 형식의 심혈관 조영술 보고서로부터 복잡한 경피적 관상동맥 중재술 절차를 정확하고 자동으로 식별하고 주요 변수를 추출할 수 있음을 입증하며, 이는 심혈관 연구를 위한 노동 집약적인 수동 추상화 작업을 대체할 수 있는 확장 가능한 대안을 제공한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
병원들은 매일 방대한 양의 비정형 텍스트를 생성합니다. 이 중 가장 중요한 문서 중 하나는 심장 도관 삽입술(의사가 혈관을 조사하기 위해 가느다란 관을 동맥을 통해 삽입하는 시술) 후에 작성되는 서술형 보고서입니다. 이 보고서들은 환자의 심장 해부학적 구조와 폐쇄된 혈관을 고치기 위해 사용된 구체적인 기술에 대한 상세한 정보를 담고 있지만, 깔끔한 체크박스 형태가 아닌 자유로운 문단 형태로 작성됩니다. 연구자와 품질 개선 팀에게 이는 상당한 병목 현상을 일으킵니다. 시술이 얼마나 잘 이루어졌는지 연구하거나 의료 시스템 전반에 걸친 사례의 복잡성을 추적하기 위해서는, 전문가들이 수천 개의 보고서를 일일이 읽고 특정 데이터 포인트를 추출해야 합니다. 이 과정은 느리고 비용이 많이 들며 규모를 키우기 어려워, 종종 중요한 의학 연구의 규모와 속도를 제한합니다.
인간처럼 텍스트를 이해하고 생성할 수 있는 인공지능의 한 종류인 대규모 언어 모델의 부상은 이 문제에 대한 잠재적인 해결책을 제시합니다. 이러한 시스템은 복잡한 문서를 읽고 특정 사실을 뽑아내도록 훈련될 수 있으며, 마치 매우 빠르고 지치지 않는 연구 보조원처럼 작동할 수 있습니다. 그러나 이러한 도구들이 특히 여러 개의 폐쇄 부위나 까다로운 기술이 포함된 '복잡한' 사례를 식별하도록 요청받았을 때, 미묘하고 전문적인 언어를 처리할 수 있는지 여부는 여전히 불분ci했습니다. 연구팀은 실제 심장 도관 삽사 보고서의 대규모 컬렉션을 사용하여 이 질문을 테스트하기 위해 연구를 시작했습니다.
연구진은 예일 뉴헤이븐 헬스 시스템 내 세 곳의 서로 다른 병원에서 가져온 1,412개의 익명화된 시술 노트를 수집했습니다. 이 문서들은 2011년부터 2017년 사이에 수행된 시술들을 다루고 있으며, 진단 검사와 의사가 스텐트를 배치하거나 풍선을 사용하여 막힌 동맥을 열어주는 실제 중재 시술이 포함된 기록이 혼합되어 있었습니다. 신뢰할 수 있는 비교 기준을 만들기 위해, 전문가 그룹이 모든 노트를 수 하나하나 수동으로 읽었습니다. 그들은 먼저 보고서가 실제로 관상동맥 치료를 위해 스텐트나 풍선을 사용한 시술을 설명하는지 결정했습니다. 치료가 이루어진 경우, 그들은 '복잡한' 시술을 정의하는 여섯 가지 구체적인 세부 사항을 추출했습니다: 치료된 혈관의 수, 해결된 별개의 폐쇄 부위 수, 배치된 총 스텐트 수, 분지 혈관에 대해 특정 이중 스텐트 기술이 사용되었는지 여부, 전체 스텐트의 총 길이, 그리고 만성 완전 폐쇄(완전히 오래되어 막힌 상태)가 치료되었는지 여부입니다.
이러한 인간 검증 기반의 '골드 스탠더드(gold standard)'를 바탕으로, 연구팀은 세 가지 서로 다른 인공지능 모델을 테스트하여 이들이 전문가의 작업을 재현할 수 있는지 확인했습니다. 연구진은 코드와 가중치가 공개되어 있어 환자의 개인정보 보호를 위해 보안이 철저한 로컬 컴퓨터에서 실행할 수 있는 오픈 소스 모델들을 선택했습니다. 한 모델은 추론 능력의 척도인 파라미터 수가 700억 개에 달하는 거대 범용 시스템이었습니다. 나머지 두 모델은 의학 용어를 이해하도록 설계된 각각 70억 개의 파라미터를 가진, 의학 문헌을 사전 학습한 더 작은 모델들이었습니다. 연구진은 동일한 텍 тек 프롬프트와 보고서를 세 모델 모두에 입력하여, 시술 발생 여부를 식별하고 여섯 가지 변수를 추출하도록 요청했습니다.
결과는 역량의 명확한 차이를 보여주었습니다. 거대 범용 모델은 두 개의 작은 의료 특화 모델보다 성능이 현저히 뛰어났습니다. 단순히 보고서가 심장 시술을 설명하는지 식별하라는 요청에 대해, 거대 모델은 완벽한 민감도(실제 시술을 놓치지 않는 능력)를 달성했으며, 비시술 노트를 정확하게 식별했습니다. 반면, 작은 모델들은 고전했습니다. 한 모델은 비시술 노트를 시술로 자주 오인했고, 다른 모델은 실제 시술을 거의 인식하지 못했습니다.
여섯 가지 복잡한 세부 사항을 추출하는 작업으로 넘어가자 격차는 더 벌어졌습니다. 거대 모델은 스텐트 수와 총 스텐트 길이를 매우 높은 정확도로 식별해냈으며, 종종 90%를 상회했습니다. 또한 치료된 혈관 수를 식별하는 데에도 좋은 성능을 보였습니다. 그러나 더 많은 해석을 요구하는 변수, 예를 들어 정확한 별개 폐쇄 부위의 수를 세거나 분지 혈관에 특정 이중 스텐트 기술이 사용되었는지 판단하는 작업에서는 성능이 떨어졌습니다. 이 경우 모델은 세부 사항을 놓치거나 맥락을 오해하기도 했지만, 여전히 작은 모델들보다는 훨씬 더 정확했습니다. 의료 특화 학습을 거친 작은 모델들은 전문적인 훈련에도 불구하고 이러한 세부 사항을 일관되게 추출하는 데 실패했으며, 결과적으로 연구용으로 쓰기에는 너무 신뢰할 수 없는 결과를 냈습니다.
연구는 또한 모델들이 세 곳의 병원 사이트에서 어떻게 다르게 수행되는지를 조사했습니다. 거대 모델은 세 곳 모두에서 높은 정확도를 유지했지만, 각 병원의 의사들이 노트를 작성하는 방식의 차이로 인해 위치별로 눈에 띄는 성능 변화가 있었습니다. 작은 모델들은 더욱 큰 불일치를 보였으며, 위치에 따라 성능이 크게 요동쳤습니다. 이는 거대 모델이 견고하긴 하지만, 정보가 기록되는 방식이 여전히 결과에 영향을 미칠 수 있음을 시사합니다.
연구진은 가장 우수한 성능을 보인 모델의 오류를 분석하여 모델이 어디에서 어려움을 겪는지 파악했습니다. 오류는 주로 문서가 모호하거나 단편적일 때 발생했습니다. 예를 들어, 모델은 때때로 진단 테스트와 치료를 혼동하거나, 성공적으로 배치된 스텐트와 배치를 시도했으나 배치되지 않은 스텐트를 구분하는 데 어려움을 겪었습니다. 또한 보고서에 치료되지 않은 폐쇄 부위가 언급되었거나, 만성 완전 폐쇄가 명시적으로 기술되지 않고 암시적으로만 언급된 경우에도 어려움을 겪었습니다. 이러한 오류들은 이 기술이 강력하긴 하지만, 인간의 무질서하고 일관성 없는 의학적 글쓰기의 현실을 헤쳐 나가기에는 아직 완벽하지 않다는 점을 강조합니다.
궁극적으로, 이 연구는 거대 오픈 소스 인공지능 모델이 전통적으로 수 시간의 수동 노동을 필요로 했던 비정형 심장 시술 보고서에서 복잡한 데이터를 정확하게 추출할 수 있음을 입증합니다. 연구 결과는 스텐트 수와 같이 명시적으로 기술된 변수의 경우, 이러한 도구들이 연구에 적합한 수준의 정확도를 달 수 있음을 시사합니다. 그러나 깊은 맥락적 해석을 요구하는 변수에 대해서는 여전히 과제가 남아 있습니다. 이 연구는 향-심혈관 연구의 확장 가능한 미래가 더 작은 전문 모델이나 수동 검토에만 의존하는 것이 아니라, 이러한 강력한 모델을 사용하여 데이터 추출의 대부분을 처리하고, 가장 어려운 사례에 대해서는 인간의 감독을 결합하는 방식에 있을 수 있음을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.