← 최신 논문
💻 computer science

A Multi-Criteria Decision Framework for Aggregating Ranked ICD-10 Code Suggestions from Large Language Models

본 연구는 다중 기준 의사결정 분석 순위 집계 방법, 특히 보르다 카운트(Borda Count)와 역순위 융합(Reciprocal Rank Fusion)을 적용하여 여러 거대 언어 모델의 출력을 결합하는 것이 개별 모델이나 단순 투표 방식에 비해 자동 ICD-10 임상 코딩의 정확도와 안정성을 유의미하게 향상시킨다는 것을 입증한다.

원저자: Ricardo da Silva Santos, Murilo Gleysson Gazzola, Paulo Marcelino Figueira, Adriana Gomes Luz, Rodolfo de Carvalho Pacagnella, Cristiano Torezzan

게시일 2026-08-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ricardo da Silva Santos, Murilo Gleysson Gazzola, Paulo Marcelino Figueira, Adriana Gomes Luz, Rodolfo de Carvalho Pacagnella, Cristiano Torezzan

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 의료 진단이라는 조각들로 이루어진 거대하고 지저치 않은 퍼즐을 풀려고 노력하고 있다고 상상해 보십시오. 의료계에서 모든 환자의 이야기는 병원이 질병을 추적하고 비용을 지불받을 수 있도록 ICD-10이라 불리는 비밀 언어와 같은 특정 코드로 번역되어야 합니다. 하지만 이 언어는 방대하고 복잡하며 까다로운 규칙들로 가득 차 있습니다. 최근에는 대규모 언어 모델(LLM)이라 불리는 초지능형 컴퓨터 프로그램들이 의사의 진료 기록을 읽고 이 코드들을 추측하는 법을 배웠습니다. 이 모델들을 각각 조금씩 다른 특성을 가진 똑똑한 탐정 팀이라고 생각해 보십시오. 각 탐정은 동일한 사건 파일을 조사하고, "가장 가능성 높은 것"부터 "가장 낮은 것"까지 순위를 매긴 용의자(코드) 목록을 제시합니다. 문제는 때때로 탐정 A는 용의자 X가 범인이라고 생각하는 반면, 탐정 B는 용의자 Y가 범인이라고 확신할 수 있다는 점입니다. 만약 단 한 명의 탐정 말만 듣는다면 틀릴 수도 있습니다. 여기서 다기준 의사결정 분석(Multi-Criteria Decision Analysis)이라는 분야가 등장합니다. 이것은 기본적으로 여러 가지 다양한 의견을 결합하여 단 하나의 최선의 답을 찾아내는 기술으로, 마치 배심원단이 증언들을 종합하여 평결에 도달하는 것과 같습니다. 그렇다면 질문은 이것입니다: 어떻게 하면 이 용의자 목록들을 조합하여 최종 그룹이 단일 탐정 혼자보다 더 똑똑하게 만들 수 있을까요?

이 논문은 각 AI 모델을 의료 코드를 위한 거대한 선거의 개별적인 "투표자"로 취급함으로써 바로 그 질문을 다룹니다. 연구진은 1,117개의 실제 브라질 포르투갈어 산과 관련 의료 기록을 가져와 다섯 가지 서로 다른 강력한 AI 모델에게 각 기록에 대한 가능한 코드의 순위 목록을 생성하도록 요청했습니다. 단 하나의 모델에서 승자를 뽑는 대신, 그들은 이 모든 목록을 하나의 "합의된" 목록으로 결합하는 세 가지 다른 방법을 테스트했습니다. 그들은 단순히 가장 많은 목록의 맨 윗부분에 등장한 코드가 승리하는 "다수결 투표(Plurality Voting)"라는 단순한 방법, 코드가 단지 1위일 때뿐만 아니라 모든 목록에서 얼마나 높게 나타나는지에 따라 점수를 부여하는 더 상세한 방법인 "보르다 카운트(Borda Count)", 그리고 상위권에 등장한 코드에는 큰 가중치를 주되 하위권에 있는 코드도 여전히 고려하는 "역순위 결합(Reciprocal Rank Fusion)"을 실험했습니다.

결과는 매우 명확했으며 그 단순함에 있어 놀라웠습니다. 연구진은 모델들을 결합하는 것이 단일 최고의 모델 하나를 신뢰하는 것보다 거의 항상 더 효과적이라는 것을 발견했습니다. 구체적으로, "보르다 카운트" 방식이 주인공이었습니다. 연구진이 정확도와 범위(coverage) 사이의 균형을 맞추기 위한 최적의 지점이라고 판단한 상위 3개 제안을 기준으로 보았을 때, 보르다 카운트 방식은 광범위한 범주 수준에서 약 20%, 특정 코드 수준에서 거의 19%의 정확도를 단일 최고의 개별 AI와 비교하여 향상시켰습니다. 이는 모든 모델의 전체 순위를 존중하며 코드가 어디에 위치하는지에 주목하는 것이 단일 전문가에 의존하는 것보다 훨씬 더 신뢰할 수 있는 결정을 만들어낸다는 것을 시사합니다.

하지만 이 논문은 몇 가지 사항을 배제하기도 했습니다. 연구진은 단순히 1위만을 세는 가장 단순한 방법인 "다수결 투표"가 전체 순위를 고려하는 더 미묘한 방법들만큼 효과적이지 않다는 것을 발견했습니다. 또한 제안하는 코드를 무한히 계속 추가할 수는 없다는 점도 보여주었습니다. 제안을 더 많이 추가하면 더 많은 진단을 잡아낼 수는 있지만(재현율), 결국 너무 많은 오답을 포함하게 되어 정확도(정밀도)를 떨어뜨리게 됩니다. 연구는 "황금 숫자"가 3이라고 제안합니다. 3개를 넘어가는 순간 결정의 품질이 저하되기 시작합니다. 나아가 저자들은 가장 "강력한" 모델에 더 많은 가중치를 주는 것이 별로 도움이 되지 않는다는 점을 언급했습니다. 모든 모델을 가중치 없이 단순하게 결합하는 것이 복잡한 가중치를 둔 방식만큼이나 좋았습니다.

요약하자면, 이 논문은 임상 코딩을 위한 최선의 전략은 단 하나의 완벽한 AI 모델을 찾는 것이 아니라, 그들의 전체 순위를 존중하는 시스템을 사용하여 몇몇 서로 다른 모델이 투표하게 하는 것이라고 제안합니다. 이 접근 방식은 모델을 재학습시키거나 그들의 "블랙박스" 내부를 들여다볼 필요 없이 의료 의사결정의 질을 높일 수 있는 실용적이고 견고한 방법을 제공합니다. 이 연구 결과는 실제 데이터와 신뢰 구간을 포함한 통계적 검증을 바탕으로 하고 있으며, 이 방법이 의료 코딩의 복잡한 현실을 다루는 안정적이고 효과적인 방법임을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →