← 최신 논문
💬 NLP

MedUPS: Towards Diagnostic Assistance in Uncommon Medical Cases with Large Language Models

이 논문은 강화 학습을 사용하여 대규모 언어 모델이 중간 임상 결정을 예측하도록 훈련함으로써 희귀 의료 사례에 대한 진단 보조를 개선하고, 이를 통해 기본 모델 및 더 큰 프런티어 모델보다 다음 단계 정확도에서 더 우수한 성능을 보이는 정렬 프레임워크 및 그에 상응하는 데이터셋(MedUPSQA)인 MedUPS를 소개한다.

원저자: Ofir Ben Shoham, Oriel Perets, Nir Grinberg, Nadav Rappoport

게시일 2026-08-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ofir Ben Shoham, Oriel Perets, Nir Grinberg, Nadav Rappoport

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 규모의 복잡한 미스터리를 풀려고 노력하고 있다고 상상해 보십시오. 하지만 정답을 은반지에 담겨 전달받는 대신, 단서 하나하나를 모아 직접 조각을 맞춰나가야 합니다. 이것이 바로 의사들이 현실 세계에서 일하는 방식과 정확히 일치합니다. 의사들은 환자의 전체 병력, 모든 검사 결과, 그리고 최종 진단이 깔끔하게 포장된 상태로 전달받지 않습니다. 대신, 환자가 어떤 증상을 가지고 내원하면, 의사는 검사를 처방하고, 결과를 얻은 뒤, 다음과 같은 결정을 내려야 합니다. 다음에 무엇을 할 것인가? MRI를 찍을 것인가? 전문의에게 연락할 것인가? 아니면 다른 약을 시도해 볼 것인가? 이 과정은 "다음 단계"를 찾아가는 여정이며, 모든 결정은 부분적인 정보만을 가진 채 이루어지며, 앞으로 나아갈 길은 종종 안개 속에 가려져 있습니다.

인공지능의 세계에는 인간처럼 읽고 쓸 수 있는 초지능형 컴퓨터 뇌인 "대규모 언어 모델(LLM)"이 존재합니다. 과학자들은 이 AI가 의사처럼 행동하도록 훈련시켜 왔지만, 우리가 사용하는 대부분의 평가 방식은 고득점이 필요한 기말고사와 같습니다. AI에게 모든 단서가 포함된 전체 이야기를 제공하고 최종 진단을 맞히라고 요구하는 식입니다. 이는 AI가 정답을 알고 있는지 확인하는 데는 좋지만, 이야기가 전개되는 도중에 AI가 의사처럼 '생각'할 수 있는지는 알려주지 않습니다. 이는 마치 탐정에게 사건을 해결했는지로만 성적을 매기는 것과 같습니다. 그 과정에서 증거를 수집하는 동안 올바른 선택을 했는지는 확인하지 않은 채 말입니다. MedUPS라는 제목의 이 논문은 핵심적인 질문을 던집니다. 우리는 이 AI "의사"들에게 결말을 알지 못하는 상황에서도, 미스터리가 진행되는 중간에 올바른 "다음 수"를 두는 법을 가르칠 수 있을까?

새로운 게임 플랜: 달리기 전에 걷는 법 배우기

MedUPS의 연구진은 희귀하고 까다로운 사례를 돕는 의사들을 지원하기 위해서는, 의료 사례를 정적인 시험 문제처럼 다루는 것을 멈추고 시간이 흐름에 따라 펼쳐지는 하나의 이야기로 다루어야 한다는 점을 깨달았습니다. 그들은 MedUPS라고 불리는 새로운 훈련 시스템을 구축했는데, 이는 목표가 결승선으로 바로 뛰어드는 것이 아니라 매 단계마다 최선의 수를 두는 AI용 비디오 게임과 같습니다.

이를 위해 그들은 Med-UPSQA라는 거대한 라이브러리를 만들었습니다. 그들은 5,500개가 넘는 실제 의료 사례 보고서(희귀 질환을 가진 환자들의 이야기)를 가져와 시간 순서에 따라 "덩어리(chunks)"로 나누었습니다. 영화 필름을 개별 프레임으로 자르는 것을 상상해 보십시오. 모든 프레임마다 그들은 AI에게 묻습니다. "지금까지 본 것을 바탕으로, 가장 논리적인 다음 단계는 무엇인가?" 답변은 최종 진단이 아니라, "혈액 검사 실시"나 "심장 전문의에게 의뢰"와 같은 구체적인 행동이었습니다. 그들은 21,000개가 넘는 이러한 "다음 단계" 결정 지점들을 생성해 냈습니다.

이들이 사용한 영리한 방법은 AI를 가르치는 방식입니다. 단순히 정답을 보여주고 "이것을 암기하라"고 말하는 방식(이를 지도 미세 조정이라 합니다) 대신, 그들은 **강화 학습(Reinforcement Learning)**이라는 방법을 사용했습니다. 이것은 AI 플레이어 옆에 서 있는 코치를 생각하면 됩니다. AI가 다음 단계에 대한 추측을 하면, 코치(판사 역할을 하는 외부 AI)가 그 추측이 얼마나 좋았는지에 따라 점수를 부여합니다. AI가 똑똑한 수를 두면 보상을 받고, 잘못된 수를 두면 벌점을 받습니다. 수천 번의 시도를 통해, AI는 최종 진단을 미리 알지 못한 채로도 논리적인 다음 단계를 예측하며 안개 낀 의료 사례의 경로를 헤쳐 나가는 법을 배웁니다.

발견한 사실: 작은 뇌, 큰 움직임

결과는 놀랍고도 흥미로웠습니다. 연구팀은 80억 개의 파라미터(매개변수) 규모의 작은 모델부터 270억 개의 파라미터를 가진 큰 모델에 이르기까지 세 가지 서로 다른 AI 모델을 대상으로 새로운 훈련법을 테스트했습니다. 그들은 AI에게 "다음 단계"에 집중하도록 가르치는 것이 엄청난 차이를 만든다는 것을 발견했습니다.

테스트한 가장 큰 모델인 Qwen3.6-27B(270억 파라미터 AI)의 경우, 올바른 다음 단계를 예측하는 정확도가 **55.2%**에서 **66.7%**로 급증했습니다. 이는 엄청난 향상입니다. 더욱 흥-미로운 점은, 더 작은 모델들도 시작 지점 대비 비슷하거나 혹은 더 많이 개선되었다는 것입니다. 90억 파라미터 모델은 **47.2%**에서 **57.8%**로, 80억 파라미터 의료 모델은 **37.8%**에서 **44.4%**로 향상되었습니다.

여기에는 일반적인 AI의 규칙에 도전하는 반전이 있습니다. 규모가 크다고 해서 항상 더 좋은 것은 아닙니다. 의료적 의사결정을 내리는 이 특정 과업에서, 잘 훈련된 작은 AI가 보통 세계에서 가장 똑똑하다고 여겨지는 거대한 "프런티어" 모델들보다 실제로 더 나은 성능을 보였습니다. 연구진은 그들의 새로운 방식으로 훈련된 270억 파라미터 모델이 훨씬 더 큰 규모의 폐쇄형 모델들을 능가할 수 있다는 것을 발견했습니다. 이는 복잡한 실제 의료 추론을 위해서는 (목적지가 아닌) 여정에 집중하는 방식의 훈련이 단순히 AI의 크기를 키우는 것보다 더 중요할 수 있음을 시사합니다.

주의사항: 마법의 지팡이는 아니다

결과는 유망하지만, 저자들은 자신들이 의료 진단을 "해결했다"고 주장하는 데 신중합니다. 그들은 자신들의 시스템이 답변을 채점하기 위해 AI "판사"에 의존하고 있으며, 공정성을 확보하기 위해 다양한 판사로 테스트를 거쳤지만, 점수가 어떤 판사가 채점하느냐에 따라 달라질 가능성이 여전히 존재한다고 지적합니다. 또한, 이들은 이것이 "최종 치료"가 아니라 "다음 단계"의 예측임을 강조합니다. AI는 의사를 대체하는 것이 아니라, 다음 검사나 전문의를 제안하는 법을 배우는 것입니다.

더 나아가, 그들이 AI의 실수를 면밀히 조사했을 때, 많은 "오류"가 실제로 잘못된 추론 때문은 아니라는 것을 발견했습니다. 때때로 AI는 완벽하게 논리적인 단계를 제안했지만, 사례 보고서 속의 실제 의사는 약간 다른 행동을 했습니다. 이는 무질서한 현실 세계에서는 항상 단 하나의 "정답"만 존재하는 것이 아니며, AI가 그 회색 지대를 항해하는 법을 배우고 있음을 보여줍니다.

이것이 중요한 이유

MedUPS의 핵심적인 교훈은 우리가 훌륭한 의료 지원을 얻기 위해 무한히 거대한 AI 모델을 구축할 필요가 없을지도 모른다는 점입니다. 대신, 우리는 인간이 하는 방식대로, 즉 단계별로 생각하고, 불확실성을 다루며, 현재 가진 정보를 바탕으로 최선의 결정을 내리는 법을 가르치면 될 수도 있습니다. 환자의 여정 중 "중간 단계(mid-stream)"에 집중함으로써, 이 접근 방식은 정적인 시험을 역동적이고 도움이 되는 대화로 바꾸어, 가장 어렵고 희귀한 사례에 직면한 의사들을 실제로 도울 수 있는 AI 도구를 만드는 새로운 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →