← 최신 논문
💻 computer science

Improving Rare Medication Recommendation with Counterfactual Data Augmentation and Large Language Models

이 논문은 대규모 언어 모델을 활용하여 반사실적 의료 데이터를 생성하고 공동 권장 약물 관계를 모델링함으로써, 기존 베이스라인 모델들과 비교하여 희귀 약물 추천의 예측 성능을 크게 향상시키는 새로운 프레임워크인 GenRxR을 소개한다.

원저자: Shinhwan Kang, Soo Yong Lee, Jaewon Kim, Kijung Shin, Buru Chang

게시일 2026-07-29
📖 6 분 읽기🧠 심층 분석

원저자: Shinhwan Kang, Soo Yong Lee, Jaewon Kim, Kijung Shin, Buru Chang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

초지능형 로봇 의사가 실제 의사들이 환자에게 어떤 약을 처방할지 결정하는 데 도움을 주는 세상을 상상해 보세요. 이것은 공상 과학 소설이 아닙니다. 'AI 기반 약물 추천'이라 불리는 성장하는 분야입니다. 이 시스템들은 환자의 과거 병력(과거의 질병, 수술, 이전에 복용했던 약물 등)을 살펴보고 가장 적합한 새로운 약물을 추측합니다. 마치 당신의 입맛과 알레르기를 당신 자신보다 더 잘 아는 매우 고급 레시피 앱과 같습니다. 하지만 여기에는 함정이 있습니다. 소금이나 설탕 같은 흔한 재료로만 요리하는 요리사처럼, 이 AI 로봇들은 '희귀한' 재료를 다루는 데 어려움을 겪습니다. 의료계에서 이들은 매우 드물게 사람들에게 투여되는 약물로, 종종 아주 특이하거나 심각한 질환을 위해 사용됩니다. AI는 학습 데이터에서 이러한 희귀 약물을 거의 본 적이 없기 때문에, 이를 완전히 무시하는 경 경향이 있으며 이는 약이 절실히 필요한 환자들에게 위험할 수 있습니다.

이것이 바로 KAIST와 고려대학교 연구진이 새로운 논문에서 다룬 문제입니다. 그들은 AI가 흔한 약물을 제안하는 데는 뛰어나지만, 희귀한 약물을 제안할 때는 처참하게 실패한다는 점에 주목했습니다. 이를 해결하기 위해 그들은 GenRxR이라는 새로운 시스템을 구축했습니다. 단순히 더 많은 실제 데이터를 기다리는 대신(개인정보 보호 규칙 때문에 현실적으로 어렵습니다), 그들은 이야기 쓰기나 대화가 가능한 것과 같은 종류의 초지능형 AI인 거대언어모델(LLM)을 이용한 '시간 여행' 기술을 사용했습니다. 그들은 AI에게 "만약"의 시나리오를 상상하도록 요청했습니다: "만약 이 환자가 이 희귀한 약을 처방받았다면? 그들의 이야기는 어떻게 변했을까?" 이렇게 생성된 가상의, 하지만 의학적으로 논리적인 이야기들을 통해 그들은 AI가 학습할 수 있는 거대한 새로운 예시 라이브러리를 만들었습니다. 또한 그들은 오케스트라의 지휘자가 모든 악기가 조화롭게 연주되도록 보장하는 것처럼, 서로 다른 약물들이 어떻게 함께 작용하는지에 대해 AI가 더 주의를 기울이도록 가르쳤습니다.

그 결과는 어땠을까요? 그들의 새로운 시스템인 GenRxR은 까다로운 희귀 약물들을 훨씬 더 잘 맞히는 예측가가 되었습니다. 테스트에서 이 시스템은 단순히 괜찮은 수준을 넘어 경쟁자들을 압도했습니다. GenRxR은 유사한 빅브레인 모델을 사용하는 다른 14개의 방법(다른 AI 시스템 포함)을 능가했습니다. 가장 인상적인 점은, 다른 시스템들이 완전히 놓치기 일쑤였던 희귀 약물에 대해 GenRxR은 예측 정확도를 최대 **30.9%**까지 향상시켰다는 것입니다. 그들은 단순히 추측한 것이 아니라, "만약"의 이야기와 AI에게 의사처럼 추론하도록 가르치는 방식을 통해 희귀한 질환을 가진 사람들에게도 더 안전하고 정확한 약물 추천을 할 수 있음을 수치로 증명해 냈습니다.

문제점: AI의 '상식' 편향

당신이 비디오 게임을 배우려고 하는데, 첫 번째 레벨만 백만 번 플레이할 수 있다고 상상해 보세요. 당신은 그 레벨의 달인이 되겠지만, 누군가 갑자기 아주 드물게 등장하는 숨겨진 보스 레벨을 플레이하라고 한다면 당신은 어떻게 해야 할지 전혀 모를 것입니다. 이것이 현재의 AI 약물 시스템에서 일어나는 일입니다.

연구진은 이러한 시스템들이 '롱테일(long-tail)' 문제를 겪고 있다는 것을 발견했습니다. 현실 세계에서는 몇몇 약물은 끊임없이 처방되는 반면(흔한 약물), 수천 개의 다른 약물은 매우 드물게 처방됩니다(희귀 약물). AI는 역사적인 병원 기록으로부터 학습하기 때문에 흔한 약물들을 반복해서 보게 됩니다. 그래서 흔한 약물에는 매우 능숙해집니다. 하지만 희귀한 약물은 어떤가요? 그것들은 데이터 속의 유령과 같습니다. 사례가 너무 적어서 AI는 기본적으로 그것들의 존재를 잊어버립니다.

이것은 단순한 작은 오류가 아닙니다. 이러한 희귀 약물 중 상당수는 매우 구체적이고 심각하거나 흔하지 않은 질환을 치료하기 위해 설계된 '희귀 의약품(orphan drugs)'입니다. 만약 AI가 이를 무시한다면, 치료가 필요한 환자는 치료 계획을 받지 못한 채 남겨질 수 있습니다. 또한 연구진은 기존 AI 시스템들이 약물들이 서로 어떻게 '함께' 작용하는지를 이해하는 데 자주 실패한다는 점을 발견했습니다. 희귀한 약물을 처방한다는 것은 대개 다른 치료법들과 결합된 특정 '칵테일'의 일부라는 것을 의미합니다. 만약 AI가 이러한 약물 간의 관계를 이해하지 못한다면, 안전한 권고를 내릴 수 없습니다.

해결책: "만약" 이야기를 통한 시간 여행

이를 해결하기 위해 연구팀은 두 가지 영리한 방식으로 LLM을 사용하는 프레임워크인 GenRxR을 만들었습니다.

1. "만약" 머신 (인과적 데이터 증강 - Counterfactual Data Augmentation)
첫 번째 큰 장애물은 데이터의 부족이었습니다. 세상에 페라리가 단 한 대뿐이라면 학생에게 운전을 가르칠 수 없습니다. 그래서 연구진은 LLM을 사용하여 더 많은 페라리를 만들었습니다. 그들은 단순히 무작위 숫자를 만들어낸 것이 아니라, AI의 의학적 지식을 활용하여 '인과적(counterfactual)' 이야기를 작성했습니다.

작동 방식은 다음과 같습니다:

  • 연구팀은 특정 희귀 약물을 처방받지 않은 실제 병원 기록 속의 환자를 선택합니다.
  • 그리고 LLM에게 묻습니다: "만약 이 환자가 이 희귀한 약을 처방받았다면 어땠을까? 그것이 논리적으로 성립하려면 그들의 의학적 기록에 어떤 변화가 있어야 할까?"
  • LLM은 의학 학위를 가진 창의적인 작가처럼 행동합니다. 예를 들어, "알겠습니다. 만약 그가 이 희귀한 약을 복용했다면, 아마도 특정 유형의 감염을 앓았거나, 특정 수술을 받았거나, 다른 보조 약물들을 복용하고 있었을 것입니다"라고 답할 수 있습니다.
  • 그런 다음 AI는 이 희귀 약물과 그에 따른 논리적인 변화들을 포함하는 완전히 새로운 합성 환자 기록을 생성합니다.

이것은 AI에게 희귀 약물이 사용되었던 평행 세계를 방문할 수 있는 타임머신을 주는 것과 같습니다. 이 수천 개의 새롭고 현실적인 "만약" 이야기들을 통해 학습함으로써, AI는 마침내 희귀 약물이 어떤 모습인지, 그리고 언제 사용해야 하는지를 배우게 됩니다.

2. "팀 플레이어" (지시어 튜닝 - Instruction Tuning)
두 번째 퍼즐 조각은 AI가 '맥락'을 이해하도록 만드는 것이었습니다. 희귀한 약물은 단독 공연을 하는 경우가 드뭅니다. 그것은 팀의 일원으로서 존재합니다. AI가 이를 이해하도록 돕기 위해 연구진은 지시어 튜닝(instruction tuning) 기법을 사용했습니다.

그들은 LLM이 환자의 상태와 필요한 약물 사이의 연결 고리를 강조하며 의료 기록을 요약하도록 가르쳤습니다. 그들은 AI에게 임상 추론 전문가처럼 행동하라는 구체적인 지침을 주었습니다. 단순히 약물 목록을 보는 대신, AI는 전체적인 그림을 보도록 배웠습니다: "이 환자는 이러한 증상이 있으므로, 이 특정 약물 조합이 타당하다." 이 단계는 AI가 희귀한 약물을 추천할 때 단순히 추측하는 것이 아니라, 인간 의사처럼 임상적 맥락을 통해 추론하도록 보장합니다.

결과: 거대한 도약

연구팀은 GenRxR을 LLM을 사용하는 다른 5개의 시스템을 포함한 14개의 다른 방법들과 비교 테스트했습니다. 결과는 명확했습니다. GenRxR이 챔피언이었습니다.

  • 전반적인 성능: 적절한 약물을 예측하는 데 있어 거의 모든 다른 방법을 이겼습니다.
  • 희귀 약물의 메달: 가장 흥미로운 발견은 희귀 약물에 관한 것이었습니다. 다른 시스템들이 적절한 희귀 약물을 맞히는 데 어려움을 겪는 동안, GenRxR은 가장 강력한 베이스라인 모델과 비교하여 성능을 최대 **30.9%**까지 향상시켰습니다.
  • 안전 우선: 결정적으로, 희귀 약물을 더 잘 맞히게 되었다고 해서 흔한 약물을 추천하는 능력이 저하되지는 않았습니다. 즉, 기초적인 부분에서도 실력을 잃지 않으면서 더 전천후로 뛰어난 의사가 된 것입니다.

연구진은 단순히 이 방식이 작동한다고 주장하는 데 그치지 않고, 실제 병원 데이터(MIMIC-III 및 MIMIC-IV 데이터셋)를 사용하여 이를 측정했습니다. 그들은 "만 if" 이야기를 통해 공백을 메우고 임상적 맥락을 통해 추론하도록 가르침으로써, 의료 AI의 주요 사각지대를 해결할 수 있음을 보여주었습니다.

이것이 왜 중요한가

이 논문은 의료의 모든 문제를 해결했다고 주장하는 것이 아니라, 강력한 새로운 도구를 제시하고 있습니다. 우리는 AI를 훈련시키기 위해 항상 더 많은 실제 데이터가 필요한 것은 아니며, 때로는 우리가 가진 데이터를 얼마나 똑똑하게 사용하느냐가 중요하다는 것을 보여줍니다. AI가 "만약"의 시나리오를 상상하게 함으로써, 우리는 현실 세계에서 발생하는 희귀하고 어려운 사례들에 대비할 수 있습니다. 희귀 질환을 가진 환자들에게 이것은, AI 의사가 감기 같은 흔한 질병뿐만 아니라 그들에게도 똑같이 준비되어 있는 미래를 의미합니다. 그들이 생성한 코드와 데이터는 이제 다른 이들이 사용할 수 있도록 공개되어 있으며, 이 "만 if" 접근 방식을 바탕으로 모두를 위한 더 안전한 의료 서비스를 구축할 수 있도록 커뮤니티 전체를 초대하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →