← 최신 논문
🤖 machine learning

Revealing Treatment Non-Adherence Bias in Clinical Machine Learning Using Large Language Models

이 연구는 대규모 언어 모델을 사용하여 임상 노트를 분석한 결과 고혈압 환자의 21.7%에서 확인된 치료 불이행이 인과 추론을 왜곡하고, 모델의 성능을 저하시키며, 임상 머신러닝 시스템의 건강 불평등을 심화시키는 상당한 편향을 초래한다는 것을 입증한다.

원저자: Zhongyuan Liang, Arvind Suresh, Irene Y. Chen

게시일 2026-07-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhongyuan Liang, Arvind Suresh, Irene Y. Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 자동차를 안전하게 운전하는 법을 가르치려 한다고 상상해 보십시오. 당신은 과거의 방대한 운전 기록(로그) 라이브러리를 로봇에게 제공합니다. 로그에는 다음과 같이 적혀 있습니다. "신호등이 빨간불로 바뀌었을 때, 운전자는 브레이크를 밟았고, 차는 멈췄다."

로봇은 단순한 규칙을 학습합니다: 빨간불 = 브레이크 = 정지. 로봇은 운전자가 빨간불을 볼 때마다 실제로 브레이크를 밟았다고 가정합니다.

하지만 여기에 문제가 있습니다. 현실 세계에서는 어떤 운전자들은 빨간불을 보고도 "서둘러야 해"라고 생각하며 그냥 지나쳐 버립니다. 로그북에는 항상 "운전자가 신호를 무시했다"라고 적혀 있지는 않습니다. 그저 "운전자가 빨간불을 보았다"라고만 적혀 있을 뿐입니다.

만약 당신의 로봇이 누가 실제로 멈췄고 누가 멈추지 않았는지 모른다면, 로봇은 잘못된 규칙을 배우게 됩니다. 로봇은 브레이크가 완벽하게 작동한다고 생각하겠지만, 실제로는 멈춘 사람과 멈추지 않은 사람이 뒤섞인 데이터를 통해 배우고 있는 것입니다. 이는 미래의 교통 상황에 대한 로봇의 예측을 위험하고 부정확하게 만듭니다.

이 논문은 바로 이 문제를 해결하는 것에 관한 것입니다: 의료 분야의 머신러닝에서 말이죠.

현실 세계의 문제: "침묵하는" 불이행

의사들은 컴퓨터 프로그램(머신러닝)을 사용하여 환자, 특히 고혈압 환자에게 어떤 치료를 할지 결정합니다. 이 프로그램들은 전자 건강 기록(EHR)—기본적으로 환자의 디지털 일기—을 살펴봅니다.

컴퓨터는 다음과 같이 가정합니다: "의사가 '약물 X를 처방함'이라고 기록했다면, 환자는 약물 X를 복용했다."

하지만 환자는 인간입니다. 때때로 약 먹는 것을 잊어버리기도 하고, 약 때문에 어지러움을 느끼기도 하며, 때로는 약을 다시 처방받을 형편이 안 되기도 합니다. 환자는 약 복용을 중단하지만, 컴퓨터는 그것을 알지 못합니다. 컴퓨터는 그저 파일에 있는 '처방 기록'만을 볼 뿐입니다.

논문의 저자들은 이를 **"치료 불이행 편향(Treatment Non-Adherence Bias)"**이라고 부릅니다. 이는 마치 로봇이 운전자가 브레이크를 밟았다고 생각하지만, 실제로는 밟지 않은 것과 같습니다.

거짓말을 잡아낸 방법: 슈퍼 리더(Super-Reader)

오랫동안 연구자들은 환자에게 직접 "약을 드셨나요?"라고 물어야 했습니다. 하지만 사람들은 종종 사실대로 말하지 않거나 기억하지 못합니다.

이 연구에서 연구진은 **대규모 언어 모델(LLM)**을 사용했습니다. 이 LLM을 아주 똑똑하고 지치지 않는 독서 조수라고 생각하십시오. 그들은 수천 페이지에 달하는 난잡하고 손글씨 스타일인 의사들의 노트를 LLM에 입력했습니다.

컴퓨터 데이터베이스는 단순히 "처방: 리시노프릴(Lisinopril)"이라고 인식했지만, LLM은 의사의 노트를 읽고 다음과 같은 숨겨진 단서들을 찾아냈습니다:

  • "환자가 어지러움 때문에 복용을 중단했다고 말함."
  • "환자가 약 재처방을 받는 것을 잊어버림."
  • "환자의 약이 떨어짐."

이 "슈퍼 리더"를 사용하여 연구진은 3,623명의 환자를 분석했습니다. 그 결과 **786명(약 22%)**이 컴퓨터 기록상으로는 처방대로 약을 복용하고 있는 것처럼 보였지만, 실제로는 복용하고 있지 않다는 사실을 발견했습니다.

발견한 내용

"정직한" 환자와 "불이행" 환자를 분리하자, 흥미로운 패턴이 나타났습니다.

  • 누가 약을 거를 가능성이 높은가? 젊은 환자와 흑인 환자들이 약을 제대로 복용하지 않을 가능성이 더 높았습니다.
  • 왜 그런가? LLM은 노트를 읽고 이유들을 분류했습니다. 가장 큰 이유는 무엇이었을까요? 바로 부작용(어지러움이나 두통 등)이었습니다. 두 번째로 큰 이유는 망각이었습니다. 그 외에도 약을 다시 처방받는 데 어려움이 있거나 약을 잃어버렸다는 내용 등이 언급되었습니다.

위험성: 이것이 왜 컴퓨터를 망가뜨리는가

이 논문의 가장 중요한 부분은 이 문제를 무시했을 때 어떤 일이 발생하는가입니다. 연구진은 두 가지를 테스트했습니다.

  1. 인과 추론 (무엇이 효과적인지 파악하기):
    그들은 특정 약물이 얼마나 효과적인지 계산하려고 시도했습니다.

    • 실수: "불이행" 환자들(약을 먹지 않은 사람들)을 "치료군(약물을 복용하는 그룹)"에 포함했을 때, 컴퓨터는 혼란에 빠졌습니다. 컴퓨터는 약을 먹지 않은 사람들이 상태가 호전되지 않자, 약이 효과가 없다고 판단했습니다.
    • 결과: 어떤 경우에는 이 편향이 너무 강력해서 결론을 뒤집어 놓았습니다. 컴퓨터는 실제로 도움이 되는 약을 오히려 해로운 것으로 판단하거나, 그 반대의 경우를 만들어냈습니다.
  2. 예측 모델 (미래 예측하기):
    그들은 환자의 결과를 예측하는 모델을 구축했습니다.

    • 실수: "더러운(dirty)" 데이터(환자가 약을 먹었다고 컴퓨터는 믿지만 실제로는 먹지 않은 데이터)를 모델에 입력하자, 모델의 정확도가 5% 하락했습니다.
    • 결과: 이것이 별것 아닌 것처럼 들릴 수도 있지만, 의학에서 5%의 정확도 하락은 도움이 가장 필요한 사람들을 놓칠 수 있다는 것을 의미합니다. 또한, 이 시스템을 불공정하게 만들었습니다. 즉, 약을 제대로 복용하기 어려운 취약 계층(약을 잘 복용하지 않는 경향이 있는 흑인 환자 등)에 대한 의료 격차를 심화시켰습니다.

해결책: 데이터 정제하기

연구진은 훈련 데이터에서 약을 제대로 복용하지 않는 환자들을 단순히 제거하기만 해도, 컴퓨터 모델이 실제로 더 좋아지고 더 공정해진다는 것을 보여주었습니다.

이는 당신의 운전 기록을 깨끗하게 정리하는 것과 같습니다. 만약 빨간불을 무시하고 지나간 운전자들의 기록을 제거한다면, 당신의 로봇은 올바른 규칙을 배울 것입니다: "브레이크를 밟으면 멈춘다."

요약

이 논문은 의료 AI 업계에 던지는 경고입니다: 처방 기록만을 전적으로 신뢰해서는 안 됩니다.

만약 당신이 모든 사람이 약을 복용한다고 가정하는 데이터로 의료 AI를 훈련시킨다면, 당신은 거짓 위에 시스템을 구축하고 있는 것입니다. 이 거짓말은 AI를 다음과 같이 만듭니다:

  1. 어떤 약이 실제로 효과적인지 오해하게 만듭니다.
  2. 환자의 건강에 대해 더 나쁜 예측을 하게 만듭니다.
  3. 약 복용에 어려움을 겪는 사람들에게 불공정한 결과를 초래합니다.

저자들은 의사의 노트를 읽어 "거짓말쟁이"(복용을 제대로 하지 않는 환자)를 찾아내고, 의료 모델을 훈련하기 전에 데이터를 정제하기 위해 AI 도구(그들이 사용한 LLM과 같은)를 사용할 것을 제안합니다. 이를 통해 의료 AI의 미래가 정확하고 공정할 수 있도록 보장해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →