← 최신 논문
📊 statistics

A Comparative Study of Methods for Handling Missing Data in Longitudinal Data with Implications for Causal Inference

본 연구는 몬테카를로 시뮬레이션과 경험적 검증을 활용하여 종단적 인과 추론을 위한 결측치 대체 및 교란 요인 통제 전략의 최적 조합을 식별하며, 측정되지 않은 교란 요인이 없는 상태에서 이중 강건 추정법과 결합된 다중 대체 또는 랜덤 포레스트가 이질적 효과를 파악하는 데 가장 우수한 성능을 보임을 입증한다.

원저자: Yemian Li, Yuhui Yang, Weiwei Hu, Zonghao Li, Fangyao Chen

게시일 2026-06-25
📖 5 분 읽기🧠 심층 분석

원저자: Yemian Li, Yuhui Yang, Weiwei Hu, Zonghao Li, Fangyao Chen

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매일 와인 한 잔을 마시는 것이 실제로 사람들을 더 행복하게 만드는지, 아니면 더 슬프게 만드는지 알아내려 한다고 상상해 보세요. 당신은 이 답을 찾기 위해 몇 년 동안 한 집단을 추적하기로 결정했습니다. 이것이 연구자들이 말하는 "종단 연구(longitudinal study)"입니다.

하지만 삶은 엉망이 되기 일쑤입니다. 사람들은 설문지를 작성하는 것을 잊어버리고, 멀리 이사를 가거나, 자신의 기분에 대한 질문에 답변하는 것을 그만둡니다. 이것이 바로 **결측 데이터(missing data)**입니다. 동시에, 소득이나 연령처럼 결과에 영향을 미치는 다른 요소들도 존재합니다. 이것들이 바로 교란 요인(confounders)(결과를 흐리는 "숨겨진 변수")입니다.

이 논문은 거대하고 하이테크한 요리 경연 대회와 같습니다. 연구자들은 단 하나의 요리만을 만든 것이 아니라, 재료가 사라지거나 주방이 혼란스러운 상황에서 어떤 "레시피"(통계적 방법)가 가장 잘 작동하는지 확인하기 위해 수천 가지의 서로 다른 시나리오를 시뮬레이션했습니다.

다음은 그들의 연구 결과를 쉬운 용어로 정리한 내용입니다.

문제점: 두 가지의 난장판

실제 연구에서는 보통 두 가지 문제가 동시에 발생합니다:

  1. 결측 데이터: 일부 사람들이 중도 탈락하거나 질문을 건너뛰었습니다.
  2. 교란: 알코올이 기분 변화를 일으킨 것인지, 아니면 다른 무언가(예: 스트레스나 소득)가 두 가지 모두를 일으킨 것인지 구별하기 어렵습니다.

기존의 대부분의 연구는 이러한 문제들을 한 번에 하나씩 해결하려고 시도했습니다. 이 연구는 다음과 같이 물었습니다: "데이터가 엉망일 때, 빠진 부분을 메우고 노이즈로부터 진짜 원인을 분리해 내는 데 가장 완벽한 도구의 조합은 무엇인가?"

실험: 시뮬레이션 주방

연구자들은 컴퓨터를 사용하여 가상의 세계를 구축했습니다. 그들은 가상의 인물, 가상의 삶, 가상의 음주 습관, 그리고 가상의 기분을 가진 가짜 사람들을 만들었습니다. 그런 다음 의도적으로 데이터를 "망가뜨려" 보았습니다:

  • 일부 사람들을 사라지게 만들었습니다(결측 데이터).
  • 데이터가 사라지는 이유를 다르게 설정했습니다(어떤 것은 무작위로, 어떤 것은 불행해서 발생하도록).
  • 추적 기간(연도)을 변경했습니다.
  • 다양한 수의 "숨겨진 변수"(교란 요인)를 추가했습니다.

그 후, 그들은 결측 데이터를 해결하는 7가지 방법(예: 빠진 숫자를 추측하는 법)과 교란 요인을 통제하는 6가지 방법(예: 레시피를 조정하는 법)을 테스트했습니다. 어떤 조합이 가장 정확한 답을 주는지 확인하기 위해 각 조합당 1,000번씩 시뮬레이션을 실행했습니다.

재료: 테스트된 방법들

결측 데이터를 해결하기 위한 팀 ("빈칸 채우기" 팀):

  • 완전 사례 분석 (Complete Case Analysis): 결측치가 있는 사람은 그냥 버립니다. (계란 하나가 빠졌다고 케이크 전체를 버리는 것과 같습니다.)
  • 평균 대치법 (Mean Imputation): 빈 공간을 평균값으로 채웁니다. (빠진 시험 점수를 학급 평균이라고 가정하는 것과 같습니다.)
  • 다중 대치법 (Multiple Imputation, MI): 여러 가지 다른 "만약에" 버전의 결측 데이터를 만들어 평균을 냅니다. (10명의 서로 다른 셰프에게 빠진 재료를 추측하게 한 뒤, 그 추측값들의 평균을 내는 것과 같습니다.)
  • 랜덤 포레스트(Random Forest) & KNN: 유사한 사람들을 살펴보고 빠진 값을 추측하는 스마트한 컴퓨터 알고리즘입니다.

교란 요인을 통제하기 위한 팀 ("소음 제거" 팀):

  • 다변량 조정 (Multivariate Adjustment, MA): 알려진 모든 변수를 수학 방정식에 단순히 추가합니다.
  • 성향 점수 방법 (Propensity Score Methods: PSM, IPW): 음주자와 비음주자를 서류상으로 똑같이 보이도록 매칭하거나, 희귀한 유형의 사람들에게 더 많은 가중치를 부여합니다.
  • 이중 강건 추정 (Doubly Robust Estimation, DRE): "이중 확인" 시스템입니다. 두 가지 서로 다른 수학 모델을 사용하며, 하나가 틀리더라도 다른 하나가 해결해 줍니다.
  • 도구 변수 (Instrumental Variable, IV): 기분에 직접 영향을 주지는 않지만 음주에는 영향을 주는 제3의 요인(예: 유전적 특성이나 무작위 사건)을 사용하여 자연스러운 실험처럼 활용합니다.

결과: 누가 경연에서 승리했는가?

1. "결측 메커니즘"의 신화
연구자들은 데이터가 왜 누락되었는지(무작위인지, 아니면 사람들이 슬퍼서인지)가 최종 결과에는 큰 영향을 미치지 않는다는 것을 발견했습니다. 가장 중요한 것은 얼마나 많은 데이터가 누락되었는가였습니다. 어떤 방법을 사용하든 결측 데이터가 많아질수록 결과는 나빠졌습니다.

2. 최고의 "빈칸 채우기" 팀
인과 관계(진짜 원인을 찾는 것)를 기준으로 승자는 다음과 같았습니다:

  • 다중 대치법 (MI): 표준적인 방법입니다. 불확실성을 잘 처리합니다.
  • 평균 대치법: 이 특정 목표에 대해서는 놀랍게도 성능이 좋았습니다. 매우 단순함에도 불구하고 말이죠.
  • 랜덤 포레스트 (Random Forest): 패턴을 학습하는 스마트한 알고리즘입니다.

피해야 할 것: 결측 데이터가 있는 사람을 단순히 버리는 것(완전 사례 분석)은 최악의 성적을 기록했습니다. 이는 가장 많은 오류를 만들어냈습니다.

3. 최고의 "소음 제거" 팀
이는 상황에 따라 달랐습니다:

  • 시나리오 A (복잡한 실제 세계의 효과): 알코올의 효과가 사람마다 다르고(이질적) 숨겨진 비밀이 없는 경우, **이중 강건 추정 (DRE)**이 명확한 승자였습니다. 가장 정확하고 안정적이었습니다.
  • 시나리오 B (단순한 효과 또는 숨겨진 비밀): 효과가 모든 사람에게 동일하거나, 연구자가 알지 못하는 미측정 교란 요인(숨겨진 변수)이 있는 경우, 도구 변수 (IV) 방법이 가장 좋았습니다. 이는 숨겨진 변수의 커튼 뒤를 들여다볼 수 있는 유일한 방법이었습니다.

4. 황금 조합
연구는 대부분의 실제 상황(효과가 사람마다 다르고 주요 교란 요인을 알고 있다고 가정하는 상황)에서 가장 좋은 전략은 다음과 같다는 것을 발견했습니다:

다중 대치법 (또는 랜덤 포레스트) + 이중 강건 추정 (DRE).

이 조합은 마치 마스터 셰프(MI)와 이중 확인 시스템(DRE)을 갖춘 것과 같았습니다. 이는 가장 적은 오류로 가장 정확한 결과를 만들어냈습니다.

실제 세계의 맛 테스트

연구자들은 자신들의 시뮬레이션이 단순한 컴퓨터 환상이 아님을 증명하기 위해, **중국 건강 및 은퇴 종단 연구(CHARLS)**의 실제 데이터에 이 방법들을 적용했습니다. 그들은 노년층의 알코올과 우울증 사이의 연관성을 살펴보았습니다.

결과는 실제 데이터가 시뮬레이션과 똑같이 움직였다는 것을 보여주었습니다.

  • 모든 방법이 알코올과 우울증 사이의 연관성을 찾아냈습니다.
  • "이중 강건(Doubly Robust)" 방법과 "다중 대치(Multiple Imputation)"를 결합한 방식이 가장 안정적이고 신뢰할 수 있는 수치를 제공했습니다.
  • "결측 데이터를 버리는(Complete Case)" 방법과 "역확률 가중치(Inverse Probability Weighting)"를 결합한 방식은 가장 불안정하고 부풀려진 결과를 냈습니다.

핵심 요약

만약 당신이 장기 연구에서 인과 관계를 밝히려는 연구자라면:

  1. 결측 데이터를 그냥 삭제하지 마세요. 다중 대치법이나 랜덤 포레스트와 같은 스마트한 채우기 방법을 사용하세요.
  2. "이중 확인" 시스템을 사용하세요. 효과가 사람마다 다르다고 생각된다면, 이중 강건 추정을 사용하세요.
  3. 비밀을 주의하세요. 측정할 수 없는 숨겨진 요인이 있다고 의심된다면 도구 변수가 필요할 수 있지만, 추적 기간이 길어질수록 힘(power)을 잃을 수 있음을 주의하세요.

이 논문은 적절한 "채우기" 도구와 적절한 "소음 제거" 도구를 매칭함으로써, 연구자들이 엉망인 실제 데이터로부터 훨씬 더 명확하고 신뢰할 수 있는 답을 얻을 수 있다고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →