← 최신 논문
📊 statistics

A Law of Iterated Expectation Primer for Causal Inference

이 논문은 반복 기댓값의 법칙과 인과 추론을 위한 g-공식 사이의 관계를 명확히 하는 입문서를 제공하며, 공식의 비반복적 형태와 반복적 형태를 모두 제시하고 점진적으로 복잡해지는 수치적 예시들을 통해 그 적용 사례를 설명한다.

원저자: Ashley I. Naimi, Razieh Nabi, Lindsay J. Collin, Paul N. Zivich, Stephen R. Cole

게시일 2026-06-19
📖 5 분 읽기🧠 심층 분석

원저자: Ashley I. Naimi, Razieh Nabi, Lindsay J. Collin, Paul N. Zivich, Stephen R. Cole

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

큰 그림: 왜 이것이 필요한가?

만약 당신이 특정 약물(예를 들어 "타목시펜"이라고 부릅시다)이 실제로 유방암 재발을 예방하는지 알고 싶다고 가정해 봅시다. 완벽한 세상이라면, 한 그룹에는 약을 주고 다른 그룹에는 설탕물을 준 뒤 그 결과를 비교하면 될 것입니다. 이것이 무작위 대조 시험(randomized trial)입니다.

하지만 현실 세계에서 우리는 종종 **관찰 데이터(observational data)**만을 갖게 됩니다. 우리는 사람들에게 강제로 약을 먹게 할 수 없습니다. 그저 사람들이 무엇을 선택하는지 지켜볼 뿐입니다. 문제는 약을 선택한 사람들이 선택하지 않은 사람들과 다를 수 있다는 점입니다(예를 들어 더 아프거나 유전적 특성이 다를 수 있습니다). 이러한 차이를 **교란 요인(confounders)**이라고 부릅니다. 만약 우리가 이를 고려하지 않는다면, 환자의 기저 질환 때문에 발생한 일을 약물 때문이라고 잘못 비난할 수 있습니다.

이 논문은 이 수학적 문제를 해결하는 방법을 설명하는 "프라이머(입문서)"입니다. 이 논문은 **반복 기댓값의 법칙(Law of Iterated Expectation)**이라는 특정 수학적 도구를 설명하고, 이 도구가 어떻게 무질서한 현실 세계의 데이터를 인과 관계에 대한 명확한 답으로 바꾸어 놓는지 보여줍니다.

핵심 개념: "반복 기댓값의 법칙"

이 법칙을 **가중 평균(weighted average)**을 계산하는 방법이라고 생각하십시오.

당신이 학교 교장으로서 전교생의 평균 시험 점수를 구하려고 한다고 상상해 봅시다.

  • 단순한 방법: 모든 학생의 점수를 다 더한 다음 학생 수로 나눕니다. 이것이 "주변 기댓값(marginal expectation)"입니다.
  • "반복적인" 방법: 학교에 학년(1학년, 2학년 등)이 있다는 것을 깨닫습니다. 1학년의 평균 점수를 구하고, 그다음 2학년의 평균 점수를 구하는 식입니다. 그런 다음, 각 학년에 학생이 얼마나 있는지에 따라 가중치를 두어 이 학년별 평균들을 결합합니다.

반복 기댓값의 법칙은 단순히 다음과 같이 말합니다: 모두를 한꺼번에 평균 내든, 그룹별로 먼저 평균을 낸 뒤 그룹들을 결합하든, 결국 똑같은 최종 결과에 도달한다.

논문에서 저자들은 이 수학적 항등식이 인과 효과를 알아내기 위해 사용되는 유명한 도구인 **g-공식(g-formula)**의 엔진임을 설명합니다.

같은 차를 운전하는 두 가지 방법: NICE와 ICE

이 논문은 이 수학을 사용하여 인과 문제를 해결하는 두 가지 서로 다른 방법을 소개합니다. 이 두 방법은 수학적으로 동일하며(정확히 같은 답을 냅니다), 데이터를 바라보는 관점만 다릅니다. 저자들은 이를 NICEICE라고 부릅니다.

1. NICE (비반복적 조건부 기댓값, Non-Iterative Conditional Expectation)

비유: "레시피 북" 접근법.
도시 전체 사람들의 평균 키를 알고 싶지만, 빨간 모자를 쓴 사람과 파란 모자를 쓴 사람에 대한 데이터만 가지고 있다고 상상해 봅시다.

  • NICE의 작동 방식: "빨간 모자" 그룹을 보고 그들의 평균 키를 계산합니다. "파란 모자" 그룹을 보고 그들의 평균 키를 계산합니다. 그런 다음, 도시 인구 조사 자료를 통해 빨간 모자를 쓴 사람과 파란 모자를 쓴 사람의 비율이 각각 얼마인지 확인합니다. 마지막으로, 인구 조사 비율을 가중치로 사용하여 이 두 평균을 혼합합니다.
  • 논문에서의 적용: 저자들은 이를 타목시펜과 림프절의 간단한 예시를 통해 보여줍니다. 다양한 그룹에 대한 재발률을 계산한 다음, 그 숫자들을 "대입"하여 최종 가중 평균을 얻습니다.

2. ICE (반복적 조건부 기댓값, Iterative Conditional Expectation)

비유: "예측 기계" 접근법.
당신이 일기 예보관이라고 상상해 보십시오. 과거의 데이터를 단순히 평균 내는 대신, 그날의 조건에 따라 매일의 날씨를 예측하는 모델을 만듭니다.

  • ICE의 작동 방식: 데이터를 가져와 모델에 실행시킨 뒤, 모든 사람에 대해 (마치 모두가 약을 복용한 것처럼) "예측된 결과"를 생성합니다. 그런 다음 그 모든 예측값의 평균을 구합니다.
  • 논문에서의 적용: 저자들은 모든 사람에 대한 "가정적(what-if)" 예측 목록을 만든 다음, 이를 모두 평균 내는 방식으로 이 작업을 수행할 수 있음을 보여줍니다.

핵심 요점: "레시피 북"(NICE)을 사용하든 "예측 기계"(ICE)를 사용하든, 당신은 결국 같은 숫자에 도달합니다. 논문은 이 두 방법이 단지 다르게 쓰인 동일한 수학적 문장임을 증명합니다.

더 복잡해지기: 시간과 움직이는 요소들

논문은 단순한 예시에서 멈추지 않습니다. 상황이 복잡해질 때 이 방식이 어떻게 작동하는지 보여줍니다.

  1. 더 많은 변수: 나이, 소득, 인종, 성별이 모두 뒤섞여 있다면 어떨까요? "레시피 북"(NICE)은 조합이 너무 많아지기 때문에 작성하기 매우 어려워집니다. 반면 "예측 기계"(ICE)는 컴퓨터가 수학을 처리하게 하면 되므로 훨씬 쉽습니다.

  2. 시간에 따라 변하는 교란 요인(Time-Varying Confounders): 이것이 가장 어려운 부분입니다. 다음과 같은 시나리오를 상상해 보십시오.

    • 당신이 시간 1(Time 1)에 약을 복용합니다.
    • 그 약이 시간 2(Time 2)에 당신의 건강 상태(교란 요인)를 변화시킵니다.
    • 이 새로운 건강 상태가 시간 2에 당신이 두 번째 약을 복용할지 여부에 영향을 미칩니다.
    • 마지막으로, 시간 3(Time 3)에 결과를 관찰합니다.

    이 시나리오에서는 "교란 요인"(당신의 건강) 자체가 처치(treatment)에 의해 변경되었기 때문에 표준 통계학은 실패합니다. 논문은 g-공식(반복 기댓값의 법칙 사용)이 이 매듭을 푸는 유일한 방법임을 보여줍니다. 이는 역방향으로 작업함으로써 수행됩니다.

    • 먼저, 맨 마지막의 결과를 예측합니다.
    • 그다음, 시간 2에 무슨 일이 일어났는지 예측하기 위해 역방향으로 거슬러 올라갑니다.
    • 그다음, 시간 1로 역방향으로 거슬러 올라갑니다.
    • 마지막으로, 이 모든 것을 평균 냅니다.

    논문은 이를 "역방향 재귀(backward recursion)"라고 부릅니다. 이는 마치 출구에서 시작하여 입구로 걸어서 돌아가는 방식으로 미로를 푸는 것과 같습니다.

저자들이 실제로 주장하는 것 (그리고 주장하지 않는 것)

  • 그들은 다음과 같이 주장합니다: 반복 기댓값의 법칙은 우리가 "관찰한 것"을 "실제로 일어났을 일"(인과 효과)로 바꿀 수 있게 해주는 수학적 토대입니다.
  • 그들은 다음과 같이 주장합니다: NICE와 ICE 방법은 수학적으로 동등합니다. 이들은 단지 다르게 표현된 동일한 것입니다.
  • 그들은 다음과 같이 주장합니다: 단순한 상황(시간 고정형)에서는 두 방법 모두 쉽습니다. 복잡한 상황(시간 가변형)에서는 ICE 방법(역방향 작업)이 코딩하기 더 쉽고 특정 유형의 오류에 더 강건(robust)합니다.
  • 그들은 다음과 같이 주장하지 않습니다: 이 논문은 새로운 의학적 결과, 새로운 임상 지침, 또는 의사에게 환자를 어떻게 치료할지에 대한 구체적인 조언을 제공하는 것이 아닙니다. 이것은 순수하게 데이터를 분석하는 수학과 논리에 관한 가이드입니다.
  • 그들은 다음과 같이 주장하지 않습니다: 한 방법이 다른 방법보다 일반적인 의미에서 "더 낫다"고 주장하지 않습니다. 그것들은 단지 같은 일을 하기 위한 서로 다른 도구일 뿐입니다. 다만, 수학적 모델이 틀렸다면 두 방법 모두 틀린 답을 낼 수 있다는 점을 언급합니다.

결론

이 논문은 번역가입니다. 이 논문은 매우 난해하고 무서운 수학적 개념(반복 기댓값의 법칙)을 가져와서, 그것이 어떻게 원시 데이터와 인과적 진실 사이의 가교 역할을 하는지 설명합니다. 이 논문은 연구자들에게 "가중 평균" 접근법을 사용하든 "단계별 예측" 접근법을 사용하든, 그들이 "우리가 만약 다른 행동을 했다면 어떤 일이 일어났을까?"라는 질문에 답하기 위해 동일한 근본적 논리를 사용하고 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →