← 최신 논문
📊 statistics

Hypothesizing an effect size by considering individual variation

이 논문은 의학, 경제학, 심리학의 사례를 통해 평균 치료 효과를 설정할 때 개별 변이를 고려한 효과 분포를 먼저 고려하는 새로운 접근법을 제시합니다.

원저자: Andrew Gelman, Amy Krefman, Lauren Kennedy, Jessica Hullman

게시일 2026-04-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Andrew Gelman, Amy Krefman, Lauren Kennedy, Jessica Hullman

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"실험을 설계할 때, '평균 효과'를 어떻게 현실적으로 예측할 것인가?"**에 대한 매우 중요한 질문을 던집니다.

저자 앤드루 젤먼 (Andrew Gelman) 과 동료들은 과학 연구자들이 흔히 하는 실수, 즉 **"이 약 (또는 교육 프로그램) 은 모든 사람에게 똑같이 큰 효과를 줄 것이다"**라고 막연하게 믿고 실험을 설계하는 것을 경계합니다. 대신, **"사람마다 효과가 얼마나 다를까?"**를 먼저 생각하라고 제안합니다.

이 복잡한 통계 논문을 일상적인 비유로 쉽게 설명해 드리겠습니다.


1. 핵심 문제: "모두에게 똑같은 효과"라는 착각

과학자들은 보통 실험을 설계할 때 "이 약을 먹으면 평균적으로 수명이 5 년 더 늘어날 것"이라고 가정합니다. 하지만 현실은 그렇게 단순하지 않습니다.

비유: "모든 사람에게 똑같은 크기의 우산"
상상해 보세요. 비가 오는 날, 여러분이 "이 우산은 모든 사람에게 100% 완벽하게 비를 막아줄 거야"라고 믿고 우산을 100 개 만들었다고 칩시다.

  • 어떤 사람은 키가 작아서 우산이 머리 위로 꽉 차고 비를 다 막습니다. (효과 100%)
  • 어떤 사람은 키가 너무 커서 우산이 작고 어깨가 젖습니다. (효과 50%)
  • 어떤 사람은 이미 우산을 쓰고 있어서 이 우산이 필요 없습니다. (효과 0%)
  • 어떤 사람은 우산을 쓰면 오히려 넘어집니다. (효과 -100%)

연구자들은 보통 '평균 효과'만 계산하려 합니다. 하지만 사람마다 우산이 필요한 정도가 다르고, 우산의 크기도 다르기 때문에, 단순히 "평균 50% 효과"라고 말하면 실제 상황과 너무 동떨어진 결과가 나옵니다.

2. 기존 방법의 함정: "파일럿 연구"와 "과장된 기대"

연구자들은 보통 작은 규모의 시범 실험 (파일럿 연구) 을 먼저 해봅니다. 그런데 여기서 큰 문제가 생깁니다.

비유: "작은 시식 코너와 대형 마트"
시범 실험은 마치 대형 마트 입구에 있는 '무료 시식 코너'와 같습니다.

  • 시식 코너에 오는 사람들은 이미 그 음식을 좋아할 가능성이 높고, 맛을 잘 아는 전문가들일 수 있습니다.
  • 그래서 시식 코너에서는 "이 음식이 정말 맛있네!"라는 반응이 90% 나 나옵니다.
  • 하지만 연구자들은 이 결과를 보고 "전 세계 사람들이 다 이 음식을 좋아할 거야!"라고 믿고, 수만 명을 대상으로 하는 대형 실험을 설계합니다.

결과: 실제 대형 마트 (전체 인구) 에서는 맛이 별로인 사람도 많고, 아예 먹지 않는 사람도 많습니다. 그래서 시범 실험에서 기대했던 "대박"이 실제로는 "실패"로 끝나거나, 운 좋게도 큰 효과를 본 것처럼 보이는 '가짜 성공'에 그칩니다.

3. 제안하는 해결책: "효과 분포 (Distribution)"를 먼저 생각하기

이 논문은 **"단 하나의 숫자 (평균 효과) 를 맞추려고 애쓰지 말고, '효과가 어떻게 퍼져 있을지'를 먼저 상상하라"**고 말합니다.

비유: "다양한 크기의 구슬 주머니"
효과를 예측할 때, "평균 크기가 5cm 인 구슬"이라고 상상하는 대신, 주머니 속에 어떤 구슬들이 들어있을지 상상해 보세요.

  1. 완벽한 구슬 (효과 100%): 약이 정말 잘 맞는 사람들.
  2. 반쪽짜리 구슬 (효과 50%): 약이 어느 정도는 듣는 사람들.
  3. 빈 구슬 (효과 0%): 약이 전혀 듣지 않는 사람들 (약 알약을 삼키지 않거나, 몸이 약을 흡수하지 못함).
  4. 거꾸로 된 구슬 (효과 -100%): 약이 오히려 해를 끼치는 사람들.

이 논문은 연구자들에게 이렇게 묻습니다:

"당신의 실험에 참여할 사람들 중에서, 약이 100% 듣는 사람은 몇 % 일까요? 아예 듣지 않는 사람은 몇 % 일까요?"

이렇게 **사람마다 다른 상황 (이질성)**을 먼저 고려하면, 평균 효과는 자연스럽게 계산됩니다.

  • 예: "약이 듣는 사람은 20% 이고, 그중에서 효과가 100% 라면, 나머지 80% 는 효과가 0% 야."
  • 계산: (0.2 * 100) + (0.8 * 0) = 평균 20% 효과

이렇게 계산하면, 연구자들은 "아, 내가 생각했던 50% 효과는 너무 낙관적이었구나. 실제로는 20% 정도일 수도 있겠구나"라고 깨닫게 됩니다.

4. 왜 이것이 중요한가? (실제 사례)

논문의 예시를 들어보면 더 명확해집니다.

  • 의료 예시: 어떤 약이 "수명 연장"을 목표로 합니다.

    • 잘못된 생각: "이 약을 먹으면 평균 수명이 5 년 늘어난다."
    • 현실적인 생각: "이미 건강해서 죽지 않을 사람 (약 60%), 약을 먹어도 죽을 수밖에 없는 중환자 (약 20%), 오직 이 약만 먹으면 살 수 있는 사람들 (약 20%) 이 있다."
    • 결과: 전체 평균 효과는 20% 수준으로 떨어집니다. 만약 연구자가 50% 효과를 가정하고 실험을 설계했다면, 필요한 환자 수가 25 배나 더 필요해졌을 것입니다.
  • 정치 예시: "동성애자를 아는 것이 동성애 결혼 찬성 여론을 바꾼다."

    • 잘못된 생각: "모든 사람이 조금씩 생각을 바꿀 것이다."
    • 현실적인 생각: "이미 극단적으로 찬성하거나 반대하는 사람들은 변하지 않는다. 오직 '중립'에 있던 사람들만 바뀐다."
    • 결과: 전체 평균 효과는 매우 작아집니다.

5. 결론: "평균"보다 "다양성"을 먼저 보자

이 논문의 핵심 메시지는 다음과 같습니다.

  1. 평균은 함정이다: "평균 효과"라는 숫자 하나만 믿으면, 실험 설계가 엉망이 되고 (과소 또는 과대 평가), 결과를 잘못 해석하게 됩니다.
  2. 사람마다 다르다: 치료나 교육, 정책은 사람마다, 상황마다 효과가 다릅니다. 어떤 사람은 천재처럼 효과를 보고, 어떤 사람은 전혀 효과가 없을 수 있습니다.
  3. 설계는 현실에서 시작하라: 실험을 시작하기 전에 "이 실험에 누가 참여할까? 그중에서 효과가 클 사람과 작을 사람은 얼마나 될까?"를 먼저 상상하세요.

한 줄 요약:

"모든 사람에게 똑같은 효과를 기대하지 마세요. 대신, '누가 효과를 볼지, 누가 보지 못할지'를 먼저 상상하면, 훨씬 더 현실적이고 성공적인 실험을 설계할 수 있습니다."

이처럼 과학 연구도 마치 다양한 크기의 구슬을 주머니에 담는 작업과 같습니다. 평균 크기만 재는 게 아니라, 주머니 속에 어떤 구슬들이 얼마나 섞여 있는지를 이해해야 비로소 정확한 예측이 가능해집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →