← 최신 논문
📊 statistics

Lord's 'paradox' explained: the 50-year warning on the use of 'change scores' in observational data

이 논문은 변화량 비교나 기저치 조정 후속 비교 모두 서로 다른 편향으로 인해 관찰 데이터에서 인과 효과를 신뢰성 있게 추정할 수 없음을 입증함으로써 로드(Lord)의 50년 된 역설을 해결하며, 이를 통해 잘 정의된 연구 질문과 g-방법론과 같은 고급 인과 추론 방법의 결정적인 필요성을 강조한다.

원저자: Peter W. G. Tennant, Georgia D. Tomova, Eleanor J. Murray, Kellyn F. Arnold, Matthew P. Fox, Mark S. Gilthorpe

게시일 2026-01-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Peter W. G. Tennant, Georgia D. Tomova, Eleanor J. Murray, Kellyn F. Arnold, Matthew P. Fox, Mark S. Gilthorpe

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로드의 '역설(Paradox)'에 대한 설명: 쉬운 언어와 일상적인 비유를 통해

거대한 미스터리: 두 명의 통계학자, 두 개의 답변

한 대학교에서 학생들의 식단이 체중 증가에 영향을 미치는지, 혹은 남학생과 여학생이 체중이 늘어나는 방식이 다른지 알고 싶어 한다고 가정해 봅시다. 이들은 9월(학기 시작 시점)에 모든 학생의 몸무게를 재고, 다시 6월(학기 종료 시점)에 몸무게를 잽니다.

그들은 데이터를 분석하기 위해 두 명의 통계학자를 고용했습니다.

  • 통계학자 A는 체중의 '차이'를 살펴봅니다. 그들은 평균적으로 남학생과 여학생의 몸무게가 9월에는 같았고, 6월에도 같았다는 것을 발견합니다. 그의 결론은 이렇습니다: "변화가 없었다. 식단과 성별은 상관이 없다."
  • 통계학자 B는 '최종' 몸무게를 보되, 처음에 얼마나 무거웠는지를 고려하여 조정합니다. 그는 처음 체중이 같았던 학생들을 기준으로 했을 때, 남학생들이 여학생들보다 더 무거워졌다는 것을 발견합니다. 그의 결론은 이렇습니다: "남학생들이 처음에 같은 체격이었을 때보다 유의미하게 더 많은 체중이 늘었다."

이것이 바로 **로드의 역설(Lord's Paradox)**입니다. 어떻게 두 명의 똑똑한 사람이 정확히 같은 숫자를 보고 완전히 상반된 결론에 도달할 수 있을까요?

논문의 해답: 이것은 역설이 아니라 함정이다

이 논문의 저자들은 이것이 마법 같은 미스터리가 아니라고 주장합니다. 이는 사실 경고 신호입니다. 두 통계학자 모두 관찰 데이터(남녀 차이처럼 사람들이 무작위로 배정되지 않은 데이터)에서 사용하기에는 결함이 있는 방법을 사용하고 있습니다.

논문은 '변화'라는 개념이 매우 까다롭다고 설명합니다. 변화를 이해하기 위해, 변수(예: 체중)가 세 가지 다른 이유로 변한다고 상상해 봅시다.

  1. "습관" 요인 (내생적 변화): 시작점이 어디냐에 따라 자동으로 발생하는 것들입니다. 이미 체중이 많이 나간다면, 단순히 존재하는 것만으로도 자연스럽게 체중이 높게 유지되거나 약간 늘어날 수 있습니다.
  2. "노이즈" 요인 (무작위 변화): 흔들리는 저울로 몸무게를 재거나 잠을 설치는 것과 같은 무작위적인 변동입니다.
  3. "실제" 요인 (외생적 변화): 우리가 연구하고자 하는 식단이나 노출처럼, 실제로 발생하는 효과입니다.

목표: 우리는 "실제" 요인을 측정하고자 합니다. 즉, *우리가 연구하는 식단이 (처음 체중과는 독립적으로) 실제로 체중 변화를 일으켰는가?*를 알고 싶은 것입니다.

왜 통계학자 A는 실패했는가 ("변화량 점수의 함정")

통계학자 A는 **변화량 점수(Change Score)**를 사용했습니다. 이것은 마치 최종 체중 - 시작 체중을 계산하는 것과 같습니다.

비유: 당신이 식물의 성장량을 측정하려고 한다고 상상해 보세요. 식물의 처음과 끝의 길이를 측정하고, 처음 길이를 뺍니다.

  • 문제점: 만약 '노출'(예: 남성임)이 '시작 체중'을 높이는 원인이 되었다면, 이 방법은 망가집니다.
  • 논문의 설명: 시작 체중을 빼버리면, 당신은 의도치 않게 노출 자체의 효과를 빼버리게 됩니다. 만약 남성이라는 특성이 더 높은 시작 체중을 만든다면, 그 시작 체중을 빼버리는 행위는 당신이 측정하려는 바로 그 효과를 "상쇄"시켜 버리는 셈입니다.
  • 결과: 통계학자 A는 "변화 없음"이라는 결과를 얻었습니다. 왜냐하면 수학적으로 실제 효과가 상쇄되었기 때문입니다. 논문은 이 방법이 관찰 연구에서 위험하다고 말합니다. 왜냐하면 실제로는 효과가 있는데 없다고 하거나(예: 약이 효과가 있는데 없다고 함), 그 반대의 경우처럼 잘못된 답을 줄 수 있기 때문입니다.

왜 통계학자 B 또한 결함이 있었는가 ("조정의 함정")

통계학자 B는 ANCOVA(기초값에 대한 추적 조사)를 사용했습니다. 이것은 "남학생과 여학생을 비교하되, 오직 처음에 정확히 같은 체중이었던 경우만 따져보자"라고 말하는 것과 같습니다.

비유: 당신이 새로운 비료의 효과를 보려고 합니다. 키가 같은 두 식물을 관찰합니다. 그런데 당신의 자가 약간 휘어져 있습니다(측정 오차).

  • 문제점: 현실 세계에서 우리의 "시작 체중" 측정값은 완벽하지 않습니다. "노이 lack"(예: 흔들리는 저울)이 존재합니다.
  • 논문의 설명: 약간 틀린 시작 측정값을 조정하려고 할 때, 수학적 계산이 엉망이 됩니다. 이 방법은 효과를 과대평가하는 경향이 있습니다. 시작 측정값의 "노이즈"가 조정을 방해하기 때문에, 남학생들이 실제로 늘어난 것보다 더 많이 늘어난 것처럼 보이게 됩니다.
  • 결과: 통계학자 B는 큰 차이를 발견했지만, 논문은 이 차이가 측정 오차나 다른 숨겨진 요인(예: 신체 활동 등)을 고려하지 못해 과장되었을 수 있다고 제안합니다.

결론: 50년 된 경고

이 논문은 두 방법 모두 관찰 데이터에 대해서는 완벽하지 않다고 결론짓습니다.

  • 변화량 점수(통계학자 A)는 노출이 시작 지점에 영향을 미칠 경우, 효과를 과소평가하거나 숨기는 경향이 있습니다.
  • 조정 방법(통계학자 B)은 측정 오차와 숨겨진 혼란 변수 때문에 효과를 과대평가하는 경향이 있습니다.

"완벽한" 시나리오:
논문은 만-약 이것이 무작위 대조 시험(사람들을 그룹에 무작위로 배정하는 약물 실험 같은 경우)이었다면, 두 방법 모두 잘 작동하여 동일한 답을 냈을 것이라고 언급합니다. 이 역설은 그룹(남녀 등)이 이미 존재하고 사전 차이가 있는 "관찰" 환경에서만 발생합니다.

모두를 위한 핵심 요약

이 50년 된 퍼즐이 주는 주요 교훈은 다음과 같습니다: 실제 데이터에서 "변화"를 분석할 때는 매우 주의하십시오.

  1. 질문을 명확히 정의하십시오: 당신이 정확히 무엇을 측정하려고 합니까?
  2. 단순한 뺄셈을 믿지 마십시오: 그룹 간의 시작점이 다르다면, 단순히 "전"과 "후"의 차이를 구하는 것은 종종 오해를 불러일으킵니다.
  3. 단순한 조정을 믿지 마십시오: 측정값이 불완식하거나 결과에 영향을 미치는 숨겨진 요인(예: 운동 습관)이 있다면, 단순히 시작점을 "조정"하는 것만으로는 마법 같은 해결책이 될 수 없습니다.

이 논문은 모든 상황에 적용되는 단 하나의 "마법 탄환" 같은 해결책을 제시하는 것이 아니라, 변화를 바라보는 가장 흔한 두 가지 방식이 서로 반대 방향으로 편향되어 있어 우리가 보는 것과 같은 혼란스러운 "역설"을 일으킬 수 있음을 과학자들에게 경고하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →