← 최신 논문
📊 statistics

Asymptotic emergence of statistically supported false causal interpretation under unmeasured confounding

이 논문은 미측정 혼란 변수가 존재하는 상황에서 표본 크기를 늘리는 것이 관찰 가능한 대리 지표를 바탕으로 한 잘못된 인과 구조를 식별하는 데 있어 역설적으로 더 높은 통계적 확실성을 초래할 수 있음을 입증하며, 이는 통계적 신뢰도와 실제 인과 기제의 회복 사이의 근본적인 단절을 강조한다.

원저자: Mark Louie F. Ramos

게시일 2026-07-31
📖 5 분 읽기🧠 심층 분석

원저자: Mark Louie F. Ramos

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 탐정이 되어 미스터리를 풀고 있다고 상상해 보세요. 하지만 당신은 범인이 아닌, 남겨진 단서들만을 볼 수 있습니다. 이것이 바로 **관측적 인과 추론(observational causal-inference)**의 세계입니다. 이는 통제된 실험을 수행하는 대신, 현실 세계의 데이터를 사용하여 무엇이 무엇을 유발하는지 알아내려는 과학의 한 분야입니다. 이 분야에서 '원인'은 다른 도미노를 쓰러뜨리는 하나의 도미노와 같습니다. 하지만 까다로운 규칙이 하나 있습니다. 두 사건이 동시에 일어난다고 해서(그들은 '연관'되어 있습니다), 반드시 하나가 다른 하나를 일으킨 것은 아니라는 점입니다. 때로는 숨겨진 제3의 요인, 즉 '교란 요인(confounder)'이 비밀리에 두 사건 모두를 밀고 있을 수 있습니다. 예를 들어, 아이스크림 판매량과 상어 공격 횟수는 모두 여름에 증가하지만, 아이스크림이 상어 공격을 유발하는 것은 아닙니다. 숨겨진 원인은 바로 더운 날씨입니다. 과학자들은 이 도미노들이 어떻게 연결되어 있는지에 대한 이론을 그리기 위해 'DAG(Directed Acyclic Graphs, 방향성 비순환 그래프)'라고 불리는 특별한 지도를 사용하지만, 이 지도들은 자신들이 '볼 수 없는 것'에 대한 거대한 가정을 전제로 합니다.

모두가 관심을 갖는 핵심 질문은 이것입니다: 우리가 진짜 원인을 찾아냈다고 확신할 수 있을까요? 우리가 더 많은 데이터를 수집함에 따라, 패턴을 포착하는 능력은 점점 더 좋아집니다. 우리는 "A와 B 사이에 연관성이 있다"라고 높은 신뢰도로 말할 수 있습니다. 하지만 그것이 A가 B를 '유발한다'는 뜻일까요? 이 논문은 매우 무서운 가능성을 다룹니다. 만약 우리가 패턴을 찾는 데 너무 능숙해진 나머지, 잘못된 답에 대해 지나치게 확신하게 된다면 어떻게 될까요? 이 논문은 완벽한 수학과 방대한 데이터가 있더라도, 만약 진짜 원인이 우리에게 보이지 않는다면, 우리는 매우 설득력 있고 통계적으로 견고한 '잘못된 용의자'에 대한 이야기를 만들어내게 될 수도 있음을 시사합니다.


보이지 않는 인형술사의 사례

당신이 정원의 특정 식물이 왜 그렇게 크게 자라는지 알아내려 한다고 가정해 봅시다. 당신은 의문의 정원사가 몰래 토양에 붓고 있는 '비밀 슈퍼 비료'(이를 X라고 부릅시다) 때문이라고 의심합니다. 하지만 문제는 X가 눈에 보이지 않는다는 것입니다. 당신은 X를 볼 수도, 측정할 수도, 심지어 존재한다는 사실조차 알 수 없습니다. 그러나 당신은 정원에서 일어나는 다른 일들은 볼 수 있습니다. 식물이 자랄 때마다 정원 호스에서도 물이 뿌려지는 것(Z)을 목격합니다. 실제로, 보이지 않는 비료(X)가 식물의 성장과 호스의 물 분사를 둘 다 일으키고 있습니다(아마도 비료가 토양을 목마르게 하거나, 정원사가 비료를 섞기 위해 호스를 사용하는 것일 수 있습니다).

이제 당신은 슈퍼컴퓨터를 가진 데이터 과학자입니다. 당신은 정원을 연구하기로 결심합니다. 당신은 보이지 않는 비료에 대해 모르기 때문에, 오직 눈에 보이는 것들, 즉 식물의 크기와 물 분사만을 관찰합니다. 당신은 10개의 식물, 100개, 10,000개의 식물로부터 데이터를 수집합니다. 데이터가 많아질수록, 당신의 컴퓨터는 물 분사와 식물 성장 사이의 연결 고리를 포착하는 데 점점 더 능숙해집니다.

이 논문은 당신이 데이터가 많아짐에 따라, 물 분사가 식물의 성장을 유발한다는 사실에 대해 100% 확신하게 되는 지점에 결국 도달하게 될 것이라고 주장합니다. 당신의 통계 테스트는 "이것은 실제 효과다! 우연이 아니다!"라고 외칠 것입니다. 당신은 "안정적이고 데이터에 기반한" 관계를 찾아낸 것입니다. 하지만 반전이 있습니다. 당신은 틀렸습니다. 물이 성장을 유발한 것이 아니라, 보이지 않는 비료가 성장을 유발한 것입니다. 물은 그저 실제 원인과 함께 움직였던 '대리 지표(proxy)'였을 뿐입니다.

"더 많은 데이터"의 함정

저자인 마크 루이 피 F. 라모스(Mark Louie F. Ramos)는 이것이 당신의 수학적 실수나 'p-해킹(p-hacking, 결과를 얻기 위해 숫자를 조작하는 것)'의 결과가 아님을 보여줍니다. 이것은 상황 자체가 가진 근본적인 함정입니다.

이것을 유령이 나오는 집에서 유령을 찾는 것에 비유해 봅시다. 당신은 유령(실제 원인)을 볼 수 없지만, 커튼이 움직이거나 불빛이 깜빡이는 것(대리 지표)은 볼 수 있습니다. 만약 당신이 고속 카메라를 들고 그곳에 오래 서 있다면, 당신은 결국 "커튼이 움직일 때 불빛이 깜빡인다"는 사실을 절대적인 확신을 가지고 증명하게 될 것입니다. 당신은 이 연결에 대한 완벽하고 흔들리지 않는 통계적 증거를 갖게 될 것입니다. 하지만 만약 당신이 "커튼이 불빛을 깜빡이게 만들었다"고 결론 내린다면, 당신은 유령을 완전히 놓친 것입니다.

이 논문은 만약 당신이 연구에 포함하는 변수(정원에서 볼 수 있는 것들)를 계속 추가하고 표본 크기(더 많은 식물을 관찰하는 것)를 늘린다면, 당신은 필연적으로 잘못된 것들 사이의 이러한 "완벽한" 연결 고리를 발견하게 될 것임을 증명합니다. 데이터가 많아질수록, 당신은 왜 그런 일이 일어나는지에 대해 완전히 잘못된 이야기에 대해 더 큰 확신을 갖게 됩니다.

이것이 중요한 이유 (그리고 중요하지 않은 이유)

이 논문이 무엇을 말하려는 것이 아닌지 이해하는 것이 중요합니다. 이 논문은 과학자들이 수학을 못 한다거나, 데이터를 골라내어 속임수를 쓰고 있다는 말을 하는 것이 아닙니다. 논문은 이것이 단순히 '제1종 오류(잘못된 운이나 나쁜 통계로 인한 가짜 알람)'가 아님을 명시적으로 배제합니다. 사실, 보이지 않는 원인이 실재하고 강력하기 때문에, 이러한 "잘-못된" 결과들은 무작위 소음보다 오히려 재현될 가능성이 더 높습니다. 만약 당신이 백만 개의 식물로 실험을 다시 수행한다면, 당신은 똑같은 "틀린" 답을 반복해서 얻게 될 것입니다. 연관성은 실재합니다. 다만 그 인과관계가 거짓일 뿐입니다.

또한 이 논문은 이것이 우리가 사용하는 도구(예: t-검정)의 문제가 아니라는 점을 분명히 합니다. 그 도구들은 두 가지가 연결되어 있는지를 알려주는 데 탁월합니다. 문제는 우리가 그 도구들이 작동하려면 먼저 '보이지 않는 것들을 포함하는 세상의 지도'를 먼저 합의해야 한다는 사실을 자주 잊는다는 점입니다. 만약 우리의 지도에 "보이지 않는 비료"가 빠져 있다면, 도구들은 기꺼이 "물 호스"가 주인공이라고 말해줄 것이며, 아주 확신에 차서 그렇게 할 것입니다.

요약

주요 결론은 "빅 데이터"가 모든 미스터리를 해결해 줄 것이라고 믿는 사람들에게 다소 낙담스러운 내용입니다. 이 논문은 더 많은 데이터가 누락된 원인의 문제를 해결해주지 못한다는 것을 보여줍니다. 오히려 그것은 우리가 잘못된 답에 대해 더 큰 확신을 갖게 만듭니다.

저자는 통계적 분석이 무엇이 무엇을 유발하는지에 대한 우리의 아이디어를 "검증"할 수 있다고 생각하는 것을 멈춰야 한다고 결론짓습니다. 통계는 오직 우리가 세상에 대한 지도가 옳다고 가정할 때만 그 효과의 크기를 알려줄 수 있습니다. 진짜 작업, 즉 보이지 않는 원인이 무엇인지 알아내는 작업은 숫자를 계산하기 에, 계산기가 아닌 우리의 머리와 이론, 그리고 사전 지식을 사용하여 이루어져야 합니다.

그러므로 다음에 "우리는 A와 B 사이의 견고하고 통계적으로 유의미한 연결 고리를 발견했다"라는 연구를 읽게 된다면, 보이지 않는 인형술사를 기억하십시오. 데이터는 완벽하고, 수학은 결점 없으며, 확신은 하늘을 찌를 듯할지라도, 만약 진짜 원인이 그림자 속에 숨어 있다면, 그 전체 이야기는 매우 설득력 있는 환상일 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →