← 최신 논문
📊 statistics

Critical Values Robust to P-hacking

이 논문은 연구자들이 새로운 기준에 맞춰 행동을 조정하더라도 유의미한 결과가 원하는 빈도로 발생하도록 보장하기 위해, 의학 과학 데이터를 사용하여 고전적 수치와 5분의 1 수준의 유의 수준에서 동일하도록 보정된 더 크고 "강건한" 임계값을 도출하고자 p-해킹을 통합한 가설 검정 모델을 제안한다.

원저자: Adam McCloskey, Pascal Michaillat

게시일 2026-07-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Adam McCloskey, Pascal Michaillat

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 미스터리를 풀려는 탐정이라고 상상해 보십시오. 과학의 세계에서 이 '미스터리'는 종종 "이 새로운 약이 정말 효과가 있는가?" 또는 "이 동전은 공정한가?"와 같은 질문입니다. 이를 해결하기 위해 과학자들은 **가설 검정(hypothesis test)**이라는 특별한 도구를 사용합니다. 이 검정을 엄격한 판사라고 생각하십시오. 판사는 피고인이 무죄라고 가정하며 시작합니다(이것을 '귀무가설'이라고 합니다). 판사는 증거가 순전히 우연에 의해 발생할 확률이 5% 미만일 정도로 압도적일 때만 피고에게 유죄를 선언(귀무가설 기각)합니다. 이 5%의 한계를 **유의 수준(significance level)**이라고 하며, 증거가 이겨내야 하는 구체적인 수치를 **임계값(critical value)**이라고 합니다.

하지만 문제는 현실 세계가 항상 법정처럼 깔끔하지는 않다는 점입니다. 과학자들도 일반 사람들처럼 이기고 싶어 합니다. 그들은 자신의 연구 결과가 발표되기를 원하고, 경력이 빛나기를 바라며, 자신의 이론이 유명해지기를 원합니다. 이로 인해 '약간의 속임수'를 쓰고 싶은 거대한 유혹이 생깁니다. 거짓말을 하는 것이 아니라, 원하는 결과를 얻을 때까지 계속해서 다시 시도하는 방식입니다. 이것을 **p-해킹(p-hacking)**이라고 합니다. 이것은 주사위를 던져서 6이 나올 때까지 계속 던진 다음, 그 6이 나온 한 번의 순간만을 친구들에게 이야기하고 나머지 1, 2, 3이 나온 결과들은 숨기는 것과 같습니다. 만약 모두가 이렇게 한다면, '무죄'인 피고들이 너무 자주 유죄 판결을 받게 될 것이고, 과학이라는 전체 사법 체계는 무너지고 말 것입니다. 이것이 바로 '재현성 위기(replication crisis)'가 발생하는 이유입니다. 많은 유명한 과학적 발견들이 원래의 과학자들이 운 좋게 걸릴 때까지 주사위를 계속 던졌기 때문에 가짜로 밝혀지고 있습니다.

아담 맥클로스키(Adam McCloskey)와 파스칼 미카엘라트(Pascal Michaillat)의 이 논문은 이 속임수 문제를 정면으로 다룹니다. 그들은 과학자들에게 주사위 던지기를 멈추라고 노력하지 않습니다. 보상이 높은 한 과학자들이 계속 시도할 것이라는 점을 알고 있기 때문입니다. 대신, 그들은 게임의 규칙을 바꾸어, 설령 과학자들이 계속해서 주사위를 던지더라도 '무죄'인 피고들이 여전히 보호받을 수 있도록 하는 수학적 모델을 구축했습니다. 그들은 현재의 규칙이 너무 깨뜨리기 쉽다는 것을 발견했습니다. 이를 해결하기 위해, 그들은 증거가 통과해야 할 훨씬 더 높은 장벽 역할을 하는 새로운, 더 까다로운 '임계값'을 제안합니다.

그들의 해결책이 어떻게 작동하는지 재미있는 비유를 들어 설명하겠습니다. 과학자가 비디오 게임의 레벨을 깨려는 게이머라고 상상해 보십시오. '레벨'은 유의미한 결과를 찾는 것입니다. 기존 시스템에서 게임은 낮은 난이도로 설정되어 있었습니다. 만약 과학자가 첫 번째 시도에서 실패하면, 원하는 결과를 얻을 때까지 원하는 만큼 '재시도(retry)'를 할 수 있었습니다. 계속 시도할 수 있었기 때문에, 그들은 결국 거의 매번 승리했습니다. 비록 그 게임이 우연히 깨는 것이 불가능하도록 설계되었을지라도 말입니다.

저자들은 새로운 규칙을 제안합니다: 게임을 더 어렵게 만드십시오. 하지만 단순히 조금 더 어렵게 만드는 것이 아닙니다. 그들은 게임이 더 어려워지면 과학자가 승리하기 위해 더 많이 플레이할 것이라는 점을 깨달았습니다. 따라서, 당신은 게임을 너무 어렵게 만들어서, 그 모든 추가 시도에도 불구하고 과학자가 오직 정해진 횟수만큼만(목표가 5%라면 5%만큼) 승리하게 만들어야 합니다.

게임의 난이도를 정확히 어떻게 설정해야 하는지 알아내기 위해, 저자들은 실제 의료 연구 데이터를 살펴보았습니다. 그들은 연구의 약 20%가 과학자들이 돈, 시간 또는 에너지가 부족하여 완료하기 전에 중단된다는 것을 발견했습니다. 이는 과학자가 단일 실험을 마칠 확률이 80%임을 의미합니다. 이 수치를 사용하여, 저자들은 속임수를 막기 위해 게임의 '난이도'를 대폭 높여야 한다는 것을 계산해 냈습니다.

그들의 주요 발견은 간단하고 강력한 경험칙입니다: p-해킹을 해결하려면, 당신의 유의 수준이 실제보다 5배 더 작다고 가정해야 합니다.

만약 어떤 과학자가 표준 5% 수준에서 결과가 유의미하다고 주장하고 싶다면, 보통의 임계값(양측 검정의 경우 1.96)을 사용하는 대신, 1% 수준에 해당하는 임계값(2.58)을 사용해야 합니다.

이것이 왜 작동하는 걸까요? 저자들은 임계값을 2.58로 높이면 과학자들이 실제로 더 많이 시도할 것이라는 점을 보여줍니다. 그들은 더 많은 실험을 수행하고, 더 많은 데이터 포인트를 버리고, 더 많은 모델을 수정하며 그 높은 선을 넘으려 필사적으로 노력할 것입니다. 하지만 선이 너무 높기 때문에, 그러한 모든 추가적인 노력에도 불구하고, 그들은 순전히 운에 의해 그 선을 넘는 데 성공하는 비율이 5%에 불과할 것입니다. '속임수'는 여전히 발생하고 있지만, 그것이 시스템을 망가뜨리지는 않습니다.

이 논문은 우리가 단순히 과학자들에게 "속임수를 쓰지 마라"고 말하거나, 얼마나 여러 번 시도했는지를 단순히 세는 것으로 해결할 수 있다는 생각을 명시적으로 배제합니다. 저자들은 과학자들이 설정된 규칙에 맞춰 항상 자신의 행동을 조정할 것이라고 주장합니다. 만약 우리가 "세 번만 시도할 수 있다"는 규칙을 세운다면, 과학자들은 네 번 시도할 방법을 찾아낼 것입니다. 시스템이 작동하는 것을 보장하는 유일한 방법은 과학자들이 자원이 바닥날 때까지 계속 시도할 것이라는 사실을 고려하여 임계값을 설정하는 것입니다.

저자들은 자신들의 수학적 모델에 확신을 가지고 있습니다. 그들은 단순히 추측한 것이 아니라, 확률론과 '최적 정지(optimal stopping, 게임을 언제 그만둘 것인가에 대한 세련된 방식)'를 사용하여 엄격한 모델을 구축했습니다. 그들은 비용을 추가하거나 나중에 진행되는 실험을 더 어렵게 만드는 등 다양한 시나리오를 통해 자신들의 아이디어를 테스트했으며, 그들의 해결책은 견고하게 유지되었습니다. 또한 그들은 유의 수준을 단순히 0.5%로 낮추자는 다른 연구자들의 인기 있는 제안과 자신들의 결과를 비교했습니다. 저자들은 수준을 낮추는 것이 좋은 아이디어이긴 하지만, 자신들의 모델이 과학자들이 계속 시도할 수 있는 자원을 얼마나 가지고 있는지에 따라 얼마나 많이 낮춰야 하는지를 정확히 보여준다고 제안합니다.

결국, 이 논문은 과학을 위한 실질적인 방패를 제공합니다. 만약 우리가 과학적 결과들을 다시 신뢰하고 싶다면, 우리는 오래되고 쉽게 깨지는 숫자들을 사용하는 것을 멈춰야 한다고 제안합니다. 우리는 이러한 "강건한 임계값(robust critical values)"을 채택해야 합니다. 양측 검정의 경우, 이는 목표 지점을 1.96에서 2.58로 옮기는 것을 의미합니다. 이는 더 높은 장벽이며, 매일 더 적은 수의 '돌파구'가 발표될 것임을 의미합니다. 하지만 그 대가는 우리가 발표하는 돌파구들이 실제로 진짜라는 것이며, '무죄'인 귀무가설들이 드디어 운 좋은 주사위 던짐에 의해 유죄 판결을 받는 일로부터 안전해질 것이라는 점입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →