The Difference Between "Replicable" and "Not replicable" is not Itself Scientifically Replicable
본 논문은 본질적 이질성이 불가감소적 불확실성과 식별 불가능한 분산을 초래함으로써 통계적 기반을 훼손하여 재현 위기를 선언하는 데 사용된 통계적 기반을 약화시키기 때문에, 비정밀 실험 전반에 걸친 이진 재현 판정을 집계하는 것은 "재현 가능"과 "재현 불가능" 결과 사이를 신뢰성 있게 구분하는 데 실패한다고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 논문은 쉬운 언어와 창의적인 비유를 사용하여 설명합니다.
핵심 아이디어: 왜 '진짜' 과학과 '거짓' 과학을 쉽게 구별할 수 없는가
당신이 새로운 요리법이 '좋다'거나 '나쁘다'고 판단해야 하는 판사라고 상상해 보세요. 당신은 50 명의 다른 요리사들에게 이 요리를 만들어 보게 합니다.
- 만약 45 명의 요리사가 "맛이 훌륭하다!"라고 말하고 5 명은 "끔찍하다"고 말한다면, 당신은 그 요리법이 재현 가능하다고 (좋다) 결론 내릴 수 있습니다.
- 만약 25 명이 "훌륭하다"고 하고 25 명이 "끔찍하다"고 말한다면, 당신은 그것이 재현 불가능하다고 (나쁘다) 결론 내릴 수 있습니다.
이 논문은 이러한 판단 방식이 결함이 있다고 주장합니다.
저자인 베르나 데베제르 (Berna Devezer) 와 에르칸 오. 부즈바스 (Erkan O. Buzbas) 는 현대 과학에서 실험이 다른 실험실에서 얼마나 자주 성공했는지 세는 것만으로는 '좋은' 결과와 '나쁜' 결과를 신뢰할 수 있게 구별할 수 없다고 주장합니다. 수천 번의 실험을 수행하더라도 수학적으로 '재현 가능'과 '재현 불가능' 사이의 경계선은 보이지 않는다고 합니다.
핵심 문제: '완벽한 복사' 신화
왜 그런지 이해하려면 '재현'이 실제로 무엇인지 살펴봐야 합니다.
- 정확한 재현: 이는 복사기와 같습니다. 문서를 가져가면 기계가 동일한 사본을 출력해 줍니다. 과학에서 이는 모든 세부 사항 (같은 사람들, 같은 장비, 같은 시간대, 같은 지시 사항) 이 동일하고 오직 무작위적인 운의 변화만 존재함을 의미합니다.
- 현실: 완벽한 복사는 거의 불가능합니다. 실제 생활에서 재현은 문서를 손으로 베끼는 것과 같습니다. 한 사람은 파란 펜을 사용하고, 다른 사람은 연필을 사용합니다. 한 사람은 책상에서 쓰고, 다른 사람은 기차에서 씁니다. 한 사람은 피곤하고, 다른 사람은 활기찹니다.
이 논문은 이를 **비정확성 (non-exactness)**이라고 부릅니다. 모든 실험실이 약간씩 다르기 때문에, 모든 실험도 약간씩 다릅니다.
두 가지 모델: '공유된 비밀' 대 '독립적인 도박'
저자들은 이러한 불완전한 복사들을 섞을 때 어떤 일이 일어나는지 설명하기 위해 두 가지 통계 모델을 사용합니다.
1. 기준 모델 (The "Shared Secret")
모두가 같은 마스터 레시피를 비밀리에 따르고 있지만, 모두 그 레시피를 읽는 데 약간 서툰 요리사들의 그룹을 상상해 보세요.
- 레시피가 '읽기 어렵다면' (높은 비정확성), 1,000 명의 요리사에게 시도하게 하더라도 그들의 결과는 여전히 엉망이 될 것입니다.
- 교훈: 정밀할 수 있는 한계 (바닥) 가 존재합니다. 요리사를 더 많이 추가하더라도 불확실성은 사라지지 않습니다. 왜냐하면 문제의 원인이 요리사의 수가 아니라 레시피 자체의 '엉망진창함'이기 때문입니다.
2. 운영 모델 (The "Independent Gamble")
이것이 과학이 실제로 작동하는 방식입니다. 각 실험실은 고유한 실험을 수행하고 간단한 "예" (성공) 또는 "아니오" (실패) 를 보고합니다.
- 저자들은 각 실험실에서 "예/아니오" 답변만 얻을 때, 실험실들이 얼마나 달랐는지에 대한 모든 정보를 잃어버린다고 보여줍니다.
- 비유: 도시의 평균 온도를 추측하려고 한다고 상상해 보세요.
- 시나리오 A: 100 명의 사람에게 같은 온도계를 보게 합니다. 그들은 모두 같은 숫자를 보지만, 아마도 모두 그걸 잘못 보고 있을지도 모릅니다.
- 시나리오 B: 100 명의 사람에게 100 개의 서로 다른 온도계를 보게 합니다. 일부는 고장 났고, 일부는 햇빛 아래 있고, 일부는 그늘에 있습니다.
- 만약 그들에게 "뜨겁나요? (예/아니오)"라고만 물어본다면, 시나리오 A 와 B 의 차이를 알 수 없습니다. 당신은 그저 "예"와 "아니오" 목록만 얻게 됩니다. 온도계가 고장 난 것인지, 아니면 날씨가 단순히 혼란스러운 것인지 알 수 없습니다.
'재현 위기'는 통계적 착시입니다
이 논문은 유명한 '재현 위기 (과학의 절반이 가짜라는 아이디어)'가 나쁜 수학으로 인한 오해일 수 있다고 주장합니다.
- 함정: 과학자들은 종종 "우리는 100 건의 연구를 재현해 보았고, 그중 36% 만 성공했다. 따라서 과학은 위기에 처했다"고 말합니다.
- 현실: 저자들은 36% 는 단지 사과와 오렌지를 섞은 숫자에 불과하다고 말합니다. 모든 실험실이 다르기 때문에 (비정확성), '36%'는 원래 과학이 나빴는지, 아니면 실험실들이 측정 방법을 합의하지 못했는지를 알려주지 않습니다.
- 판결: "예/아니오" 결과 목록을 보고 "이 결과는 확실히 참이다" 또는 "이 결과는 확실히 거짓이다"라고 말할 수는 없습니다. 데이터 구조가 그러한 판단을 내릴 만큼 충분한 정보를 포함하고 있지 않기 때문입니다.
왜 '더 많은 재현'이 문제를 해결하지 못하는가
보통 우리는 이렇게 생각합니다: "우리가 확신이 없다면, 더 많은 실험을 해보자!"
- 논문의 반전: 실험들이 '비정확하다면' (다른 실험실, 다른 사람들, 다른 도구), 실험을 더 추가하는 것은 서로 다른 언어로 외치는 사람들이 있는 방에 더 많은 사람을 추가하는 것과 같습니다. 당신은 단지 더 많은 소음만 얻게 됩니다.
- 유효 표본 크기: 저자들은 100 개의 서로 다른 실험실로 이루어진 연구가 5~6 개의 완벽한 동일한 실험의 통계적 힘만 가질 수 있음을 보여줍니다. 실험실 간의 차이로 인한 '소음'이 실험실을 더 많이 가진다는 이점을 상쇄시킵니다.
Many Labs 4 사례
저자들은 17 개 실험실이 죽음에 대해 생각하는 것과 관련된 유명한 심리학 실험을 재현하려 했던 'Many Labs 4'라는 실제 프로젝트에서 그들의 이론을 테스트했습니다.
- 결과: 실험실들은 모두 달랐습니다. 일부는 온라인으로, 일부는 대면으로 진행했습니다. 일부는 다른 질문을 사용했습니다.
- 수학: 이 17 개 실험실의 '엉망진창함 (이질성)'을 계산했을 때, 그 수치가 너무 높아 데이터가 원래 결과가 참인지 거짓인지 알려줄 수 없었습니다. '예/아니오' 답변들은 너무 모호했습니다.
- 결론: 막대한 자금이 투입된 대규모 프로젝트였음에도 불구하고, 데이터는 승자를 선언하기에 너무 '흐릿'했습니다.
요약: 우리는 무엇을 해야 하는가?
저자들은 우리가 과학을 하거나 재현하는 것을 멈춰야 한다고 말하지는 않습니다.
- 재현은 여전히 좋습니다: 일이 어떻게 작동하는지 배우고, 올바른 측정을 찾으며, 세부 사항을 이해하는 데 유용합니다.
- 재현은 나쁩니다: 우리가 그것을 전체 과학 분야를 '위기' 또는 '성공'으로 선언하는 간단한 '합격/불합격' 테스트로 사용할 때 나쁩니다.
최종 비유:
다른 실험실들로부터의 '예/아니오' 표를 세어 과학적 결과가 '실제'인지 판단하려는 시도는 100 명의 사람에게 노래를 불러서 그 품질을 판단하려는 것과 같습니다. 어떤 사람은 다른 음정으로 부르고, 어떤 사람은 가사를 잊고, 어떤 사람은 더 빠르게 부릅니다. 만약 단순히 몇 명이 '맞게' 불렀는지 세기만 한다면, 당신은 노래를 판단하는 것이 아니라 군중이 노래를 얼마나 잘 모방하는지 판단하는 것입니다.
이 논문은 과학의 '위기'를 선언하는 데 현재 사용 중인 도구들이 할당된 임무를 수행할 수 있는 수학적 능력을 갖추지 못했다고 결론 내립니다. 우리는 현재 방법으로는 '재현 가능'과 '재현 불가능' 사이에 신뢰할 수 있는 경계선을 그을 수 없습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.