Statistical Significance Revisited
本論文は、標準的な0.05という閾値の廃棄や二項仮説検定からの脱却といった、統計的有意性の実践を改革するよう最近求められている呼びかけを、これらの提案された変更の強みと欠点を分析することによって検討する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたが謎解きをする探偵だと想像してください:データに真のパターンがあるのか、それとも単なる偶然なのか?
ほぼ 1 世紀にわたり、科学者たちはこの問いに答えるのを助けるために、「有意性検定」という特定の道具(そしてその主な出力である「p 値」)を用いてきました。p 値を「疑念メーター」と考えてみてください。メーターの読みが非常に低い場合(通常は 0.05、つまり 5% 未満)、探偵はこう言います。「これは偶然の産物としてはあり得なさすぎる;ここには真のパターンに違いない!」
しかし最近、多くの人々がこの道具は壊れていると主張しています。彼らは、これが「誤った警報」(実際には存在しないパターンを見つけること)を過剰に引き起こし、5% という閾値は恣意的であると述べています。R. L. Machete によって書かれたこの論文は、これらの不満を深く掘り下げ、問いかけます:この道具を捨て去るべきか、ルールを厳格化すべきか、それとも使い方をより上手に学ぶべきか?
以下に、この論文の主張を簡単なアナロジーを用いて解説します。
1. 二つの学派:門番 vs ギャンブラー
論文は、この道具の歴史を説明することから始まります。
- フィッシャー(門番): 彼は、結果が「驚くほど」のものであり、何も起こっていないという考え(帰無仮説)を棄却するのに十分かどうかを見るために、この検定を発明しました。彼は 5% という閾値を使用しましたが、それを硬直した法則として扱うことには警告を発しました。
- ネイマンとピアソン(ギャンブラー): 彼らは賭けにもう一つの側面を加えました。「もし真の効果があるなら、それを逃す可能性はどれほどあるか?」と問いかけました。彼らは第一種の過誤(誤った警報)と第二種の過誤(真のシグナルを見逃すこと)の概念を導入しました。
アナロジー: 空港の金属探知機を想像してください。
- フィッシャーは言います。「ブザーが鳴れば、それは疑わしい。」
- ネイマンとピアソンは言います。「ブザーの鳴り方をバランスさせる必要があります。感度を上げすぎれば、すべてのベルトバックルを捉えてしまいます(第一種の過誤)。逆に鈍くしすぎれば、本当の武器を見逃してしまいます(第二種の過誤)。」
2. 大論争:「ルールをより厳しくしよう!」
最近、ベンジャミンら一部の科学者たちは、5% という閾値が緩すぎると主張しました。彼らはこれを0.5%(または 0.005)に変更したいと考えています。
- 彼らの論理: 金属探知機の作動をより難しくすれば、誤った警報を減らすことができます。これにより、実験の再現成功回数が倍増するはずです。
- 論文の反論: 著者はこれはトレードオフであると述べています。探知機の作動を難しくすれば、確かに真の武器を見逃す(第二種の過誤)ことになります。
- コスト: 基準があまりにも高く設定されるため、「極めて明白なもの」だけが通過できるようになり、真の発見を見逃すことになるかもしれません。
- 数学: 論文は、閾値を下げることが誤った警報を減らすことは示していますが、最初に真の発見がどれだけ存在するかを知っていなければ(通常は不可能ですが)、自動的に「再現性の危機」を解決するわけではないと示しています。
3. 「ベイズ的」迂回路:確率を推測する
一部の批判者は、p 値は誤解を招くものであり、理論がそもそもどれほど「ありそうか」を考慮していないと主張しています。彼らは、ベイズ的アプローチの使用を提案しており、これには「事前確率」(調査を始める前に仮説がどれほどありそうだと考えるか)を推測する必要があります。
- 論文の見解: 著者は、現実世界ではこれらの事前確率を知ることはできないと主張しています。すべての科学的仮説のうち、実際に真である割合がどれほどかを簡単に推測することはできません。
- 比喩: 全ての研究に対してベイズ的アプローチを使用しようとするのは、車庫から出る前に交通密度を推測して運転しようとするようなものです。それは素敵なアイデアですが、実際にはそのデータを持っていないことが多いのです。論文は、誤りの確率(検定が誤る頻度)に固執する方が実用的であると提案しています。
4. 「捨て去れ」運動
一部の改革派は言います。「p 値や閾値の使用を完全にやめよう!単に数値を報告し、人々に判断させよう。」
- 論文の見解: 著者はこれは危険だと考えています。
- アナロジー: 医師が「患者に熱があるかどうかは言わないで。体温だけ教えてくれ、私が推測するから」と言うのを想像してください。
- 問題点: 人間は明確な基準線なしに二択(はい/いいえ)の決定を下すのが苦手です。閾値を取り除いても、決定がなくなるわけではありません。ただ基準線が隠されるだけです。最終的には、誰かが結果が「十分良い」かどうかを決定しなければなりません。
- 信頼区間: 論文は、信頼区間(ありそうな値の範囲)を報告すべきであることに同意していますが、これらが p 値を置き換えるべきではないと主張しています。これらは地図とコンパスのように、一緒に機能すべきです。
5. 「厳格性」検定:データを眺める新しい方法
論文は、メイヨという哲学者から由来する厳格性(Severity)という概念を導入しています。
- アイデア: 単に検定を通過するだけでは不十分です。「もしこの仮説が偽だったなら、この検定を通過する可能性はどれほどあったか?」と問う必要があります。
- 比喩: 容疑者が嘘発見器を通過したと想像してください。
- 標準的な検定: 「通過したから、無実だ。」
- 厳格性検定: 「もし彼が有罪なら、この特定の嘘発見器は彼を捕まえたか?もし機械が壊れていて誰でも通過させてしまうなら、'通過'は何も証明しません。しかし、機械が非常に厳しく、彼がそれでも通過したなら、それは無実の厳格な証拠です。」
- 著者は、単一の数値を見るのではなく、この「厳格性」という考え方をデータに深く掘り下げるために使用することを提案しています。
6. 現実世界の例:アフリカのサバンナの火災
これらの道具が機能することを証明するために、著者はアフリカの火災に関するデータを見ています。
- 問い: 火災は 5 年周期で発生するか?
- 結果: 数学は強いパターン(非常に低い p 値)を示しました。
- 応用: 著者は単に「有意である」と言うだけではありませんでした。厳格性の概念を用いて、「この周期は偶然ではなく、95% の確信度で真実である」と述べました。また、その周期がどれほど強いかを正確に示すために信頼区間も使用しました。
- 教訓: これらの道具は、ゲームのルールを変えることなく、明確で確信に満ちた答えを与えるために一緒に機能しました。
最終的な判決
論文は、私たちが岐路に立っていると結論付けています。
- 道具を捨てないこと: p 値や有意性検定は、真の科学とノイズを区別するために依然として有用です。
- 単にネジを締めないこと: 閾値を 0.005 にすることは誤った警報を減らすかもしれませんが、真の発見を隠してしまうことになります。
- 道具を賢く使うこと: 科学者は道具の主人であり、奴隷であってはなりません。彼らは p 値、信頼区間、厳格性のチェックを一緒に使用して、情報に基づいた決定を下すべきです。
- 真の敵: 問題は数学ではなく、行動にあります。「データ・ドレッシング」(パターンが見つかるまで探すこと)や「任意の停止」(良い結果が出たらすぐに実験を止めること)といったことが、悪い科学の真の原因です。p 値の閾値を変更しても悪い行動は修正されません。より良い倫理とインセンティブだけがそれを解決します。
要約: この論文は、統計のルールをパニックになって書き換えるべきではないと主張しています。代わりに、既存の道具を信頼し、よりニュアンスを持って(「厳格性」をチェックするなど)使用し、悪い科学につながる人間の行動を修正することに焦点を当てるべきです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。