← 最新の論文
📊 statistics

Critical Values Robust to P-hacking

本論文は、研究者が新たな基準に合わせて行動を調整する場合でも、有意な結果が所望の頻度で発生することを保証するために、医学科学データを用いて従来の有意水準の5分の1の水準において古典的な値と等価になるよう較正された、より大きな「ロバストな」棄却限界値を導出するためにpハッキングを取り入れた仮説検定のモデルを提案するものである。

原著者: Adam McCloskey, Pascal Michaillat

公開日 2026-07-23
📖 1 分で読めます☕ さくっと読める

原著者: Adam McCloskey, Pascal Michaillat

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ミステリーを解決しようとしている探偵だと想像してください。科学の世界において、この「ミステリー」とは、「この新しい薬は本当に効くのか?」や「このコインは公平か?」といった問いであることがよくあります。これを解決するために、科学者は仮説検定と呼ばれる特別な道具を使います。この検定を、非常に厳格な裁判官だと考えてください。裁判官は、容疑者は無実である(これは「帰無仮説」と呼ばれます)という前提からスタートします。裁判官が「有罪(帰無仮説を棄却)」を宣告するのは、その証拠があまりにも圧倒的で、それが純粋な偶然によって起こる確率が5%未満である場合のみです。この5%という制限を有意水準と呼び、証拠が打ち負かさなければならない具体的な数値が臨界値です。

しかし、ここには問題があります。現実の世界は、必ずしも法廷のように整然としてはいません。科学者も他の人々と同じように、勝ちたいと考えています。彼らは自らの研究結果が発表され、キャリアが飛躍し、理論が有名になることを望んでいます。これが、一種の「ズル」をする強い誘惑を生み出します。嘘をつくのではなく、望む結果が得られるまで何度も何度も試行錯誤すること、これがpハッキングと呼ばれるものです。これは、サイコロを振り続け、ようやく「6」が出た時に、それまでの「1」や「2」や「3」のことは隠して、その「6」が出たことだけを友人に話すようなものです。もし全員がこのようなことをすれば、「無実」の容疑者が誤って有罪とされることがあまりにも多くなり、科学の司法制度全体が崩壊してしまいます。これが、なぜ「再現性の危機」が起きているのかという理由です。多くの有名な科学的発見が、元の科学者たちが運良く結果が出るまでサイコロを振り続けたために、実は偽りであったことが判明しているのです。

アダム・マクロスキーとパスカル・ミハイラットによるこの論文は、この「ズル」の問題に正面から取り組んでいます。彼らは科学者に「サイコロを振るのをやめなさい」とは言いません。報酬が高い限り、科学者が試行を続けることは分かっているからです。代わりに、彼らは数学的なモデルを構築し、たとえ科学者が試行を繰り返したとしても、「無実」の容疑者が依然として守られるような、ゲームのルールを変更する方法を見つけ出しました。彼らは、現在のルールは突破するのが容易すぎると結論付けました。これを解決するために、彼らはより高いハードルとなる、新しい、より厳しい「臨界値」を提案しています。

彼らの解決策がどのように機能するかを、遊び心のある比喩を使って説明しましょう。科学者がビデオゲームのレベルをクリアしようとしているゲーマーだと想像してください。「レベル」とは、有意な結果を見つけることです。旧システムでは、ゲームの難易度設定が低すぎました。もし科学者が一度目に失敗しても、勝利するまで何度でも「リトライ」することができました。何度も試行できるため、たとえゲームが偶然ではクリア不可能なはずの設定であっても、最終的にはほぼ確実に勝利してしまいます。この論文は、これでは「勝利」に意味がないことを示しています。

著者たちは新しいルールを提案しています:ゲームをより難しくせよ。 しかし、単に少し難しくするだけではありません。彼らは、ゲームを難しくすれば、科学者は勝利するためにさらに多く回数をプレイするようになることも理解していました。ですから、それだけの追加の試行を行ってもなお、科学者が(目標とする通り)5%の確率でしか勝利できないような、非常に高い難易度に設定しなければなりません。

ゲームをどれほど難しくすべきかを判断するために、著者たちは医学研究の実際のデータを用いました。彼らは、資金、時間、またはエネルギーが尽きるために、研究の約20%が完了する前に中止されていることを見出しました。これは、科学者が単一の実験を最後までやり遂げられる確率が80%であることを意味します。この数値を用いて、彼らは、ズルを防ぐためにはゲームの「難易度」を劇的に上げる必要があると計算しました。

彼らの主な発見は、シンプルで強力な経験則です:pハッキングを修正するには、有意水準が実際よりも5倍小さいかのように振る舞う必要がある。

もし科学者が、標準的な5%のレベルで結果が有意であると主張したい場合、通常の臨界値(両側検定の場合は1.96)を使用すべきではありません。代わりに、1%のレベルに対応する臨界値(2.58)を使用すべきなのです。

なぜこれが機能するのでしょうか? 著者たちは、難易度を2.58に上げると、科学者が実際に試行回数を増やすことを示しています。彼らは、あの高いラインを越えようと必死になって、より多くの実験を行い、データポイントを削り、モデルを微調整するでしょう。しかし、ラインがあまりにも高いため、そのようなあらゆる努力を注ぎ込んだとしても、純粋な運によってそのラインを越えられるのは、結局のところ5%の確率程度に留まるのです。「ズル」は依然として行われていますが、それがシステムを破壊することはありません。

この論文は、「科学者にズルをやめるように言う」ことや、「何回試行したかを数えることで解決できる」という考えを明確に退けています。著者たちは、科学者はどのようなルールを設定しても、それに合わせて行動を調整するものであると主張しています。もし「3回までしか試行できない」というルールを作れば、科学者は4回試行する方法を見つけ出すでしょう。システムを保証する唯一の方法は、科学者がリソースを使い果たすまで試行を続けるという事実を考慮した上で、臨界値を設定することなのです。

著者たちは自分たちの数学に自信を持っています。彼らは単に推測したのではなく、確率論と「最適停止(いつゲームを辞めるべきかという高度な概念)」を用いた厳密なモデルを構築しました。彼らは、実験にコストを加えることや、後の実験を完了させるのを難しくすることなど、異なるシナリオを用いて彼らのアイデアをテストしましたが、彼らの解決策は一貫して有効でした。また、彼らは、研究者による「有意水準を単純に0.5%に下げる」という一般的な提案とも比較を行いました。著者たちは、レベルを下げることは良いアイデアではあるものの、彼らのモデルは、科学者がどれだけの資源を持って試行を続けるかに基づいて、具体的に「どの程度」下げるべきかを正確に示していると述べています。

結局のところ、この論文は科学に対する実践的な盾を提示しています。もし私たちが科学的な結果を再び信頼したいのであれば、古い、簡単に突破できてしまう数値を使うのをやめる必要があります。私たちはこれらの「ロバストな臨界値」を採用する必要があります。標準的な両側検定の場合、それはゴールポストを1.96から2.58へと移動させることを意味します。これは高いハードルであり、毎日発表される「画期的な発見」の数は減少することを意味します。しかし、そのトレードオフとして、発表される画期的な発見は「本物」であり、「無実」の帰無仮説は、運の良いサイコロの目によって有罪とされることからようやく守られることになるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →