← 最新の論文
📊 statistics

p-Hacking Inflates Type I Error Rates in the Error Statistical Approach but not in the Formal Inference Approach

この論文は、p ハッキングが誤差統計アプローチでは多重比較による実際の誤差率の上昇を通じて第一種の過誤率を膨張させるが、形式推論アプローチでは報告された個々の仮説に関する推論にその実際の誤差率が関係しないため、第一種の過誤率の膨張は生じないと論じている。

原著者: Mark Rubin

公開日 2026-03-04
📖 1 分で読めます☕ さくっと読める

原著者: Mark Rubin

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、統計学の「p ハッキング(結果を都合よく操作して有意な結果を出すこと)」が、なぜ**「悪いこと」なのか**について、2 つの異なる視点から面白い議論を繰り広げています。

著者のマーク・ルービンさんは、この問題を「エラー統計アプローチ(エラー統計学)」と「形式推論アプローチ(形式推論学)」という 2 つの異なる「メガネ」で見ると、答えが全く変わってくるのだと主張しています。

これをわかりやすく、日常の例え話で解説します。


1. 2 つの「メガネ」の違い

まず、この 2 つのアプローチの違いを理解しましょう。

🧐 メガネ A:エラー統計アプローチ(厳格な裁判官)

この視点では、「実験の全過程」がすべて重要です。
研究者が「100 回試して、たまたま 1 回だけ当たった結果」だけを報告した場合、裁判官はこう言います。

「いやいや、100 回も試して、たまたま当たったのを『奇跡』だと報告するのは嘘だ!実際には 100 回試したのだから、偶然で当たる確率は非常に高いはずだ。だから、この結果は信頼できない(エラー率が膨らんでいる)」

  • 特徴: 隠された試行(失敗した実験)も含めて「実際の試行回数」を数えます。
  • 結論: p ハッキングは**「嘘つき」であり、「誤って正解だと信じる確率(タイプ I エラー)」を劇的に高めてしまう**悪い行為です。

🎭 メガネ B:形式推論アプローチ(劇作家の脚本)

この視点では、「報告された結果そのもの」だけが重要です。
研究者が「100 回試した」とは言わず、「ある特定の条件で 1 回だけ実験した」として結果を報告した場合、劇作家はこう言います。

「その『1 回の実験』という脚本自体は、数学的に正しい計算で書かれている。『100 回試した』という裏事情は、この脚本(報告された推論)には含まれていない。だから、この 1 回の結果に対する数学的な確率は、そのまま正しい」

  • 特徴: 報告された「1 つの推論」に焦点を当てます。裏で何があったかは、その推論の数学的な正しさを否定しません。
  • 結論: p ハッキングは**「数学的なエラー率を膨らませる」ことにはならない**。報告された 1 つの結果は、その瞬間には「正しい計算」をしているからです。

2. 具体的な例え話:ダーツと射撃

この違いを、2 つの例え話で説明します。

例え話①:ダーツ大会(エラー統計アプローチ)

ある人がダーツを 20 回投げました。

  • 19 回は的の周りに散らばり、1 回だけ的の真ん中に命中しました。
  • 彼は「私は的の真ん中に命中させた!」と報告し、他の 19 回の失敗は隠しました。

🧐 エラー統計アプローチの裁判官の意見
「それは詐欺だ!20 回投げたなら、偶然で真ん中に当たる確率は 60% 以上あるはずだ。『1 回だけ』という報告は、実際の確率(60%)を隠して、あたかも 5% の確率で成功したかのように見せかけている。これは**『エラー率の膨張』**だ!」

例え話②:射撃の練習(形式推論アプローチ)

同じ状況ですが、別の視点で見ます。

  • 彼は「的の真ん中に命中した」という1 つの事実だけを報告しました。
  • その 1 発の射撃自体は、的の中心を正確に狙って撃たれたものでした。

🎭 形式推論アプローチの劇作家の意見
「その『1 発の射撃』が的の中心を撃ったという事実は、数学的に正しい。その 1 発の確率は 5% です。
彼が『20 回も撃った』という裏事情を隠しているのは、『射撃の技術』の問題や『物語の構成(科学の倫理)の問題かもしれない。しかし、その『1 発の射撃』が偶然だったかどうかを計算する『数学的な式』自体は、裏事情があっても間違ってはいないんだ。
だから、p ハッキングによって『その 1 発の数学的エラー率』が勝手に 5% から 60% に変わってしまうわけではないよ。それは『別の話(20 回撃ったという話)』の確率であって、この 1 発の確率とは関係ないんだ」


3. なぜこの議論が重要なのか?

この論文は、**「p ハッキングは本当に統計学的なエラー率を歪めているのか?」**という点に疑問を投げかけています。

  • エラー統計学(A)は言います。「p ハッキングは統計的な信頼性を崩壊させる。だから厳しく罰し、事前に計画(プリレジストレーション)を義務づけなければならない!」
  • 形式推論学(B)は言います。「p ハッキングは数学的な計算自体を間違ったものにはしない。問題は、隠された失敗が『科学の物語(実質的な結論)』を歪めてしまうことだ。だから、統計の数式を疑うよりも、『なぜその結果だけを選んだのか?』という科学的な議論を深めるべきだ」

🌟 重要なポイント:「隠された失敗」の正体

形式推論アプローチでは、p ハッキングによって「数式が壊れる」わけではありません。
しかし、「科学の結論(実質的な推論)

  • 例え:「緑色のジェリービーンを食べるとニキビができる」という結論を出したとします。
    • 研究者は 20 色すべてのジェリービーンを試しましたが、「緑色」だけが当たったので、他の 19 色(ニキビにならない結果)を隠しました。
    • 形式推論:「緑色のジェリービーン」に関する 1 つの統計テストは、数学的には正しい(エラー率は 5% のまま)。
    • しかし:「ジェリービーン全体がニキビの原因だ」という科学的な結論は、他の 19 色のデータ(証拠)を隠しているせいで、偏った(バイアスがかかった)ものになっています。

4. 結論:何が問題で、どうすればいい?

この論文の結論は、少し意外なものです。

  1. p ハッキングは「数学的なエラー率」を膨らませない(形式推論の視点)
    • 報告された 1 つの結果の「偶然の確率」自体は、裏で何があったかで変わらないという考え方です。
  2. でも、p ハッキングは「科学の信頼性」を損なう
    • 隠された「失敗した実験(ノイズ)」が、私たちが「本当の事実」だと信じてしまう原因になります。
  3. 解決策は「統計の修正」ではなく「議論の深化」
    • 単に「プリレジストレーション(事前登録)」をして数を数えるだけでは不十分かもしれません。
    • 重要なのは、「なぜその結果だけを選んだのか?」「他の可能性(隠された失敗)という、研究者同士の批判的な対話です。

🎯 一言でまとめると
「p ハッキングは、『計算ミス(数学)ではなく、『物語の嘘(科学)です。だから、数式を疑うよりも、『なぜその話だけなのか?』と問いかける批判的な姿勢が、科学を正しく保つための鍵なのです」


📝 補足:この論文が示唆する「複製危機」について

最近、科学界では「実験結果が再現できない(複製できない)」という問題(複製危機)が起きています。

  • 従来の考え:「p ハッキングでエラー率が膨らんで、嘘の結果が溢れているからだ!」
  • この論文の新しい視点:「エラー率は実は正しくても、『見えていない未知の要因(隠れた変数)が、結果を左右しているから再現できないんだ。p ハッキングは、その『見えない要因』に気づかせてくれないだけだ」

つまり、「もっと厳しく統計を管理する」ことよりも、「自分たちの知識の限界(無知)が、科学をより強くする道だと説いています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →