Statistical Significance Revisited
本文通过剖析这些拟议变革的优势与不足,审视了近期关于改革统计显著性实践(例如弃用标准的 0.05 阈值并超越二元假设检验)的呼吁。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名侦探,试图解开一个谜团:数据中是否存在真实的模式,还是仅仅出于巧合?
近一个世纪以来,科学家们一直使用一种名为显著性检验(Significance Test)的特定工具(及其主要产出p 值)来辅助回答这一问题。将 p 值想象成一个“怀疑度计”。如果该读数非常低(通常低于 0.05,即 5%),侦探就会说:“这太不可能只是偶然了;这里一定存在真实的模式!”
然而,最近许多人认为这一工具已经失效。他们指出,它导致了过多的“误报”(发现实际上并不存在的模式),并且 5% 的阈值是武断的。本文由 R. L. Machete 撰写,深入探讨了这些抱怨,并提出:我们应该抛弃这一工具、收紧规则,还是仅仅学会更好地使用它?
以下是利用简单类比对该论文论点的拆解。
1. 两大思想流派:守门人 vs. 赌徒
论文首先解释了这一工具的历史。
- 费希尔(The Gatekeeper,守门人): 他发明该检验是为了判断结果是否“令人惊讶”到足以拒绝“什么都没有发生”这一想法(零假设)。他使用了 5% 的阈值,但警告不要将其视为僵化的法律。
- 奈曼与皮尔逊(The Gamblers,赌徒): 他们在赌局中增加了另一面。他们问道:“如果确实存在真实效应,我们有多大可能错过它?”他们引入了第一类错误(误报)和第二类错误(漏掉真实信号)的概念。
类比: 想象机场的金属探测器。
- 费希尔说:“如果它响了,那就可疑。”
- 奈曼与皮尔逊说:“我们需要平衡报警频率。如果我们让它过于敏感,就会捕捉到每一个皮带扣(第一类错误);如果我们让它过于迟钝,就会漏掉真正的武器(第二类错误)。”
2. 重大争议:“让我们收紧规则!”
最近,一些科学家(如 Benjamin 等人)认为 5% 的阈值过于宽松。他们希望将其改为0.5%(即 0.005)。
- 他们的逻辑: 如果我们让金属探测器更难触发,我们就会捕捉到更少的误报。这应该使实验成功复现的次数翻倍。
- 论文的驳论: 作者指出这是一种权衡。如果你让探测器更难触发,你肯定会漏掉更多真正的武器(第二类错误)。
- 代价: 你可能会停止发现真正的突破,因为门槛设得太高,只有那些“超级明显”的发现才能通过。
- 数学层面: 论文表明,虽然降低阈值确实减少了误报,但它并不能自动解决“可重复性危机”,除非你事先知道真实发现的数量——而这通常是无法得知的。
3. “贝叶斯”绕道:猜测概率
一些批评者认为 p 值具有误导性,因为它们没有考虑到一个理论原本就有多大的可能性。他们建议使用贝叶斯方法,这要求你猜测“先验概率”(即在开始之前你认为假设成立的可能性有多大)。
- 论文的观点: 作者认为,在现实世界中,我们往往无法知道这些先验概率。你很难轻易猜出所有科学理论中实际上有多少是真的。
- 隐喻: 试图对每一项研究都使用贝叶斯方法,就像在离开车道之前就试图通过猜测交通密度来开车。这是一个很好的想法,但在实践中,我们往往没有这些数据。论文建议,坚持使用错误概率(即测试出错的频率)更为实用。
4. “彻底抛弃”运动
一些改革者说:“停止使用 p 值和阈值!只需报告数据,让人们自行决定。”
- 论文的观点: 作者认为这很危险。
- 类比: 想象一位医生说:“别告诉我病人是否发烧。只给我体温,让我来猜。”
- 问题: 人类在没有明确界限的情况下,很难做出二元决策(是/否)。如果你移除了阈值,你并没有移除决策;你只是隐藏了那条线。最终,仍有人必须决定结果是否“足够好”。
- 置信区间: 论文同意我们应该报告置信区间(可能值的范围),但它认为这些不应取代p 值。它们应像地图和指南针一样协同工作。
5. “严重性”检验:审视数据的新视角
论文引入了哲学家 Mayo 提出的严重性(Severity)概念。
- 核心思想: 仅仅通过测试是不够的。你必须问:“如果该假设是假的,它通过此测试的可能性有多大?”
- 隐喻: 想象一名嫌疑人通过了测谎仪。
- 标准测试: “他们通过了,所以他们是无辜的。”
- 严重性测试: “如果他们有罪,这台特定的测谎仪会抓住他们吗?如果机器坏了,让所有人都能通过,那么“通过”就证明不了任何东西。但如果机器非常严格,而他们仍然通过了,那就是严重的无罪证据。”
- 作者建议利用这种“严重性”思维来深入挖掘数据,而不仅仅是看一个单一的数字。
6. 现实案例:非洲大草原的火灾
为了证明这些工具的有效性,作者分析了非洲火灾的数据。
- 问题: 火灾是否每 5 年发生一次循环?
- 结果: 数学分析显示了一个强烈的模式(极低的 p 值)。
- 应用: 作者没有仅仅说“结果显著”。他们利用严重性概念指出:“我们有 95% 的把握认为该循环是真实的,而非偶然。”他们还使用置信区间来确切展示该循环的强度。
- 教训: 这些工具协同工作,无需改变游戏规则,就给出了清晰、自信的答案。
最终裁决
论文得出结论:我们正处于十字路口。
- 不要抛弃工具: p 值和显著性检验对于区分真实科学与噪音仍然有用。
- 不要仅仅收紧螺丝: 将阈值改为 0.005 可能会减少误报,但也会掩盖真正的发现。
- 明智地使用工具: 科学家应成为工具的主人,而非奴隶。他们应结合使用 p 值、置信区间和严重性检查,以做出明智的决策。
- 真正的敌人: 问题不在于数学,而在于行为。诸如“数据挖掘”(不断搜索模式直到找到一个)和“随意停止”(一旦得到好结果就停止实验)等行为才是导致不良科学的真正原因。改变 p 值阈值无法纠正不良行为;只有更好的伦理和激励机制才能做到。
简而言之: 论文主张,我们不应惊慌失措并重写统计学规则。相反,我们应该信任现有工具,以更细致的方式使用它们(例如检查“严重性”),并专注于纠正导致不良科学的人类行为。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。