T_root by Default: A Reporting Standard for Independence in Contingency Tables
本文认为,当前列联表统计软件的默认设置由于在稀疏或异质数据中的校准效果不佳而存在根本性缺陷,并提议使用一种名为 的新型单一闭式统计量来取代它们,该统计量无需重采样方法即可提供更优的规模控制和统计功效。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在科学研究的世界里,数据通常以简单的网格形式呈现,研究人员通过统计落在不同类别中的人数来进行计数。想象一张比较两组人群的表格,例如接受新疗法与接受标准疗法的患者,并检查他们是康复了还是未康复。为了判断该疗法是否确实产生了影响,科学家们使用一种数学工具来计算一个数值,这个数值能告诉他们所看到的模式是真实的,还是仅仅是随机的偶然现象。几十年来,标准做法一直是依赖两种特定的工具来完成这项工作。其中一种工具因其“精确”而闻名,这意味着它在计算概率时不进行宽泛的猜测;而另一种则是经典方法,在数据充足且分布均匀时表现良好。然而,一项新的分析表明,目前软件选择这些工具的方式存在缺陷,导致在绝大多数现实世界的研究中产生了误导性的结论。问题不在于这些工具本身是损坏的,而在于使用它们的规则过于僵化,导致研究人员要么错失真实的效应,要么看到并不存在的模式。
马萨诸塞大学阿默斯特分校的威廉·J·德怀尔(William J. Dwyer)提出了一种新的标准来修复这一报告错误。他认为,目前每当表格中的数字较小时就自动切换到“精确”工具的做法是一个错误。虽然该工具在计算上很精确,但它过于谨慎,往往会掩盖真实的发现,使证据看起来比实际情况更弱。相反,另一种常用的工具在数据不均匀时则过于急于寻找模式,有时会在没有发现的情况下大声宣布“发现”。作者发现,当数据平衡时,这两种传统方法在寻找真实效应方面的能力实际上是相等的,但当数据杂乱或稀疏时,它们都无法报告正确的确定性水平。该论文并没有强迫研究人员在过于胆怯和过于大胆的工具之间做出选择,而是引入了一个名为 的单一新统计量,该统计量是在一篇配套的方法论文中开发并验证的。该统计量在处理各种类型的数据时都能可靠地工作。
研究通过测试数千个模拟表格,观察旧方法在不同条件下的表现。结果显示,尽管被称为“精确”工具,但它并不能如承诺般控制误差率。因为它只能产生特定的、离散的概率步骤,所以它往往比预期的要严格得多,实际上降低了判定为“发现”的门槛,却未告知任何人。在这些模拟实验中,即使数据清晰地显示出某种联系,该工具也经常无法标记出真实的关联。与此同时,另一种替代工具则经常会标记出仅仅是随机噪声的联系,尤其是在被比较的两组规模差异很大时。研究表明,在这两种方法之间进行选择从来不是关于哪一个在寻找真相方面更有力;两者发现真相的速率是相同的。真正的问题在于校准:在所有类型的表格中,这两种工具都无法被信任去报告正确的置信水平。
为了解决这个问题,作者利用了新的统计量 。这是一个单一的、自包含的公式,它会根据其正在分析的数据表的特定形状和大小进行自我调整。与旧方法不同,旧方法需要复杂的决策树来确定使用哪种工具,而 对每张表的工作方式都是一致的,无论是小而空的网格,还是大而拥挤的网格。在广泛的测试中,这种新方法表现得非常稳健,即使在最困难、最不均匀或最稀疏的情况下,也能报告非常接近目标值的误差率。它还恢复了检测旧版“精确”工具所错失的真实关联的能力,在最具问题的区域,有效地将发现真实信号的能力提升了一倍。该方法速度快,不需要复杂的调整,并且能返回一个单一且清晰的答案,而无需运行数千次计算机模拟。
该论文还查看了来自公共数据集的数千张真实世界表格,以观察现有系统失效的频率。调查结果令人震惊:大约 94% 的被分析表格都属于一种类别,即在这些类别中,默认的软件设置会产生不可靠的结果。在这些情况下,标准工具要么过于保守,要么过于激进,导致对是否存在某种关系得出错误的结论。一个具体的例子涉及一项关于烧伤创口的研究,标准软件显示清洁处理与是否需要手术之间没有显著联系。然而,新方法检测到了明显的联系,将结论从“无效应”转变为“显著效应”,并提供了关于该效应强度更准确的范围。这种判决的逆转并非罕见的异常现象,而是数据科学家每天使用的日常数据中常见的现象。
拟议的解决方案是更改统计软件的默认设置。与其要求用户在不同的测试之间做出选择,或依赖过时的关于小数字的规则,不如让软件自动为几乎所有的表格报告新的 统计量。只有一个例外:如果一个表格非常小且为空,以至于坍缩成一个过于简单的形状无法分析,软件才应退回到传统的“精确”方法。这创造了一个简单且诚实的标准:将新工具用于一切,仅在没有任何其他方法可以工作的极端角落使用旧工具。作者还建议,报告中不仅应包含一个数值,还应包含一个衡量该测试在特定情况下表现如何的指标,以确保读者确切知道该结果的可信度有多高。
这项工作将一个长期的统计学问题重新定义为不再是“选择哪种工具”的谜题,而是“报告标准”的失败。研究表明,“精确计算”与“精确误差控制”之间的混淆导致了几十年的误导性结果。通过采用一种在所有领域都通用的、经过校准的单一统计量,科学界可以确保从数据中得出的结论既有力又诚实。论文总结道,复杂决策树和冲突默认值的时代应该结束,取而代之的是一条无论数据多么杂乱都能报告真相的简单规则。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。