E-Values For Multiplicity Control In Multiverse Analysis
本文提出在广义线性模型中使用 p-to-e 校准,以有效控制多元分析中的错误发现率,并证明该方法在统计功效方面显著优于通用型和软秩型 e-值,同时成功识别了技术使用与青少年心理健康问题之间的关联。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名试图破解谜团的侦探,但你面对的不是单一的线索,而是一个装有数千个潜在线索的大箱子:不同类型的证据、各种嫌疑人,以及无数种将它们拼凑在一起的方式。在科学领域,这被称为“多元宇宙分析”(multiverse analysis)。这是一种研究方法,研究人员不仅仅选择一种观察数据的方式,而是尝试许多不同的处理方式、结果和分组组合,以观察某种模式是否在所有情况下都成立。你可以把它想象成在每一种可能的地图、使用每一个角色、并在每一种天气条件下测试一种新的电子游戏策略,以看看它是否真的有效。
然而,这个游戏中有一个棘手的陷ual。如果你尝试了足够多的组合,即使该策略实际上很糟糕,你也最终会仅仅因为纯粹的运气而发现一个“获胜”模式。这就是“假阳性”(false positives)的问题。为了防止研究人员被运气所蒙蔽,统计学家使用工具来控制“错误发现率”(False Discovery Rate, FDR)。你可以把 FDR 想象成一名质量控制检查员,他负责确保如果你声称找到了宝藏,那么这件东西极有可能是真金而非仅仅是闪亮的石头。一种流行的工具是“p值”(p-value),它告诉你你的结果有多令人惊讶。但有一种更新、更坚固的工具叫做“e值”(e-value)。你可以把 e 值看作是一种投注得分:如果你押注 1 美元赌你的结果是真的,e 值会告诉你你的这笔赌注值多少钱。如果 e 值很高,说明你的赌注回报丰厚;如果 e 值很低,说明你可能只是在瞎猜。
这篇论文是关于寻找在使用这些“e 值”投注得分进行大规模“多元宇宙”游戏(即同时测试许多事物)时,如何使用最佳方法。作者 Paul Rognon-Vael 和 David Rossell 想知道:哪种计算 e 值的方法才是最敏锐的侦探?他们测试了三种不同的策略,以观察哪种方法能在不被噪音误导的情况下发现真实效应。他们运行了数千次计算机模拟——就像在虚拟世界中玩了数百万次侦探游戏一样——以观察哪种方法能找到最多的真实线索,同时忽略那些虚假的线索。
以下是他们的发现。他们发现并非所有的 e 值计算器都是平起平坐的。一些被称为“通用 e 值”(universal e-values)和“软秩 e 值”(soft-rank e-values)的方法非常安全但也非常胆小;它们很少发出警报,即使存在真实的效应也未必能发现。这就像是一个由于太害怕虚假警报而让真正的窃贼从身边走过的保安。然而,第三种方法,他们称之为“p 转 e 校准”(p-to-e calibration),则要有效得多。这种方法通过特定的数学配方将传统的 p 值转换为 e 值。在他们的模拟实验中,这种“校准”后的方法成为了冠军:它比其他两种方法发现了显著更多的真实效应,同时仍将虚假警报率控制在一定范围内。
作者随后将他们最好的方法应用于一个关于青少年的真实数据集。他们研究了不同类型的技术使用(如看电视、玩电子游戏、上网或使用社交媒体)与心理健康问题(如抑郁、自尊心低和同伴问题)之间的联系。在之前的一项使用不同方法的研究中,研究人员得出的结论是,技术使用对青少年的心理健康几乎没有影响。但当作者使用他们这种更敏锐的新型 e 值工具时,他们发现了一个完全不同的故事。他们发现了重度使用互联网和社交媒体与特定心理健康挣扎之间的强有力且显著的联系。例如,他们发现重度使用互联网的青少年更有可能报告自尊心低和抑郁症状,且其父母报告的同伴问题也更多。对于这些问题的发生概率,重度使用者是普通人的 2 到 4 倍。
论文指出,虽然 e 值是在这些复杂的“多元宇宙”场景中保持科学诚实的一种强大工具,但它们在拥有大量数据时效果最好。如果样本量太小,即使是最好的 e 值方法也可能会错过信号。但只要数据充足,这种“p 转 e 校准”方法似乎是区分真金与闪亮石头最可靠的方式,它能帮助我们在不迷失在统计噪音的海洋中时,理解技术对我们生活的真实影响。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。