Simultaneous false discovery rate control in location families
本文提出了对 Benjamini-Hochberg 程序的一种推广,以控制位置族中所有参数值下的错误发现率曲线,并证明标准程序本质上也为实际无关紧要的值提供了这种同时控制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名侦探,正在试图破解一起拥有数百条线索的庞大案件。你有一份嫌疑人名单(假设),并希望找出有罪者(发现)。然而,你清楚自己有时会犯错,冤枉无辜者。在统计学中,这种错误被称为“错误发现”。
几十年来,侦探们一直使用一本名为本杰明 - 霍奇伯格(BH)程序的标准规则手册。这本手册帮助你决定逮捕多少嫌疑人,同时确保你意外逮捕的无辜者比例(即“错误发现率”或 FDR)保持在安全限度以下,例如 5%。
问题:“零”盲区
传统规则手册只关心“无辜”的一个特定定义:那些完全未做任何事的人(参数值恰好为零)。
- 旧方法:“如果你逮捕了 100 人,请确保其中不超过 5 人完全未做任何事。”
- 现实世界:但如果你并不在乎那些完全未做任何事的人,却在乎那些做了些微乎其微、实际上无关紧要之事的人呢?也许某种药物将血压降低了 0.0001%。从技术上讲,这并非“零”,但实际上毫无用处。旧规则手册无法保护你免受意外逮捕这些“实际上无用”嫌疑人的风险。
新发现:“免费午餐”
本文作者高子君、胡文杰和赵清源发现了一个令人惊讶的“免费午餐”。他们发现,标准规则手册(BH)提供了一项此前无人察觉的额外免费功能。
他们引入了一个名为FDR 曲线的概念。与其仅仅检查“零”处的错误率,不如想象一个滑动标尺。
- 左侧:完全未做任何事的人(零)。
- 中间:做了些微小事的人(实际上不显著)。
- 右侧:做了巨大之事的人(显著)。
该论文证明,如果你使用标准规则手册来控制“零”处的错误,你自动也会获得针对标尺上“实际上不显著”一侧的极强安全网。这就像买了一张电影票,结果发现还免费获得了爆米花、苏打水和毛毯。你并未额外为毛毯付费,但因为你购买门票的方式,你依然得到了它。
“广义”工具
作者们还构建了一个新的、更灵活的工具。想象标准规则手册是一条僵硬的直线,而新工具允许你绘制自定义的安全曲线。
- 你可以说:“我希望‘无’的错误率为 5%,但希望‘微小效应’的错误率为 10%,‘中等效应’的错误率为 20%。”
- 新工具会根据这条自定义曲线,为每位嫌疑人计算一个特殊的“调整分数”。
- 神奇之处:即使面对这种复杂、自定义的曲线,数学也能保证你的实际错误率将始终低于你的目标曲线。
“相切”点
这是他们数学中最引人入胜的部分。他们证明,无论你如何绘制自定义安全曲线,你获得的实际保护(即“真实”曲线)都至少会在某一点上与你目标线相切。
- 想象一个气球(你的实际安全)被压向一个金属线框(你的目标)。气球总会在线框的某处与其接触。
- 这意味着你无法通过欺骗系统来获得完美的全方位保护;总有一个“最紧”的点,你的保护恰好是你所要求的,而在其他所有地方,你的实际保护都比你所要求的更安全。
现实世界案例:癌症研究
作者在涉及乳腺癌基因的真实数据集上测试了这种方法。他们考察了两种测量数据的方式:
- 效应量:基因表达变化的幅度。
- 信噪比:信号相对于背景噪声的清晰度。
他们发现,当他们使用新方法为不同级别的“有用性”设定严格规则时,标准方法(即“免费午餐”)实际上比他们预期的表现更好。在某些情况下,仅使用一条简单规则(例如“在零处控制”)就足以确保整条曲线的安全,从而免去了为每种场景进行复杂计算的必要。
总结
- 旧观点:我们仅控制“零”效应的错误。
- 新观点:控制“零”效应会自动控制“微小”效应,且往往比我们想象的更好。
- 工具:你现在可以绘制自定义的安全地图,定义什么算作“错误”,而数学保证你不会越界。
- 启示:标准方法比我们意识到的更强大,而我们如今拥有一种灵活的方式来定义什么是“显著”,同时不失去我们的安全网。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。