← 最新论文
📊 statistics

The Benjamini--Hochberg Procedure Can Fail to Control the FDR for Correlated Two-Sided Gaussian Tests

本文通过证明 Benjamini–Hochberg 程序在处理相关的双侧高斯检验时,无法将其错误发现率控制在标称水平上,从而推翻了一个长期存在的猜想,该结果通过区间算术进行了严格证明并由作者进行了验证。

原作者: Edgar Dobriban

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Edgar Dobriban

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名试图在一间充满诚实人的房间里抓捕一群骗子的侦探。你拥有一本特殊的规则手册(本杰明-霍奇伯格程序,Benjamini–Hochberg procedure),它会告诉你如何在不误伤过多无辜旁观者的情况下大喊“抓到了!”。几十年来,统计学家们一直认为这本规则手册是不可撼动的。他们认为,即使房间里的人在互相窃窃私语(相关数据),规则手册仍能将错误指控的数量严格控制在一定限度之下,比如 1% (0.01)。

但一篇在名为 GPT-5.6 Pro 的超级智能 AI 帮助下完成的新论文,刚刚揭穿了这一信念。

重大发现:规则手册存在漏洞
作者们展示了对于一种特定的棘手情况——即当这些“测试”是双侧高斯数(think of them as measurements that can wiggle up or down from zero,想象成可以上下摆动的测量值)时——规则手册实际上会失效。事实证明,当这些测量值以一种非常特定且狡猾的方式相关联时,规则手册会让错误指控率稍微超过限制。

虽然这个数字很小,但在严谨的数学世界里,它是巨大的裂痕。错误报警率并没有停留在安全的 1%,而是上升到了 0.0104。这只是一个微小的数字,但在严格的数学领域,这相当于在大坝上撕开了一个巨大的缺口。论文并不仅仅是在猜测,它构建了一个严密的“证书”(就像一份数学安全检查员的报告),证明了随着测试数量的增加,该比例必然高于 0.01。

“狡猾因子”模型
他们是如何找到这个漏洞的?他们构建了一个虚构的世界,一个“因子模型”,来测试这本规则手册。想象一个巨大的房间,里面有三组人:

  1. 诚实人群 (占房间的 96%): 他们是真正的零假设(true nulls)。他们应该是清白的。
  2. 信号组 A (占房间的 1%): 他们是“真实”的信号,朝着一个方向移动。
  3. 信号组 B (占房间的 3%): 他们也是“真实”的信号,但朝着另一个方向移动。

这里的转折在于,房间里的每个人都在聆听一位隐形的指挥家(一个被称为 Z 的潜在因子)的指挥。

  • 诚实人群随指挥家的动作而动。
  • 信号组则逆着指挥家的动作而动,但速度不同。

当指挥家挥动手棒的方式特定时,信号会变得更响,使得规则手册频繁地大喊“抓到了!”。但与此同时,“诚实人群”也会变得有些焦躁不安,使得他们的行为边缘(tails)看起来极像那些信号。这造成了一场完美的风暴:规则手册产生了混乱,拒绝了过多的无辜者,导致错误发现率飙升,恰好突破了 1% 的界限。

他们有多确定?
这不仅仅是“也许”或“我们认为”。作者们对此非常有信心。

  • 证明过程: 核心论证是由 AI 生成并由人类作者仔细检查的。他们使用了一种称为“区间算术”(interval arithmetic)的方法,这就像是在做数学时带有一个安全余量,确保即使考虑到舍入误差,答案也绝不会出错。他们证明了,对于足够多的测试,该比例严格大于 0.0104
  • 模拟实验: 为了支持这一点,他们运行了计算机实验(蒙特卡洛模拟)。当他们测试 200 组数据(总计 20,000 次测试)时,计算机测得的错误发现率为 0.010359。这在统计学上高于 1% 的限制,证实了他们在现实模拟中的理论。

这意味着什么(以及并不意味着什么)
这篇论文明确排除了“本杰明-霍奇伯格程序对所有相关的双侧高斯测试都是安全”的观点。二十年来,专家们一直认为它是安全的;而这篇论文说:“事实上,并非如此。”

然而,论文谨慎地指出,这并不代表规则手册毫无用处。这种违背是非常微小的(0.0104 对比 0.01),并且发生在测试数量庞大的特定构建场景中。作者承认,他们不知道这种情况是否也会发生在较少数量的测试中,也不确定是否存在一个通用的上限。他们也尚未在基因或股票等现实世界的数据上进行测试;他们构建的是一个数学模型来证明这一点。

因此,下次当你听到某种统计方法被“证明”在任何条件下都有效时,请记住这篇论文:有时候,最受信任的工具也有一个微小的、隐藏的裂缝,只有通过一位超级聪明的侦探(以及一点 AI 的帮助)才能将其发现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →