← 最新论文
📊 statistics

How accurate are Bayes factor-based null hypothesis tests? A simulation study

这项模拟研究通过使用 brms 和 bridgesampling 包,验证了常见心理学设计中基于贝叶斯因子(Bayes factor)的零假设检验的准确性,证明了在未出现算法警告时估计结果是可靠的,但若出现此类警告,则应忽略这些估计。

原作者: Daniel J. Schad, Martin Modrák

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Daniel J. Schad, Martin Modrák

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜团的侦探:一个新线索究竟是真的证明了你的嫌疑人有罪,还是仅仅是一个巧合?在科学世界中,特别是在心理学和语言学等领域,研究人员经常面临同样的问题。他们拥有数据,并且有两个相互竞争的故事:一个是特定效应确实存在的“有罪”故事,另一个是其实什么也没发生的“无罪”故事。为了决定哪个故事更好,科学家们使用了一种叫做“贝叶斯因子”(Bayes factor)的数学工具。你可以把贝叶斯因子想象成一个极其精确的秤,用来衡量证据的重量。如果天平大幅向“有罪”的故事倾斜,研究人员就会感到信心十足;如果天平保持平衡,他们就知道证据很微弱。

然而,计算这个天平上的精确重量,往往就像是在一艘移动的小船上试图数清沙滩上的每一粒沙子一样。要做到完美地计算在数学上是不可能的,所以科学家们使用聪明的计算机捷径来获得一个“近似值”。大的担忧在于:这个近似值与真相有多接近?如果计算机的猜测偏离了,侦探可能会冤枉一个无辜的人,或者放走一个有罪的人。这正是 Daniel J. Schad 和 Martin Modrák 在一项新研究中所探讨的问题。他们想知道,科学家用来衡量这些贝叶斯因子的流行计算机工具是否真的准确,或者它们是否在以一种可能导致错误结论的方式在秘密地“失灵”。

为了测试这一点,作者们不仅仅是观察真实数据;他们建立了一个“模拟实验室”。想象一下,他们创建了数千个预先知道答案的虚假实验。他们根据特定的规则生成虚假数据,然后要求计算机工具计算贝叶斯因子,看看工具得出的结论是否与他们预先埋下的真相相符。他们重点研究了心理学和语言学中使用的三种非常常见的实验设计:简单的 2x2 设计、一种混合受试者和项目的设计(例如不同的人阅读不同的单词),以及这种混合设计的更复杂版本。

结果呈现出两种截然不同的局面,这取决于一个微小的细节:一条警告信息。当计算机软件运行其计算且没有显示警告信息时,贝叶斯因子是非常精准的。天平得到了完美的校准;工具对证据的估计与真相几乎完全一致。这就像是侦探的天平运作完美,每次都能给出可靠的判决。

然而,当软件发出警告时,故事发生了戏剧性的变化。在计算机提示“嘿,我在估算这个数字时遇到了困难”的模拟中,结果变得不可靠。贝叶斯因子不再准确;它们变得有偏差且波动剧烈。有时,工具会夸大证据,使一个微弱的效应看起来很强(“宽松”偏差);有时则会贬低一个真实的效应,使其看起来像是什么都没发生(“保守”偏差)。作者发现,在这些出现警告的情况下,计算机本质上是在带有大量噪声进行猜测,其结果是不可信的。

有趣的是,作者尝试通过让计算机“更努力地工作”来解决这个问题——即增加计算步骤(从 10,000 次迭代增加到 40,000 次)。虽然这略有帮助,但并没有阻止警告的出现,也没有完全修复偏差。这项研究表明,问题不仅仅在于做更多的数学运算,而在于数据的形态对于目前的快捷算法来说过于棘手,无法平滑处理。

那么,这对科学的未来意味着什么呢?作者得出结论:对于他们测试的常见实验设计,贝叶斯因子是一个伟大的工具——但前提是计算机保持沉默。如果软件闪烁警告,研究人员应该停下来,不要相信该结果。这有点像开车:如果“检查引擎”灯没亮,你可以充满信心地驾驶;但如果这个灯在闪烁,你不应该仅仅忽略它并继续加速,你需要停车并解决问题,然后再去信任你的时速表。这项研究是一个至关重要的提醒:在科学发现的高风险游戏中,关注计算机的警告信号与关注数据本身同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →