← 最新论文
📊 statistics

The Difference Between "Replicable" and "Not replicable" is not Itself Scientifically Replicable

本文认为,在非精确实验中汇总二元复制裁决无法可靠地区分“可复制”与“不可复制”的结果,因为固有的异质性造成了不可约减的不确定性和无法识别的方差,从而动摇了用以宣告复制危机的统计基础。

原作者: Berna Devezer, Erkan O. Buzbas

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Berna Devezer, Erkan O. Buzbas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创造性类比对这篇论文的解释。

核心理念:为何我们难以轻易区分“真”科学与“假”科学

想象你是一位法官,试图判断一道新食谱是“好”还是“坏”。你请了 50 位不同的厨师来尝试制作。

  • 如果 45 位厨师说:“味道很棒!”而 5 位说:“太糟糕了”,你可能会得出结论:这道食谱是可复现的(好的)。
  • 如果 25 位说“很棒”,25 位说“太糟糕”,你可能会得出结论:它不可复现(坏的)。

这篇论文认为,这种判断方式是有缺陷的

作者伯纳·德韦泽(Berna Devezer)和埃尔坎·O·布兹巴斯(Erkan O. Buzbas)指出,在现代科学中,我们无法仅通过统计不同实验室中结果成功的次数,来可靠地区分“好”结果与“坏”结果。即使你进行数千次实验,数学表明,“可复现”与“不可复现”之间的界限是看不见的。

核心问题:“完美复制”的神话

要理解原因,我们需要看看什么是真正的“复现”。

  • 精确复现:这就像一台复印机。你取出一份文件,机器吐出一份完全相同的副本。在科学中,这意味着每一个细节(相同的人员、相同的设备、相同的时间、相同的指令)都完全一致,唯一变化的是随机运气。
  • 现实情况:精确的副本几乎是不可能的。在现实生活中,复现更像是手工抄写文件。一个人用蓝笔,另一个人用铅笔;一个人在书桌上写,另一个人在火车上写;一个人疲惫,另一个人精力充沛。

论文将这种现象称为**“非精确性”**。因为每个实验室都略有不同,所以每个实验也略有不同。

两种模型:“共享秘密”与“独立博弈”

作者使用两个统计模型来解释当我们混合这些不完美副本时会发生什么。

1. 基准模型(“共享秘密”)
想象一群厨师,他们都秘密地遵循着同一份主食谱,但他们都稍微不太擅长阅读它。

  • 如果食谱“难以阅读”(高非精确性),即使你让 1,000 位厨师尝试,他们的结果仍然会杂乱无章。
  • 教训:精确度有一个“底线”。无论你增加多少厨师,不确定性永远不会消失,因为食谱本身的“杂乱”才是问题所在,而不是厨师的数量。

2. 操作模型(“独立博弈”)
这才是科学实际运作的方式。每个实验室运行自己独特的实验,并报告一个简单的“是”(成功了)或“否”(失败了)。

  • 作者表明,当你从每个实验室只得到“是/否”答案时,你就失去了关于实验室之间如何不同的所有信息。
  • 类比:想象你试图猜测一座城市的平均气温。
    • 情景 A:你让 100 个人看同一支温度计。他们都看到了同一个数字,但也许他们都看错了。
    • 情景 B:你让 100 个人看 100 支不同的温度计。有些坏了,有些在阳光下,有些在阴影里。
    • 如果你只问他们“热吗?(是/否)”,你就无法区分情景 A 和情景 B。你得到的只是一份“是”和“否”的清单。你完全不知道是温度计坏了,还是天气本身就混乱不堪。

“复现危机”是一种统计幻觉

这篇论文认为,著名的“复现危机”(即一半科学是虚假的)可能是一种由糟糕的数学引起的误解。

  • 陷阱:科学家常说:“我们尝试复现了 100 项研究,只有 36% 成功了。因此,科学正处于危机之中。”
  • 现实:作者指出,36% 只是一个将苹果和橘子混为一谈的数字。因为每个实验室都不同(非精确性),这"36%"并不能告诉我们原始科学是否糟糕,还是仅仅因为实验室无法就如何测量达成一致。
  • 裁决:你不能看着一份“是/否”的结果清单就说:“这个结果绝对是真实的”或“这个结果绝对是虚假的”。数据结构本身就不包含足够的信息来做出这种判断。

为何“更多复现”无法解决问题

通常,我们会想:“如果我们不确定,那就做更多实验吧!”

  • 论文的转折:如果实验是“非精确”的(不同的实验室、不同的人、不同的工具),那么增加更多实验就像是在一个房间里增加更多人,而每个人都在用不同的语言大喊大叫。你只会得到更多的噪音。
  • “有效样本量”:作者表明,一项拥有 100 个不同实验室的研究,其统计效力可能仅相当于5 或 6 次完美的、完全相同的实验。实验室之间差异的“噪音”抵消了拥有更多实验室带来的好处。

“多实验室 4"(Many Labs 4)示例

作者在一个名为“多实验室 4"的真实项目中测试了他们的理论,该项目中 17 个实验室试图复现一个关于思考死亡的著名心理学实验。

  • 结果:这些实验室各不相同。有些在线进行,有些面对面进行。有些使用了不同的问题。
  • 数学计算:当他们计算这 17 个实验室的“杂乱程度”(异质性)时,发现其程度之高,以至于数据根本不可能告诉他们原始结果是真还是假。“是/否”的答案太过模糊。
  • 结论:即使是一个庞大且资金充足的项目,数据也太过“模糊”,无法宣布赢家。

总结:我们应该怎么做?

作者并非说我们应该停止科学或停止复现。

  • 复现仍然是好的,用于学习事物如何运作、找到正确的测量方法以及理解细节。
  • 复现是坏的,当我们试图将其用作简单的“通过/失败”测试,以宣布整个科学领域处于“危机”或“成功”时。

最终隐喻
试图通过统计不同实验室投出的“是/否”票来决定科学结果是否“真实”,就像试图通过让 100 个人向你哼唱歌曲来评判歌曲的质量。有些人会用不同的调子哼唱,有些人会忘记歌词,有些人会哼得更快。如果你只是统计有多少人“唱对了”,你并不是在评判歌曲,你只是在评判人群模仿歌曲的能力。

论文得出结论:我们目前用来宣布科学“危机”的工具,在数学上无法完成被分配的任务。我们无法用当前的方法可靠地划清“可复现”与“不可复现”之间的界限。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →