← 最新论文
💻 computer science

The Replication Assessment Problem in Software Engineering

本文通过对近期文献进行系统综述以识别方法论缺陷,并提出一个基于原则且具有统计学依据的框架来标准化评估标准,旨在解决软件工程领域中复制研究评估方式存在的不一致性和歧义性问题。

原作者: Giuseppe Destefanis, Martin Shepperd, Leila Yousefi

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Giuseppe Destefanis, Martin Shepperd, Leila Yousefi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

把科学想象成一场巨大的、全球性的“传声筒”游戏,只不过科学家们传递的不是耳语,而是复杂的思想和实验。在软件工程领域,研究人员构建工具、测试理论并编写代码来解决问题。但问题在于:仅仅因为一个团队说“嘿,这段代码运行得完美无缺!”并不意味着它会对其他人也同样有效。这就是**重复实验(Replication)**发挥作用的地方。重复实验就像是邀请另一组朋友用同样的规则玩同样的游戏,看看他们是否能得到相同的分数。这是终极的真相检查。如果第一支队伍赢了,第二支队伍也赢了,我们就能相当确定这场游戏没有作弊。但如果第二支队伍输了,或者得到了一个异常不同的分数,我们就不得不追问:是他们玩错了?是第一支队伍运气好?还是这个游戏本身就太复杂,以至于无法两次以同样的方式进行?

那个一直困扰着科学家的重大问题是:我们如何决定第二支队伍到底是“赢”了还是“输”了? 在过去,这就像裁判根据直觉大喊“进球!”或“没进!”,或者只是看着计分板说:“嗯,他们已经很接近了,我想也就这样吧。”但如果没有明确的规则手册,一位裁判可能会判定一场比赛成功,而另一位裁判却可能判定为失败,即便两者的得分完全相同。这使得建立可靠的知识体系变得不可能,因为我们不知道哪些游戏是真正值得重玩一次的。


伟大的计分卡之谜

在这篇论文中,Giuseppe Destefanis、Martin Shepperd 和 Leila Yousefi 决定扮演侦探的角色,去破解软件工程师是如何评判这些重复实验游戏的谜团。他们并没有发明一种新游戏;他们只是观察了过去几年(具体为 2021 年至 2025 年间发表的研究)中的计分卡,以观察裁判的工作表现如何。

他们总共发现了 10 项试图重复以往软件实验的近期研究。当他们开始阅读这些计分卡时,意识到裁判们使用的是一套混乱的规则组合。这感觉就像有些裁判在使用尺子,有些在使用魔力 8 号球,而有些则仅仅是根据玩家的表现进行猜测。

计分板上的混乱
作者发现,这些研究的评判方式是五花八门的。

  • “直觉”问题: 在好几个案例中,研究人员直接使用了“专家判断”。这就像一名裁判说:“我看了一下比赛,感觉像是赢了,”却没有任何数字支撑或解释原因。在 10 项研究中有 3 项甚至没有清楚说明最终结论的依据。它就像一个神秘盒!
  • “混杂”陷阱: 有三项研究决定跳过“这次特定的重复实验是否成功?”这一问题,而是直接将原始游戏和新游戏的所有数据全部倒进一个大罐子里取平均值。作者称之为“合并(pooling)”。虽然混合数据在后期可能有用,但论文指出,你不能直接跳过“检查新游戏是否与旧游戏匹配”这一步骤。这就像是在说:“我们不知道这个新球员好不好,但如果把他们的统计数据和旧队混在一起,平均水平看起来还行!”
  • 缺失的工具: 论文指出,裁判们并没有使用现有的最佳工具。他们没有使用“预测区间”(这就像是在计分板上画出一个安全区域,看新分数是否落在预期范围内)或“贝叶斯方法”(一种随着新证据出现而更新信念的高级方法)。相反,他们经常依赖简单的“是/否”检查,这可能会忽略情况的细微差别。

结论各不相同
当作者查看这 10 项研究的最终结果时,答案令人困惑:

  • 5 项研究称重复实验是“部分”或“混合”的。
  • 2 项称其为“成功”。
  • 1 项称其“失败”。
  • 1 项称其“不确定”。
  • 1 项研究尽管进行了 11 次新的实验,却连最终结论都没有给出!

作者发现最大的问题在于,如果没有在游戏开始前写下清晰的规则,就无法知道一次“成功”是真的还是仅仅是运气好。例如,一项研究声称重复实验成功,仅仅是因为专家觉得它成功了,却没说出什么样的数字才算失败。另一项研究比较了两个数字,但并未说明它们需要多接近才能算作匹配。

新的规则手册

由于这种混乱局面,作者提出了旨在修复计分卡的一套全新的四项原则。他们并不是说已经解决了整个问题,而是提供了一个让事情变得更公平的起点。

  1. 先写好规则: 在你看到结果之前,必须写下什么算赢,什么算输。你不能在比赛结束后,仅仅因为你喜欢那个分数就临时决定规则。
  2. 检查“契合度”,而不只是“胜负”: 不要只问“他们是否得了高分?”,而要问“新分数是否落在旧分数的安全区域内?”这是关于观察结果是否兼容,而不仅仅是看它在统计学上是否显著。
  3. 不要跳过检查: 你不能为了避免检查新实验是否真正奏效的繁琐工作,就直接把所有数据混合在一起(合并)。你必须先检查单个游戏。
  4. 承认“我不知道”也没关系: 如果数据太模糊或数值范围太宽,说结果是“不确定的”比强行给出一个“成功”或“失败”的结论更好。承认不确定性比假装知道自己并不了解的事情更诚实。

为了展示这套规则如何运作,作者选取了一项令人困惑的研究(在该研究中,专家仅表示“它奏效了!”),并使用他们的新规则对其进行了重新评估。在新的系统下,由于原始研究没有写明规则和数字,其结论会从“成功”变为“不确定”。这并不意味着实验失败了,它只是意味着我们目前还没有足够的信息来断定它奏效了。

核心结论

论文得出结论,目前的软件工程重复实验有点像一场裁判随心所欲制定规则的游戏。通过采用这些新原则——预先制定规则、检查兼容性以及对不确定性保持诚实——我们可以开始建立一个所有人都能信任的知识体系。作者承认他们只观察了 10 项研究,因此这仅仅是对话的开始,而非最终答案。但如果我们想要知道哪些软件工具和理论是真正可靠的,我们就必须停止猜测,开始按照清晰、共享的规则手册进行游戏。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →