Automated reproducibility assessments in the social and behavioral sciences using large language models
本研究表明,大型语言模型可以作为社会与行为科学中自动化可复现性评估的可扩展筛选工具,在实现与人类重新分析者相当的定性结论的同时,支持而非取代专家判断,以用于系统性审计。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,科学的世界就像一座巨大且繁忙的图书馆,研究人员在这里撰写关于人类如何思考、行动和互动的书籍。长期以来,这座图书馆一直笼罩着一种挥之不去的担忧:有时,当其他专家试图阅读原始笔记并重新进行数学计算时,却得不到相同的答案。这被称为“重复性危机”。这就像是你按照巧克力蛋糕的食谱去制作,但当你亲自动手尝试时,最后得到的却是一碗汤。在社会科学和行为科学领域——这些学科研究诸如我们为何投票、如何学习或是什么让我们感到幸福等问题——检查这些“食谱”是非常困难的。这通常需要雇佣一支专家厨师(科学家)团队,花费数周或数月的时间在厨房里,试图弄清楚究竟使用了哪些原料以及它们是如何混合的。对于书架上的每一本书都这样做,既缓慢又昂贵,而且极其困难。
欢迎这位新来的小伙伴:大语言模型(LLM)。你可能知道它们是那些可以写故事、回答问题甚至编写计算机代码的超智能 AI 聊天机器人。把 LLM 想象成一名不知疲倦、动作极快的学徒厨师,他可以阅读食谱,查看原料,并能瞬间尝试自己烘焙出那个蛋糕。科学家们一直在问的一个大问题是:这个数字学徒真的能胜任这份工作吗?它能否查看一篇已发表的研究,找到数据,运行数字,然后告诉我们最初的结果是真的还是仅仅是一个偶然?如果它能做到,它将永远改变这座图书馆,将一个需要数年的过程缩短为几分钟,从而帮助我们更加信任书架上的书籍。
这篇论文讲述了一个关于寻找那个“数字学徒”是否已经准备好进入厨房的大规模实验的故事。由来自德国和美国大学的团队领导的研究人员设计了一个巨大的测试,涉及来自心理学、经济学和政治学的 180 项真实研究。他们给一个 AI 模型(具体来说是一个名为 Claude Opus 4.7 的版本)提供了原始数据和“食谱”(研究的结论),并要求它重现结果。他们对每项研究进行了五次测试,以观察 AI 的一致性,就像把同一个蛋糕烤五次,看看每次出来的结果是否都一样。
结果呈现出一种“惊叹”与“困惑”交织的状态。AI 在理解大局方面表现得非常出色。在 80% 的案例中,AI 在判断主要观点是否正确方面与原始研究达成了一致。这就像学徒说:“没错,这个蛋糕绝对是巧克力的,”就像原配方厨师说的一样。然而,当涉及到精确的测量——比如蛋糕的具体大小或精确的糖量——AI 就显得有些吃力了。只有大约 24% 的情况下,AI 得到的精确“效应量”(衡量结果强度的特定数值)落在了一个非常紧密的误差范围内。在其他情况下,AI 做出的蛋糕虽然仍是巧克力的,但可能比原版更甜一些,或者稍微干了一些。
为了看看 AI 与人类相比表现如何,研究人员观察了一组较小的研究样本,在这些研究中,人类专家也曾尝试过重新进行数学计算。在这里,AI 表现得相当不错,在 40% 的案例中匹配了原始发现,这实际上比人类专家的表现还要好,因为人类专家仅在 28% 的案例中实现了匹配。人类和 AI 都似乎在如何混合原料方面做出了不同的选择,这在科学研究中是很正常的,但 AI 在紧贴原始食谱方面表现得令人惊讶地好。
团队还测试了 AI 是否需要整本食谱,还是只需要一个简短的摘要。他们给了 AI 完整的论文、去掉了“如何操作”部分的论文,以及仅仅只有摘要(开头部分的简短总结)。令人惊讶的是,这三者之间的差别并不大;AI 在这三种情况下的表现几乎相同。这表明,即使没有每一个细节,AI 也能根据主要目标推测出正确的步骤。他们甚至尝试了不同的 AI 模型,包括一些免费且任何人都可以使用的开源模型,它们给出的结果都非常相似。
那么,最终结论是什么呢?论文指出,这些 AI 模型尚未成为能够完全取代人类专家的完美大师级厨师。有时 AI 会卡住,找不到正确的原料,或者出现计算错误。但它是一个极其强大的工具,可以充当“初步筛选器”。想象一位图书管理员,他可以快速扫描每天的 100 本书,并标记出那些看起来可疑的书籍,这样人类专家就只需把时间花在那些棘手的书上。作者认为,虽然 AI 不应成为最终的裁判,但它可以作为一个可扩展、快速且有帮助的助手,让科学变得更加严谨和值得信赖,帮助我们在错误变成永久历史的一部分之前就将其捕捉到。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。