Human-AI Collaboration for Estimating Scientific Replicability
本文介绍并评估了一种混合预测市场,其中基于历史复现数据训练的算法智能体与人类专家协作,以预测科学可复现性,结果表明这种结合方法在生成准确可靠的预测方面,通常优于或至少等同于纯人工智能或纯人类基线。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在猜测一项新科学发现究竟是“真实”的,还是仅仅是一次幸运的偶然。过去,科学家们曾尝试通过两种方式回答这个问题:
- 人类专家组:他们询问一组专家:“如果我们重新运行这项研究,你认为它会成立吗?”
- 机器人专家组:他们将研究的数据和文本输入计算机程序,由程序通过计算数据来做出猜测。
这两种方法都有缺陷。人类可能带有偏见、感到疲惫,或者仅了解科学世界中极小的一部分。机器人速度快且掌握大量数据,但它们可能会忽略微妙的背景信息,或无法理解关于某项研究为何可能站不住脚的“直觉”。
“混合”构想
本文提出:如果我们让人类和机器人在同一空间内共同做出猜测,会怎样?
作者构建了一个预测市场。你可以将其想象成一个股票市场,但人们买卖的不是苹果或特斯拉的股票,而是科学研究的“份额”。
- 如果你认为一项研究会被复现(再次被证实为真),你就买入“会复现”份额。
- 如果你认为它会失败,你就买入“不会复现”份额。
份额的价格代表了群体的信心。如果价格是 70 美分,市场就认为该研究为真的概率是 70%。
实验
研究人员设立了一个数字交易大厅,包含三种类型的团队:
- 全人类团队:仅由真实科学家进行交易。
- 全机器人团队:仅由计算机算法进行交易。
- 混合团队:真实科学家与机器人共同进行交易。
机器人基于数百项过往研究进行训练,以学习模式(例如“样本量小的研究往往失败”)。人类则带来了他们的现实世界专业知识和直觉。他们交易了 12 小时,最终价格即为他们的集体预测。
结果:谁赢了?
结果有点像体育锦标赛,获胜者取决于具体的运动项目:
- 混合团队在大多数情况下是 MVP:在社会学和政治学等领域,人类加机器人的团队最为准确。这就像一位经验丰富的教练(人类)与一位超高速的统计分析师(机器人)协同工作;他们弥补了彼此的盲点。
- 人类在心理学领域获胜:在心理学领域,仅由人类组成的团队表现最佳。机器人并未在此提供太多价值;专家们对材料的了解程度超过了代码所能推断的范围。
- 机器人在市场营销和教育领域获胜:在这些领域,仅由机器人组成的团队实际上比混合团队表现得略好。似乎这些领域的模式更容易被计算机识别,而非被人类解读。
人类是如何表现的?
研究人员询问了人类交易者是如何做出决策的。
- 主要靠“直觉”:大多数人并没有试图超越市场或玩弄复杂的策略。他们仅仅基于自己相信为真的内容进行交易。如果他们觉得某项研究是扎实的,他们就会买入。
- 部分人“随大流”:少数人观察价格变动并跟随趋势。
- 并非“赌徒”:令人惊讶的是,很少有人试图为了赚钱而“操纵系统”。他们主要是在努力确保对科学的判断是正确的。
核心结论
该论文得出结论:将人类与人工智能结合是判断科学真理的有力方式。它并非一种每次都能完美奏效的灵丹妙药,但在许多情况下,“混合市场”比单独依靠人类或机器人更为可靠。这表明,评估科学的最佳方式或许是让计算机承担繁重的数据工作,而由人类提供背景信息和常识。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。