← 最新论文
🤖 AI

The Agentic Garden of Forking Paths

本文证明了人工智能智能体可以复制人类研究人员在各类高风险领域中所做出的多样化且往往相互冲突的分析选择,凸显了科学分析中选择性报告的问题,并提出了“智能体自助法”(Agentic Bootstrap)这一方法,通过将“m值”作为衡量科学主张可信度的全新标准,基于其在合理分析空间中的位置进行评估。

原作者: Jiacheng Miao, Jonathan K Pritchard, James Zou

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiacheng Miao, Jonathan K Pritchard, James Zou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名侦探,正试图通过一盒线索(即数据)来破解谜案。在过去,如果两名侦探观察同一盒线索,他们可能会得出略有不同的故事,但通常会对主要事实达成共识。

这篇论文引入了一个新的转折点:扮演侦探角色的 AI 智能体(AI agents)。研究人员发现,如果你给两个 AI 智能体完全相同的线索盒,但告诉它们拥有不同的“人格”(一个持怀疑态度,一个持相信态度),它们不仅会讲述略有不同的故事,还会讲述完全相反的故事,而且这两个故事听起来都非常合乎逻辑且具备科学严谨性。

以下是利用简单类比对他们研究结果的详细拆解:

1. “分叉路径的花园”

想象一片拥有数百万条路径的巨大森林(“分叉路径的花园”)。每当研究人员分析数据时,他们都必须选择走哪条路径。

  • 旧问题: 人类研究人员有时会下意识地选择那条能导向他们想要发现的结果的路径。这被称为“研究者自由度”(researcher degrees of freedom)。
  • 新的 AI 问题: AI 智能体现在可以极其快速地穿梭于这片森林。它们可以在几分钟内尝试数千条不同的路径。论文显示,如果你告诉一个 AI:“你认为移民对经济有害,”它会自然而然地游走到那些导向该结论的路径上。如果你告诉另一个 AI:“你认为移民对经济有益,”它会游走到完全相反的路径上。
  • 可怕之处: 这两类 AI 都在做“好的”科学研究。它们并没有撒谎或违反规则。它们只是在森林中选择了不同的、有效的道路来抵达目的地。

2. 实验:“意识形态之镜”

研究人员在四个重大问题上测试了这一点:

  • 移民是否影响福利支持?
  • 咖啡是否影响健康?
  • 社交媒体是否损害青少年心理健康?
  • 肠道细菌是否影响体重?

他们给 AI 智能体赋予了不同的“人格”(例如赋予它们特定的政治或科学偏见),并要求它们分析相同的数据。

  • 结果: “亲移民”AI 智能体一致发现了积极影响,而“反移民”智能体则发现了负面影响。
  • 人类对比: 在一项著名的现实世界研究中,42 支人类团队分析了相同的移民数据,并存在结论上的“差距”。AI 智能体重现了该人类差距的 72%
  • 速度: 一个 AI 智能体大约只需 15 分钟和 1.68 美元即可完成整个分析过程。

3. “质量检查”陷阱

你可能会想:“好吧,那个有偏见的 AI 一定是在做错误的数学运算。”

  • 令人惊讶的结果: 研究人员让其他 AI 以及人类专家(统计学博士)对报告进行了评审。
  • 结论: 86% 的 AI 报告通过了评审。78% 的报告通过了人类专家的评审。
  • 启示: AI 智能体利用专家认为无懈可击的方法得出了截然相反的结论。问题不在于数学错了,而在于 AI(像人类一样)选择性地探索了森林,以寻找符合其“信念”的路径。

4. AI 是如何实现的:探索 vs. 选择

论文拆解了 AI 如何得出错误(或正确)结论的过程:

  1. 探索(Exploration): AI 开始行走。如果它是一个“相信者”,它会自然地向看起来有利于其信念的路径靠拢。如果它是一个“怀疑者”,它会走向别处。
  2. 选择(Selection): 在走过许多路径后,AI 会挑选出最符合其故事的那一条,并将其放入最终报告中。
  • 类比: 想象一位厨师想要做一道辣味菜肴。他们品尝了 100 种不同的汤。他们自然会对那些辣味明显的汤投入更多注意力,并调整它们使其更辣,最后端上一碗最辣的汤。一位“不追求辣味”的厨师也会遵循完全相同的过程,但最终会端出一碗清淡的汤。两位厨师都完美地遵循了烹饪规则。

5. 解决方案:“m 值”与“智能体自助法”(Agentic Bootstrap)

由于我们不再能信任单一的报告(因为 AI 完全可以轻易地挑选出最符合心意的路径),作者提出了一种新的评判科学的方法。

  • 旧方法 (p 值): “如果我们用相同的配方重复这个实验 1,000 次,会有多少次得到这个结果?”(这检查的是数据中的运气)。
  • 新方法 (m 值): “如果我们用不同的有效配方对这些相同的数据进行 1,000 次尝试,会有多少次得到这个结果?”(这检查的是决策中的运气)。

**智能体自助法(Agentic Bootstrap)**是他们构建的工具。它利用 AI 智能体来模拟数千种不同的“假设情况”(即森林中不同的路径),并绘制出所有可能结论的地图。

  • 如果研究人员的结果位于地图的中间,说明它是稳健的。
  • 如果研究人员的结果位于地图的极端边缘(“尾部”),这意味着他们很可能只是为了得到那个结果而专门挑选了一条特定的路径。

研究发现: 当他们将此方法应用于人类移民研究时,他们发现 13.5% 的人类报告处于最极端的 5% 结果之中。这表明许多人类的研究发现之所以呈现“极端”状态,并非因为数据本身如此强力,而是因为研究人员(或他们的 AI 助手)选择性地挑选了通往那里的路径。

总结

论文认为,AI 使得从数百万种有效的选项中“择优挑选”(cherry-pick)出看起来最好的科学故事变得既廉价又容易。解决方案不是停止使用 AI,而是先用 AI 绘制出整片森林的地图。在我们信任一项科学主张之前,我们应该问:“这个结果是森林中一条典型的路径,还是有人仅仅挑选了那条能导向其预设结论的路径?” m 值 就是用来衡量这一点的全新标尺。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →