← 最新论文
💻 computer science

Preregistration for Experiments with AI Agents

本文主张在涉及人工智能智能体的实验中强制采用预注册实践,以减轻方法论上的脆弱性并增强可信度,同时提供了一个定制化的模板,以应对诸如模型选择和提示词工程等独特的科研自由度问题。

原作者: Michelle Vaccaro

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Michelle Vaccaro

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位试图证明自己的新食谱做出了“完美”汤品的厨师。

在过去,制作这种汤既昂贵又缓慢。你必须购买新鲜食材,花费数小时切菜,并使用一个大锅。因为这耗费了大量的成本和时间,你可能只会做一两次这种汤。如果味道不好,你可能会稍微调整一下食谱,但你不会为了杂志上的文章而做出 50 个不同的版本来寻找那个所谓的“完美”味道。

新的问题: “无限汤品”厨房

现在,假设你有一个机器人厨师(AI 智能体),它可以在几秒钟内做出汤,成本仅为一分钱。你一小时可以做出 1,000 碗汤。你可以为每一碗汤改变盐量、香料、温度以及使用的锅具类型。

论文指出,正因为这变得如此廉价且容易,研究人员正在做一件危险的事情:他们正在制作成千上万碗汤,品尝其中的每一碗,然后只向世界展示那一碗味道完美的汤。他们可能会说:“看!这个食谱在科学上被证明是最棒的!”但他们并没有告诉你,他们还扔掉了另外 999 碗难喝的汤。

这就是所谓的 “规格搜索”(Specification Search)。这就像是在一个池塘里用一百万个鱼钩钓鱼。如果你不断尝试直到钓到一条鱼,你就不能声称你是“运气好”或者这条鱼很容易钓到。你只是不断尝试,直到得到了你想要的东西。

解决方案:“锁定食谱”(预注册)

为了解决这个问题,论文提出了一个简单的规则,叫做 “预注册”(Preregistration)

你可以这样理解:在打开炉火之前,你必须把你的食谱写在一张纸上,把它装进信封,交给公证人。你必须准确地写下:

  • 你将使用哪位机器人厨师。
  • 你将告诉机器人的确切词句(即“提示词”)。
  • 你会使用多少盐和热量。
  • 你认为什么是“好”的汤。

一旦信封封好,你就不能更改食谱。你进行烹饪,品尝汤的味道,然后报告结果。如果汤变得又咸又难喝,你也必须如实报告。你不能因为第一碗失败了,就偷偷把盐换成糖。

为什么这对 AI 至关重要

论文解释说,AI 实验目前正处于一个“西部荒野”阶段。因为运行这些实验非常便宜,研究人员在无意中(或有时是有意地)不断微调他们的设置,直到得到一个看起来令人兴奋的结果。

  • “分叉路径的花园”: 想象一个拥有数百万条路径的花园。研究人员走下一条路径,看到了一朵花,于是决定报道这朵花。但他们没有告诉你,他们其实还走了另外 50 条没有花的路径。预注册迫使他们说:“我在开始走路之前,就选择了这条路径。”
  • 作弊的成本: 在人类研究中,由于采访成本高昂,作弊很难。在 AI 研究中,由于成本极低,作弊很容易。预注册通过强制要求你在早期就提交计划,从而重新引入了“摩擦力”(难度)。

论文提出的方案

作者创建了一个特殊的清单(模板),供科学家在开始 AI 实验前填写。该清单要求他们锁定:

  1. 机器人: 他们使用的确切 AI 模型及其版本。
  2. 指令: 他们将输入的精确词句。
  3. 规则: 如果 AI 拒绝回答或给出奇怪的响应,他们将如何处理。
  4. 历史记录: 如果他们在之前尝试过不同的指令,他们必须承认这一点。

核心结论

这篇论文并不是在说“停止做 AI 实验”。它的意思是:“让我们确保我们能信任研究结果。”

通过迫使研究人员在开始“烹饪”之前就锁定他们的计划,我们可以分辨出哪些是真正的发现,哪些仅仅是尝试了一百万次后的幸运猜测。目标是在 AI 研究变得庞大到无法修复之前,建立起一种信任的声誉。

简而言之:不要让机器人厨师做出 1,000 碗汤,然后只端出那一碗看起来不错的。要让他们先写下食谱,只做一次,并呈现出来的任何结果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →