← 最新论文
💬 NLP

Mitigating LLM-based p-Hacking by Preregistering for the Next LLM

本文提出并实证验证了一种通过预先登记分析计划,并在登记后发布的第一个符合条件的模型上执行验证性测试,从而减轻基于大语言模型研究中 p-hacking 现象的方案,以此防止研究人员对特定模型行为进行过拟合。

原作者: Maria Thomas, Kristina Gligoric, Nihar B. Shah

发布于 2026-06-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Maria Thomas, Kristina Gligoric, Nihar B. Shah

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

问题所在:“用 AI 篡改数据”

想象一下,一位科学家想要证明一种新的减肥药有效。他们没有进行严格、枯燥的实验,而是使用了一个超级聪明的 AI(大语言模型,简称 LLM)来阅读人们的饮食日记,并判断他们的进食量是否减少了。

问题在于,这些 AI 就像是非常柔软的黏土。如果科学家不喜欢 AI 给出的答案,他们只需稍微挤压一下这块“黏土”即可:

  • 稍微改变问题的措辞(例如:“问他们是否吃得更少了”,而不是“问他们是否吃得更多了”)。
  • 微调 AI 的“情绪”(一个被称为“温度/temperature”的设置)。
  • 改变 AI 被允许回答的方式。

他们不断地调整这些设置,直到 AI 终于说出:“是的,这种减肥药有效!”这就是所谓的 p-hacking(p 值操纵)。这就像一个学生在考试时,通过擦掉答案并重试,直到拿到 A 为止。结果看起来很真实,但实际上只是通过操纵问题制造出来的假象,而非真正的发现。

解决方案:“锁定盒子”协议

作者提出了一项新规则来阻止这种作弊行为。他们称之为**“为下一个 LLM 进行预注册”**。

以下是其运作方式,我们使用**“时空旅行彩票”**来做类比:

  1. 练习阶段: 研究人员在当前的 AI 模型上进行尝试,以确定他们的实验方案。他们决定了要问哪些具体问题以及如何分析答案。
  2. 锁定盒子(预注册): 在看到结果之前,他们写下整个计划并将其放入一个时间锁定的盒子中。他们还列出了一份“合格模型清单”(例如:“任何在今天之后发布的来自 Google、OpenAI 或 Anthropic 的新 AI”)。
  3. 等待期: 他们开始等待。他们不能再对实验进行任何改动。他们必须等待一个符合其清单要求的全新的 AI 模型发布。
  4. 揭晓时刻: 一旦那个新的 AI 到达,研究人员打开盒子,并在这台新机器上运行他们完全一致的计划。

为什么这能阻止作弊?
因为这个新的 AI 在他们写下计划时还不存在。研究人员不可能为一台尚未诞生的机器去“篡改数据”。

此外,论文发现 AI 模型就像不同的人。让“甲”说“是”的套路,在问到“乙”同一个问题时往往会失效。如果研究人员欺骗了旧的 AI,新的 AI 通常能识破它,并给出一个平淡且诚实的答案。

研究人员做了什么(证据)

为了证明这套方法有效,研究人员实际遵循了自己的规则。他们设置了两个他们已知结果为“没有任何变化”(无效结果)的虚假实验:

  1. 虚假 AI 评论: 他们要求 AI 判断科学评论是由人类还是 AI 撰写的。(他们已知所有评论都是人类写的,因此任何判定为“AI”的结论都是谎言)。
  2. 虚假饮食日志: 他们要求 AI 判断人们在第二天是否比第一天摄入了更少的卡路里。(他们已知这两天是随机生成的,所以答案应该是 50/50)。

他们尝试了 11 种不同的方法来在旧模型上“欺骗”AI。

  • 结果: 在旧模型上,这些套路经常奏效。
  • 测试: 他们进行了预注册,并在他们锁定盒子后发布的第一个新模型上运行了计划。
  • 结局: 这些套路在约 73% 的案例中失败了。新的 AI 拒绝配合旧有的套路。

“压力测试”

研究人员还问道:“如果作弊者试图智斗这个系统怎么办?”

  • 如果他们选择了最好的套路呢? 即使研究人员选择了在旧模型上表现最好的那一个套路,它在大多数情况下在面对新模型时依然失效了。
  • 如果他们只使用一家公司的 AI 呢? 即使他们只押注于 OpenAI 或只押注于 Google,来自同一家公司的模型通常也会打破这个套路。
  • 这会阻碍真正的发现吗? 不会。如果存在真实的效应(比如减肥药确实有效),新的 AI 仍然能发现它。该系统拦截的是虚假的套路,而不会阻挡真实的真相。

代价

唯一的缺点是耐心。你必须等待下一个 AI 模型发布。在他们的研究中,这种等待平均约为 10 天

核心结论

论文认为,为了让 AI 研究值得信赖,科学家不应仅仅运行一次实验。他们应该写下计划,将其锁起来,并在一个未来的 AI(尚未发布的 AI)上运行。因为新的 AI 是旧套路的陌生人,它充当了天然的“测谎仪”,过滤掉虚假的结果,只留下真实的发现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →