← 最新论文
🤖 AI

A robust association between LLM use and scientific productivity: Assessing stopping-time selection

本文通过多种稳健的设计证明,观察到的关联依然显著,且无法由所识别出的人工制品来解释,从而反驳了停止时间选择偏差会使“大语言模型使用与科学生产力之间存在正向联系”这一发现失效的说法。

原作者: Keigo Kusumegi, Xinyu Yang, Paul Ginsparg, Mathijs de Vaan, Toby Stuart, Yian Yin

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Keigo Kusumegi, Xinyu Yang, Paul Ginsparg, Mathijs de Vaan, Toby Stuart, Yian Yin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

伟大的论文计数谜题

想象一下,科学世界就像一座巨大且繁忙的图书馆,研究人员在那里不断撰写新的书籍。几十年来,衡量一名研究人员成功与否的方法很简单:计算他们写了多少本书。但最近,一个新工具登场了:大语言模型(LLMs)。你可以把它们想象成超级聪明的数字副驾驶,可以帮助作者起草文本、构思创意并润色句子。现在大家都在问一个大问题:这些数字副驾驶究竟是帮助科学家写出了更多的书,还是仅仅是一个华丽的干扰项?

为了回答这个问题,研究人员必须玩一场棘手的“找不同”游戏。他们需要弄清楚科学家究竟是从何时开始使用 AI 的,然后计算他们在那个时刻前后的产出。然而,在这个游戏中隐藏着一个狡猾的陷é——“停止时间选择”(stopping-time selection)。想象一下,你正在测量一名跑步者在喝了某种特殊的能量饮料后速度提升了多少。如果你决定在跑步者跨过第一场比赛终点线的那一瞬间按下秒表,你就制造了一个奇怪的问题。在那一刻之前的那场比赛可能是一个表现糟糕、速度缓慢的日子,这会让跑步者在喝完饮料后看起来立刻变成了超级英雄。在科学论文的世界里,如果一名研究人员的第一篇 AI 辅助论文被检测器标记出来,那么该标记前的一个月可能会因为统计上的偶然性而显得异常缓慢。这可能会误导我们,让我们以为是 AI 导致了产量的激增,而实际上那只是一个统计上的巧合。

侦探工作:这种爆发是真实的还是幻觉?

这篇论文是对一群批评者(我们称之为“怀疑论者”)的回应。这些“怀疑论者”指出,原研究中发现的——即 AI 让科学家变得更高效——可能只是由那个“标记前的糟糕月份”造成的错觉。他们认为,如果你观察随机的、毫无意义的标记,你会看到同样的虚假“爆发”模式,从而证明 AI 其实并没有起到任何特殊作用。

这篇论文的作者们是一群数据侦探,他们决定对这一说法进行测试。他们没有仅仅进行辩解,而是运行了一系列巧妙的实验,以观察当他们消除了“时间陷阱”时,“AI 爆发”是否依然存在。

首先,他们修复了“假标记”测试。
怀疑论者曾使用随机标记来展示这种模式,但作者意识到那些随机标记太弱了。这就像试图通过对比自行车来测试一台新引擎一样,这种比较是不公平的。作者重新校准了测试,使随机标记触发的频率与真实的 AI 检测器完全一致。即使在这样的“公平竞争”下,真实的 AI 检测器所显示的生产力提升也远高于随机标记。怀疑论者预测的“虚假爆发”确实存在,但它微乎其微——就像一个小小的涟漪——而真实的 AI 效应则是一波巨大的浪潮。

其次,他们尝试了四种不同的不带陷阱的测量方法。
为了绝对确保万无一失,作者设计了四个新的实验,使得“标记前的糟糕月份”无法干扰结果:

  1. “时空旅行者”测试: 他们不再进行月度对比,而是观察 AI 使用前的一整年与使用后的一整年。这跳过了那个奇怪的“第一个月”。结果显示,使用 AI 的科学家仍然比之前多产出了约 17.3%(在较低的置信水平下)和 25.1%(在更严格的置信水平下)的工作量。
  2. “未来用户”对照组: 他们不仅将当前的 AI 使用者与从不使用 AI 的人进行比较,还将其与那些将来会使用 AI 的人进行比较。这创造了一个更公平的基准。即使在这种保守的设置下,AI 使用者仍显示出正向的提升,比对照组高出 0.05 到 0.13 个对数点
  3. “强度”检查: 他们没有选择一个特定的开始日期,而是观察了一名科学家在一个季度内使用了多少 AI。他们发现,在之前的三个月里,一位科学家使用的 AI 越多,他在当前月份写出的东西就越多。当他们在 AI 出现之前的时期运行相同的测试时,这一模式消失了。
  4. “顶端 vs 底端”竞赛: 他们将 AI 使用强度最高的论文与 AI 使用强度最低的论文进行比较,同时保持被标记论文的总数不变。AI 强度高的论文始终优于随机概率基准,而低 AI 强度的论文表现则较差。

结论
论文得出结论:怀疑论者识别出的“停止时间”缺陷确实存在,但它太小了,不足以解释生产力的巨大飞跃。这就像是在汽车上发现了一个小划痕,虽然它能解释一个凹痕,但凹痕本身其实是由一次更大的撞击造成的。当作者移除了这个时间技巧时,AI 与科学产出之间的正向联系并没有消失;它依然强劲。

然而,作者也谨慎地表示,他们并未声称已经“解决”了关于这背后的原因(即 为什么 会发生这种情况)或 AI 是唯一原因的谜团。他们承认,选择使用 AI 的科学家本身可能在其他方面就与众不同。但他们已经成功证明了“AI 爆发”并非仅仅是由糟糕的时机导致的统计幻觉。这种关联是真实的,方向是正向的,并且其效应足够强大,能够经受住最严苛的审查。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →