← 最新论文
🤖 AI

Measuring Mid-2025 LLM-Assistance on Novice Performance in Biology

该研究通过一项随机对照试验发现,尽管 2025 年中期的语言模型在生物学基准测试中表现强劲,但其在物理实验室中并未显著提升新手完成复杂病毒反向遗传学工作流程的整体成功率,仅显示出 modest 的辅助效益,这凸显了将 AI 生物安全评估从虚拟基准转向现实世界验证的必要性。

原作者: Shen Zhou Hong, Alex Kleinman, Alyssa Mathiowetz, Adam Howes, Julian Cohen, Suveer Ganta, Alex Letizia, Dora Liao, Deepika Pahari, Xavier Roberts-Gaal, Luca Righetti, Joe Torres

发布于 2026-02-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Shen Zhou Hong, Alex Kleinman, Alyssa Mathiowetz, Adam Howes, Julian Cohen, Suveer Ganta, Alex Letizia, Dora Liao, Deepika Pahari, Xavier Roberts-Gaal, Luca Righetti, Joe Torres

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个非常有趣且重要的实验,我们可以把它想象成一场**“生物实验室里的‘作弊’大挑战”**。

🧪 核心故事:新手 vs. 超级助手

想象一下,你被关在一个充满各种瓶瓶罐罐、显微镜和危险化学品的高级生物实验室里(BSL-2 级别)。你的任务是完成一系列高难度的生物实验,比如培养细胞、复制 DNA、甚至制造病毒(当然,是安全的、用于研究的病毒)。

但是,你有一个大麻烦:你几乎是个生物学小白,以前没怎么摸过这些仪器。

现在,研究者把你分成了两组,看看谁能更好地完成任务:

  1. 🔍 “谷歌组” (对照组): 你们可以像普通人一样,用电脑上网查资料、看维基百科、搜 YouTube 视频、看论坛帖子。就像你在家里遇到难题,会去百度或谷歌搜答案一样。
  2. 🤖 "AI 组” (实验组): 你们除了能上网,还拥有一个2025 年最顶尖的“超级大脑” (AI 大模型)。你可以随时问它:“细胞怎么养?”“这个 DNA 片段怎么拼?”“我该怎么办?”它就像个无所不知的私人导师,24 小时待命。

研究者的问题是: 有了这个无所不知的 AI 助手,新手们能不能像专家一样,在实验室里把活干得漂漂亮亮?这是否意味着 AI 会让普通人也能轻易制造出危险的生物武器(这是大家担心的“生物安全”问题)?


🏆 比赛结果:AI 并没有让新手“瞬间变神”

经过 8 周、39 次、每次 4 小时的艰苦奋战,153 位参与者完成了实验。结果有点让人意外,也有点让人安心:

1. 最终通关率:没太大区别

如果把“成功完成所有核心实验”作为通关标准,两组人的通关率都非常低,且没有显著差异。

  • AI 组: 约 5.2% 的人通关。
  • 谷歌组: 约 6.6% 的人通关。
  • 结论: AI 并没有让新手直接变成“生物学家”。在复杂的实际操作中,AI 并没有起到“一键通关”的魔法作用。

2. 过程表现:AI 确实帮了点忙

虽然最终通关的人不多,但 AI 组在过程中表现得更好一些:

  • 细胞培养任务: 这是最考验“手感”和“无菌操作”的活。AI 组的人比谷歌组的人更早成功,而且尝试的次数更少
    • 比喻: 就像学骑自行车,谷歌组的人可能摔了 10 次才学会,AI 组的人摔了 6 次就学会了。AI 给了他们更好的指导,减少了试错成本。
  • 推进速度: AI 组的人更有可能跨过早期的障碍。很多新手在实验一开始就卡住了(比如不知道用什么试剂),AI 帮助他们识别了材料,让他们能继续往下走。
    • 比喻: 谷歌组的人可能在迷宫门口就迷路了,而 AI 组的人虽然还没走到终点,但至少已经穿过了迷宫的前半段。

3. 为什么 AI 没能“封神”?

研究者发现,AI 虽然很聪明,但在物理世界里也有局限性:

  • “只懂理论,不懂手感”: AI 可以告诉你“细胞需要 37 度”,但它无法告诉你“细胞看起来有点发灰,可能是污染了,得赶紧处理”。这种**“只可意会不可言传”的经验(隐性知识)**,AI 很难通过文字教给新手。
  • 新手不会“提问”: 就像你给一个很聪明的朋友打电话求助,如果你问的问题很模糊,他也给不出好答案。很多新手不知道如何向 AI 提出精准的问题,导致 AI 给出的建议有时是错的,或者不够具体。
  • YouTube 更管用: 有趣的是,两组人都觉得YouTube 视频比 AI 更有帮助。因为看视频里的人怎么操作(比如怎么拿移液枪、怎么看细胞状态),比看 AI 写的文字教程要直观得多。

💡 这个实验告诉我们什么?

  1. AI 不是“生物武器制造机”: 目前看来,仅仅给一个生物学新手配上最强的 AI,还不足以让他立刻变成能独立制造病毒的危险分子。物理世界的操作难度、隐性知识的缺失,依然是巨大的门槛。
  2. AI 是“好助手”,但不是“救世主”: AI 能帮新手少犯低级错误,更快上手,但无法替代真正的动手经验和专家指导。
  3. 未来的风险在变化: 虽然现在的 AI 还没法让新手“一键造病毒”,但随着 AI 变得更聪明,以及人类学会更好地使用 AI(比如学会怎么提问),这个差距可能会缩小。所以,我们需要持续监控这种变化。

🌟 一句话总结

这就好比给一个刚学做饭的新手配上了一个世界顶级的大厨 AI 助手。虽然 AI 能告诉他“盐放多少”、“火开多大”,让他比完全瞎琢磨的人做得更好、更快,但要想真正做出一桌满汉全席(完成复杂实验),新手还是缺了那种“厨房里的直觉”和“手上的功夫”。AI 有帮助,但还没到能让人“瞬间成神”的地步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →