Contemporary AI lacks the imagination to diverge or negate in science
这项迄今为止规模最大的“人机协同”评估研究表明,尽管人工智能能够生成科学构想,但它目前仍缺乏进行发散性思考或提出虚无假设的想象力,往往默认陷入一种由常规思想构成的狭隘“蜂群思维”,并且需要人类的引导来克服其在创新性、上下文感知能力以及判断力方面相较于专家科学家所存在的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大局观:对 AI 科学家的现实检验
想象一下,我们向一个超级聪明的机器人求助,希望它能帮我们解开科学界最难的谜团。我们希望它能提出人类尚未想到的、精彩绝伦且全新的想法。这篇论文就像是一个大规模的、现实世界的“压力测试”,旨在测试这个机器人是否真的准备好胜任这项工作了。
研究人员不仅仅是让 AI 写个故事,而是要求它扮演一名科学家。他们接管了 12 万篇真实的科学论文(涵盖生物学、医学、化学和社会科学),并要求 AI 观察每篇论文中的“谜题”,并建议下一步该怎么做。然后,他们将这些 AI 的建议发回给这些论文的实际作者,看看他们的看法如何。
以下是他们的发现,分为三个主要故事。
1. “蜂群思维” vs. “漫游者”
发现: 大多数 AI 模型(即“非推理型”模型)表现得像一个巨大的、目标单一的蜂群。如果你要求十个这样的模型去解决同一个谜题,它们提出的想法几乎完全一样。它们彼此之间非常相似,也与人类已经表达过的观点非常相似。它们并没有真正进行“跳出框架”的思考;它们只是在盒子内部重新排列家具。
类比: 想象你要求十个学生写一个关于丢失小狗的故事。
- 非推理型 AI: 这十个学生写的都是同样的故事:“小狗去了公园,找到了一根骨头,然后回家了。”他们都在抄袭同一部热门电影的剧情。
- 推理型 AI: 这些模型表现得稍好一些。它们会在公园里多转悠一会儿。也许一个建议小狗去了海滩,另一个建议它去了面包店。它们具有更多的多样性。
缺失的一环: 即便是那些“漫游者”(推理型模型)也有一个盲点。它们几乎从不提出**“什么也没发生”**这种想法。
- 类比: 如果科学家问:“吃蓝莓会让跑步变快吗?”AI 会建议:“是的,蓝莓能提供超强速度!”或者“也许它们有助于补水。”
- 人类的行为: 一个人类科学家可能会说:“事实上,也许蓝莓对跑步速度没有任何影响。”
- AI 的失败: AI 很少提出“虚无假设”(即认为两者之间没有联系的观点)。这就像一位厨师只知道如何添加食材,却忘记了如何说:“这道菜不需要添加任何东西。”论文指出,这是因为 AI 的训练数据大多是报告“成功案例”(正面结果)的书籍,而“失败”(虚无结果)往往被藏在科学界的“抽屉”里,不为人所见。
2. 科学家的“回声壁效应”
发现: 当真正的科学家评审 AI 的想法时,他们并没有表现得像客观的评判者。他们表现得更像是自己作品的粉丝。
- “像我”偏见: 科学家们非常喜欢那些听起来和他们之前的研究成果高度一致的 AI 想法。他们认为这些想法更“可行”且“更有可能为真”。但讽刺的是,他们同时也认为这些想法的“新颖性”较低(即不够新颖)。
- “资历”偏见: 年长、成名的科学家(“资深”研究人员)是更严厉的批评者。他们不太愿意采纳 AI 的想法,尤其是在社会科学领域。
- “领域”偏见: 医学领域的科学家对 AI 最为开放。社会科学领域的科学家则最为怀疑。为什么?因为社会科学是复杂的,它高度依赖于语境(如文化和历史)。AI 通过学习数据中的模式来运作,它难以理解这些不断变化的、复杂的社会语境。它试图模仿“平均”观点,但在社会科学中,往往并不存在可以模仿的“平均”观点。
类比: 想象一群建筑师在评审一个新的设计方案。
- 如果 AI 建议建造一座看起来和建筑师之前设计的摩天大楼一模一样的建筑,建筑师会说:“太棒了!这很安全,也完全可行!”(但同时也会觉得:“很无聊,我以前见过这种设计”)。
- 如果 AI 提出了一个疯狂的新设计,建筑师会说:“这太冒险了。”
- 年长、成名的建筑师是最严格的批评家。他们就像是行业里的“泰斗级人物”,见多识广,因此对新奇的小玩意儿持怀疑态度。
3. 破碎的计分卡
发现: 目前的科学界正在使用其他 AI 工具来自动评分科学构想(以节省时间)。这篇论文测试了这些工具,发现它们的工作表现非常糟糕。
- 问题所在: 这些自动化评委给出的分数大多是“C-”等级。它们不敢给出高分或低分,而是将所有分数都聚集在中间水平。它们无法分辨出一个想法是天才之作还是平庸之作。
- 解决方案: 研究人员构建了一个新的、定制化的“奖励模型”(一种专门的 AI 评委),该模型是专门针对人类科学家真正喜欢的点进行训练的。这个新模型学会了不同科学领域的微妙“品味”。它在预测人类想法方面做得更好,缩小了机器人评委与人类评委之间的差距。
类比: 想象一场音乐比赛,评委都是机器人。
- 旧机器人评委: 它们听了一首摇滚乐、一首爵士乐和一首乡村音乐,然后都给了 5.5 分(满分 10 分)。它们无法分辨其中的区别。
- 新定制评委: 研究人员通过展示成千上万个人类乐评人喜爱的例子,教会了一个新的机器人。现在,这个新机器人可以分辨出:“啊,这首爵士乐有一个人类喜欢的巧妙转折,”并给出了 9 分。它终于理解了那种“氛围”。
总结
论文的结论是:今天的 AI 是一个得力的助手,但不是一个创造性的伙伴。
- 它擅长的地方: 它可以阅读大量的书籍,总结它们,并根据已有的文字内容建议逻辑上的下一步。它扩展了寻找想法的范围。
- 它缺乏的地方: 它缺乏想象力和否定能力。它不知道如何说“如果这是错的怎么办?”或者“如果什么也没发生怎么办?”它缺乏好奇心。它是在预测“已经被说过的话”,而不是在探究“接下来可以学到什么”。
最终的比喻:
把 AI 想象成一位非常快速、博学多才的图书管理员。
- 如果你问:“关于猫已经写了哪些书?”这位图书管理员可以瞬间给你列出所有关于猫的书籍。
- 但如果你问:“猫不是什么?”或者“如果猫会飞怎么办?”这位图书管理员就会感到困惑。图书管理员只知道书架上现有的书。他们不知道那些从未被写出来的书,也不知道那些尝试过但失败了的想法。
为了让科学真正进步,人类仍然需要扮演那个提出怪异问题、想象不可能之事、并决定什么才是重要事物的人。AI 可以帮助整理图书馆,但它无法独自谱写人类知识的下一个伟大篇章。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。