SciPaths: Forecasting Pathways to Scientific Discovery
本文介绍了 SciPaths,这是一个用于预测科学发现路径的新基准和任务,它要求模型识别并确立目标科学贡献所必需的促成性贡献和先期工作,结果表明当前语言模型在这一复杂推理能力上存在显著不足。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你正注视着一座宏伟的、已完工的摩天大楼。它就是“目标贡献”——一项新的科学发现。
大多数现有的 AI 工具就像导游,能告诉你:“这座大楼建于 2023 年,”或者“它看起来像隔壁那栋楼。”它们能列出建筑师读过的书籍(参考文献),或猜测建筑师接下来可能会建造什么。
但它们难以回答那个最重要的问题:究竟有哪些具体、不可见的建筑构件,是这座摩天大楼得以矗立所绝对必需的?
本文介绍了SCIPATHS,一种针对上述问题测试 AI 的新方法。它将科学发现视为一份食谱或施工蓝图,而非一份参考文献列表。
核心理念:“逆向食谱”
作者们创建了一个名为SCIPATHS(科学路径)的基准测试。他们提出了一个简单却困难的问题:
“如果你想在今天构建这项特定的科学发现,在开始之前,你的‘储藏室’里必须备有哪些确切的‘食材’和‘工具’?”
他们将这些食材称为“促成性贡献”。
例如,如果这项发现是一种新型自动驾驶汽车,那么“促成性贡献”不仅仅是“汽车”或“计算机”。它们是一些具体的事物,例如:
- 一种特定的教会计算机视觉的方法(一种方法)。
- 一个包含雨天照片的海量数据集(一种资源)。
- 一种处理湿滑路面的特定数学公式(一个概念)。
两部分挑战
该论文对 AI 模型进行了一项两步式的“烹饪挑战”测试:
任务 A(食材清单): 给定最终菜肴(即科学发现),AI 能否列出必需的食材?
- 陷阱: AI 不应仅仅列出“面粉”(一个模糊的概念)。它需要列出“过筛的高筋面粉”(具体的促成性贡献)。
- 结果: AI 模型在这方面表现极差。即使是最聪明的模型,也只能正确识别约**19%**的食材。它们擅长命名“面粉”(例如“一个数据集”),却难以识别真正让菜肴奏效的具体“过筛高筋”部分(核心方法)。
任务 B(寻找源头): 一旦 AI 列出了食材,它能否找到购买这些食材的确切商店?
- 结果: 如果你给 AI 提供正确的食材清单(由人类专家编写的“黄金”清单),它在寻找商店(原始论文)方面的表现会好得多。
- 问题: 如果你让 AI 先自己列出清单(它通常列错),它就完全找不到商店了。这就好比因为 AI 猜食材是“魔法粉尘”,而去寻找售卖“魔法粉尘”的商店,而真正的食材其实是“酵母”。
主要结论
该论文揭示了 AI 理解科学方面存在的一个巨大差距:
- 现有 AI 擅长寻找相关书籍或猜测一般性概念。
- 它所缺乏的 是从成品发明逆向推理至使其成为可能的具体、功能性建筑构件的能力。
可以这样理解:AI 能告诉你汽车需要“轮子”。但它难以解释这辆特定的汽车需要“专为雪地设计的具有特定胎面花纹的橡胶轮胎”,并且这种特定花纹是在三年前的另一篇论文中发明的。
为何这很重要(根据论文所述)
作者们建立了一个包含262 份经专家验证的“蓝图”(以及数千份 AI 生成的蓝图)的庞大图书馆,以证明当前的 AI 模型缺乏这种“依赖推理”技能。
他们发现:
- AI 不擅长处理“核心方法”: 它能轻松找到数据来源(“食材”),但无法识别那些最难发明的特定算法或方法(“烹饪技巧”)。
- 知道搜索什么是关键: 如果你确切地告诉 AI 需要寻找哪个建筑构件,它就能找到那篇论文。但如果它必须猜测要寻找什么,它就会失败。
简而言之,SCIPATHS 是一项测试,旨在观察 AI 能否停止仅仅在科学互联网上“冲浪”,转而真正理解科学突破背后的构建逻辑。目前,AI 仍在学习如何握紧锤子。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。