Historical Backtesting for Scientific Question Discovery: A Protocol and Astronomy Pilot
本文介绍了一种模型无关的“历史回测”协议,该协议通过将问题固定在历史语料库上,并针对时间隔离的未来语料库对其进行客观评分,从而评估科学问题生成器,证明了“证据结构优先”的生成方式优于仅使用大语言模型提示的方法,同时揭示了人类标注者在结果分类法上的分歧甚至比人工智能评判者还要严重。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
科学始终由问题所驱动。研究人员观察世界,发现一些令人困惑的事物,然后追问:“如果……会怎样?”或者“为什么?”几十年来,人工智能一直被教导去阅读大量的科学论文并对其进行总结。现在,新一代的人工智能正被要求去做更难的事情:观察同样的文献库,并发明出人类应该提出的下一个重大问题。但我们如何知道一个人工智能是否真的擅长此道?如果一台计算机提出了一个新的研究方向,那是一个天才的洞察,还仅仅是一个幸运的猜测?直到现在,评判这些系统的唯一方法是询问人类专家的意见,或者让其他计算机来对这些想法进行评分。这两种方法都是主观的。它们依赖于人们在当下认为什么听起来“有趣”,而不是这些想法是否真的能引导出新的发现。
这种不确定性至关重要,因为科学界正在投入大量的时间和金利来追踪这些由人工智能生成的线索。如果问题很糟糕,这项投资就会被浪费;如果问题很精彩,它们可能会加速我们对宇宙的理解。核心挑战在于,我们无法在未来到来且科学界给出答案之前,预知一个科学问题的价值。今天提出的一个问题可能被忽视十年,也可能在下个月就被解决。由于缺乏预见未来的方法,我们无法判断人工智能是真的具有预见性,还是仅仅在模仿近期论文的风格。
一组独立的研究人员提出了一种解决该问题的方法,即通过“倒转时钟”来解决。他们不是试图预测未来,而是建立了一个测试过去的方法。他们称之为“历史回测”(historical backtesting)。这个想法简单而强大:获取截至过去某一特定日期的所有可用科学知识的快照。只给人工智能系统提供那些旧知识,并要求它生成新的研究问题。然后,将这些问题“冻结”,使其无法被更改。最后,观察在该日期之后发表的科学论文——即人工智能从未见过的论文——来看看实际发生了什么。科学界回答了这个问题吗?他们忽略了它吗?他们是否独立地提出了同样的问题?或者他们证明了该问题的初始假设是错误的?通过将人工智能生成的“冻结问题”与随后发生的真实历史进行对比,研究人员创造了一种利用硬性数据而非主观意见来衡量科学问题质量的方法。
为了测试这种方法,研究人员将重点放在了系外行星大气研究上,这是一个快速发展的领域,科学家们通过分析来自遥远世界的微光来确定其包含哪些气体。他们设定了一个截止日期为2020年12月31日。他们收集了该日期之前发表的所有相关论文,并将它们输入到一个旨在寻找现有数据中张力与矛盾的系统中。该系统并不依赖标准的语言模型来“凭空构思”想法,而是寻找证据中特定的结构性冲突,并据此生成了十个冻结问题。研究人员随后检查了2021年至2026年间发表的文献。结果令人震惊。该系统生成的十个问题中的每一个,都在随后的几年中得到了科学界的关注。其中两个被完全解答,七个被部分处理,还有一个是由该领域的科学家独立提出但仍悬而未决的。最显著的是,其中一个问题挑战了关于特定行星(HD 209458 b)含水量的一个广泛接受的结论。随后,科学界进行了该问题所要求的精确测试,并证明了原有的结论是错误的,显示出低含水量量是测量方法的产物,而非行星本身的特征。
研究人员并未止步于此。他们意识到,仅凭十个问题的少量样本可能无法说明完整情况,因此他们扩大了测试范围,纳入了数百个由不同方法生成的问题。他们将这种基于证据的系统与其他方法进行了比较,包括一个仅仅阅读旧论文并尝试撰写新问题的标准人工智能,以及一个仅仅挑选过去最著名的结果并询问其是否仍然成立的系统。当他们查看这组424个问题的大样本时,他们发现标准人工智能非常擅长提出吸引注意力的宏大且时髦的问题。然而,它很少能导致明确的答案或对旧观念的反驳。它的问题就像一张大网,虽然捕捉到了很多东西,却抓不住任何具体的东西。相比之下,那个寻找证据中结构性冲突的系统,在引导产生具体答案或推翻既定信念方面表现得要好得多。
他们工作的一个关键部分是测试人工智能是否仅仅是在“回忆”其训练数据中的答案。由于现代人工智能模型是在海量文本(包括2020年截止日期之后发表的论文)上进行训练的,因此存在一种担忧,即它们只是在回忆未来,而不是在预测未来。研究人员设计了一个压力测试,以区分真正的预见性与记忆力。他们在不同的时间段运行相同的系统,其中包括一个“未来”发生在AI训练之后的时期。他们发现,只有当未来与其训练数据接近时,标准人工智能的表现才会良好,这表明它是在依赖记忆。但基于证据的系统即使在AI不可能知晓答案的时间段内,依然能找到有价值且具体的问题。这证明了寻找好问题的能力来自于证据本身的结构,而非人工智能对未来的记忆。
这项研究还揭示了目前评估这些系统时的一个惊人缺陷。研究人员尝试使用人类专家和不同的AI模型来对这些问题进行评分。他们发现,人类专家之间经常存在分歧,而不同的AI模型之间的一致性则比它们与人类之间的一致性要高得多。这表明,我们判断这些问题的方式——依赖单一的AI或一小组人类——是不可靠的。研究人员得出结论,在我们能够信任任何评判者(无论是人类还是机器)进行评分之前,我们需要对如何定义一个“好”问题有更清晰、更一致的定义。
最终,这项工作为衡量科学思想的价值提供了一种新方法。它使该领域从关于“听起来有趣”的主观意见,转向向一种可衡量的、关于“实际发生了什么”的记录。研究人员已经公开了他们的数据、代码和冻结的问题,允许任何人进行同样的测试。他们还建立了一个新的实验,即今天生成的问题将被冻结,并根据未来四年的科学文献进行评分。这种前瞻性的测试将提供一个无污染的度量,用以衡量人工智能是否真的能帮助科学家预见未来。研究结果表明,虽然人工智能在措辞和总结方面表现出色,但发现新科学问题的真正力量在于系统地搜索证据中的矛盾与空白,这需要一种结构化的方法,而非仅仅依靠强大的语言模型。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。