← 最新论文
🤖 AI

Self-prompting and cross-model consensus enable reproducible data extraction from scientific literature with large language models

本文表明,将自我提示(self-prompting)与跨模型共识(cross-model consensus)与大语言模型相结合,能够在通过实际的分工维持专家监督的同时,实现从科学文献中进行可复现且可扩展的数据提取。

原作者: Valentin Romanov, Monique Bax, Steven Niederer

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Valentin Romanov, Monique Bax, Steven Niederer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

科学依赖于庞大的过去发现的库,但寻找隐藏在这些旧论文中的特定事实是一项缓慢且乏味的工作。想象一下,一位研究人员需要准确了解心肌蛋白在特定条件下的行为。他们必须阅读数十篇文章,其中一些是几十年前写的,寻找像温度、化学浓度和测量方法这样微小的细节。这些细节通常埋藏在密集的文本中,或散落在表格中,漏掉哪怕一个细节都可能导致新研究出现错误。多年来,科学家们一直希望计算机程序能够承担这种繁重的工作,但直到最近,这些工具在处理如此精细的工作时仍然不够可靠。它们经常忽略关键的上下文,或者凭空捏造从未存在过的实事。

由伦敦帝国理工学院和剑桥大学研究人员进行的一项新研究,测试了最新一代的人工智能是否终于能解决这个问题。该团队不仅仅是要求计算机阅读论文;他们将计算机视为一名需要仔细培训和监督的初级研究助理。他们设计了一系列实验,以观察这些程序在提取科学文章中的特定数据方面表现如何,范围从人类给出清晰指令的简单任务,到复杂的、需要计算机自行寻找文章的任务。其目标是绘制出这些机器在何处取得成功,以及在何处仍需要人类之手来引导。

研究人员从一个直接的挑战开始:计算机能否从18篇不同的科学论文中提取出关于钙如何与心肌蛋白结合的精确数字?他们向七个最先进的计算机程序提供了一套详细的、由专家编写的指令,并要求它们为每项实验寻找七个特定的信息,例如使用的动物类型、温度和化学数值。结果令人惊讶地强劲。表现最好的程序在超过95%的情况下都能得到正确的数字。事实上,当计算机被要求仅寻找原始数字时,其正确率接近100%。然而,当被要求理解数字背后的故事时,机器却遇到了困难。它们经常无法准确识别正在测试的是哪种版本的蛋白质,或者是在何种特定条件下进行的测量。这表明,虽然计算机非常擅长寻找数字,但它们仍在学习如何理解使这些数字具有意义的科学语境。

为了看看计算机在没有人类编写指令的情况下是否能做得更好,研究人员让程序编写自己的指南。他们要求每台计算机搜索提问的最佳方式,然后为该任务创建一份主指令表。计算机确实成功创建了有用的指南,但使用这些自写指令所提取的数据比遵循人类专家的原始计划时略逊一筹。对于顶尖程序来说,这一差距很小,但对于其他程序来说则变得更大。这表明,虽然计算机可以学会提出好问题,但人类专家仍然最清楚如何界定科学问题的具体细微差别。

随后,团队进一步推动了计算机,要求它们扮演自主研究者的角色。在这种情景下,程序必须自行寻找相关的科学论文,阅读它们,并在没有任何人类帮助指引方向的情况下提取数据。这就是系统撞墙的地方。即使是最先进的程序也漏掉了超过一半本应找到的正确论文。其中一些程序甚至虚构了并不存在的论文引用,即所谓的“幻觉”问题,而另一些则干脆无法定位到正确的来源。研究发现,当计算机必须自行搜索信息时,它的可靠性会大幅下降。这就像要求一名学生写报告但不给他们图书馆卡一样;他们可能会猜对书名,但也同样容易编造书名。

研究的最后一部分探讨了如何使这一过程在现实世界中运作。研究人员测试了一种方法,即使用多台计算机相互检查彼此的工作。他们发现,如果一台计算机犯了错,另一台往往能发现。通过将同一任务运行五次并取最常见的答案,团队可以显著提高准确性。他们还发现,让不同的计算机处理同一个问题,比让一台计算机重复执行五次任务效果更好。这种方法创造了一个安全网,让计算机可以标记出困难案例供人类审查。研究结论指出,使用这些工具的最佳方式不是取代人类科学家,而是建立一种伙伴关系。在这种新的工作流中,计算机处理寻找和提取数据的重复性工作,而人类专家则介入以验证棘手部分并解决机器之间的分歧。这种分工让科学家能够在不失去人类特有的谨慎判断力的前提下,快速处理大量的文献。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →