← 最新论文
💬 NLP

Scientific Knowledge Discovery in the Age of Large Language Models

本章综述了 34 项同行评审研究,这些研究探讨了生成式大语言模型如何通过自动化文献检索以及根据入选标准筛选候选研究,来应对学术文献快速增长所带来的挑战,从而提升科学知识发现的能力。

原作者: Eleni Adamidi, Serafeim Chatzopoulos, Thanasis Vergoulis

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Eleni Adamidi, Serafeim Chatzopoulos, Thanasis Vergoulis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,科学的世界就像一座巨大且不断扩张的图书馆。每天都有成千上万本新书(研究论文)被编写并添加到书架上。在过去,一位图书管理员(研究人员)可以走在走廊里,找到他们需要的书,并检查这些书是否足够优秀以供使用。但现在,图书馆增长得太快了,图书管理员快要溺水了。他们无法读完每一本书,也可能会错过最重要的书,或者不小心重复购买了同一本书。这就是“科学知识发现”的问题。为了提供帮助,科学家们正在尝试一种新型工具:大语言模型(LLMs)。不要把它们仅仅看作是只会匹配像“狗”或“猫”这样关键词的简单搜索引擎,而要将它们视为超级聪明的“阅读机器人”,能够理解问题的含义,在眨眼之间浏览数百万页的内容,并告诉你:“嘿,这本书正是你正在寻找的,”或者“不,这一本不符合规则。”

这篇论文就像是一份关于这些“阅读机器人”实际工作表现如何的侦探报告。作者 Eleni Adamidi、Serafeim Chatzopoulos 和 Thanasis Vergoulis 收集了 34 项近期的研究(发表于 2024 年至 2026 年间),以观察这些 AI 工具是如何被用来解决两个特定问题的:文献检索(寻找正确的书)和文献筛选(决定哪些书足够好以值得保留)。他们想知道:这些机器人足够聪明到可以取代疲惫不堪的图书管理员吗?人们正在使用什么样的机器人?以及我们如何知道它们是否真的做得很好?

伟大的图书馆搜寻:寻找正确的书

报告的第一部分探讨了文献检索。这是“搜索”阶段。想象一下,你问图书管理员:“我需要一本关于如何修理损坏的机器人手臂的书。”传统的搜索引擎可能只会抓取所有标题中带有“机器人”和“手臂”字样的书,即使那本书是关于玩具机器人或人类手臂的。新的 AI 工具则试图理解你的意思是用于机器人的机械臂。

论文发现,研究人员正在尝试许多不同的技巧来让这些机器人变得更聪明。有些方法使用 AI 将一个大问题分解成几个较小的、更容易回答的问题(就像侦探将案件拆解一样)。另一些方法使用 AI 构建不同书籍之间的连接图谱,以便它能找到简单搜索会遗漏的隐藏联系。有些系统甚至使用多个 AI 代理(agents)协同工作:一个代理负责规划搜索,另一个负责寻找书籍,第三个负责检查结果是否合理。

然而,报告指出一个棘手的问题:虽然这些 AI 工具非常擅长生成答案,但它们并不总是针对自己能否找到答案进行测试。在许多研究中,研究人员只检查了 AI 写出的最终故事是否精彩,而没有检查 AI 是否从正确的书籍中提取信息来撰写那个故事。这就像是仅凭汤的味道来评判一位厨师,而不去检查他是否使用了正确的食材。论文指出,虽然有一些巧妙的新系统,但我们还没有足够的证据证明它们在实际寻找正确论文方面比旧方法更好。此外,大多数这些“机器人”只是在使用预制的、现成的模型(就像请一位名厨来烹饪),而不是为特定任务训练定制的机器人。

守门人:决定保留什么

报告的第二部分侧重于文献筛选。这是“过滤”阶段。想象一下,你有一堆 1,000 本书,但你只想要那些关于“机器人手臂”且在过去五年内编写的书。人类必须阅读每一本书的标题和摘要,以决定它是否属于其中。这既缓慢又枯燥。

在这里,AI 机器人正被用作守门人。论文发现,研究人员正在测试两种主要方式。第一种方式是“单次尝试”(One-Shot)法:你把书交给机器人,问它“保留还是丢弃?”,然后它给出一个答案。第二种方式是“团队协作”法:你使用一整支机器人团队。一个负责阅读书籍,另一个负责核实事实,如果他们意见不一,第三个机器人将充当法官做出最终裁决。

报告建议,“团队协作”方法看起来更有前景。这就像是拥有一个评审团而不是仅仅一个人;如果一个法官犯了错,其他人可以纠正它。论文还强调,大多数此类测试都发生在医学和生物学领域。为什么?因为在医学领域,对于什么才算作“证据”有严格的规则,并且已经有了大量的过往决策记录(例如哪些研究被纳入了医学综述),研究人员可以使用这些记录来测试他们的机器人是否准确。在历史学或工程学等其他领域,我们还没有这些明确的规则或测试样本,因此很难知道机器人做得是否好。

大局观

那么,最终结论是什么?论文表明,我们正处于使用 AI 管理图书馆的早期且令人兴奋的阶段。机器人正变得越来越擅长理解复杂的问题并进行团队协作。然而,它们目前主要还是在医学界被使用,我们需要更多证据来证明它们实际上比人类找得更准。

作者指出,虽然技术进步神速,但我们也需要保持谨慎。仅仅因为一个机器人能写出一段漂亮的摘要,并不意味着它找到了正确的来源。此外,虽然有些人正在使用功能强大且昂贵的“封闭式”机器人(比如来自大型科技公司的著名模型),但也有人开始使用开源的、可定制的机器人,这些机器人可以在自己的电脑上运行,以节省成本并保护秘密。

简而言之,AI 图书管理员是一个得力的助手,但它还没准备好接管整个图书馆。它需要更多的训练、更好的测试,或许还需要更多的团队协作,才能完全取代那些长期以来一直从事这项艰苦工作的研究人员。未来看起来很光明,但就目前而言,我们仍在观察这些机器人学习阅读的过程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →